Verwendung der LLM-API

Cache-Kosten

Metrisch Ohne Cache Mit Cache

Wie semantisches Caching funktioniert

Jede eingehende Anfrage wird in einen Einbettungsvektor umgewandelt. Der Cache prüft, ob ein ähnlicher Vektor existiert (Kosinusähnlichkeit ≥ Schwellenwert, typischerweise 0,92–0,97). Wenn ja, wird die gespeicherte Antwort sofort zurückgegeben – es werden keine LLM-Tokens verbraucht. Wenn nein, geht die Abfrage an das LLM und das Ergebnis wird für zukünftige Treffer gespeichert.

Woher kommt die Trefferquote: Wiederkehrende Anfragen (FAQ-Bots, Kundensupport) sehen 30–60 %. Diverse offene Anfragen (Codierungsassistenten, kreatives Schreiben) finden sich bei 5–15 %. Sie können die Trefferquote erhöhen, indem Sie den Ähnlichkeitsschwellenwert senken. Dadurch besteht jedoch die Gefahr, dass leicht falsche Antworten im Cache bereitgestellt werden.

Einbettungskosten: Jede Abfrage (Hit oder Miss) kostet eine Einbettungssuche. Bei 0,02 $/1 Mio. Token kostet die Einbettung einer 300-Token-Abfrage 0,000006 $ – vernachlässigbar, es sei denn, Sie haben Millionen von Abfragen pro Tag.

Siehe auch: Sofortige Caching-Einsparungen · RAG-Kostenrechner · Vektor-DB-Kosten

Häufig gestellte Fragen

Was ist ein semantischer Cache für LLMs?

Ein semantischer Cache speichert frühere LLM-Antworten und nutzt die Einbettungsähnlichkeit, um semantisch ähnliche Abfragen zu erkennen. Wenn die Ähnlichkeit über dem Schwellenwert liegt, wird die zwischengespeicherte Antwort ohne Aufruf des LLM zurückgegeben, wodurch die gesamten Tokenkosten für diese Abfrage eingespart werden.

Welche Cache-Trefferquote ist realistisch?

Kundensupport-Bots mit sich wiederholenden Fragen erzielen oft eine Trefferquote von 30–60 %. Offene Chatbots oder Codierungsassistenten können 5–15 % sehen. Ein guter Ähnlichkeitsschwellenwert (0,92–0,97 Kosinus) gleicht die Trefferquote gegen Qualitätsverlust aus.

Wie hoch ist die Break-Even-Trefferquote?

Break-Even = Cache-Kosten ÷ (Abfragen/Monat × Token × LLM-Preis/Token). Wenn Ihr LLM 0,003 $/Abfrage kostet und der Cache 50 $/Monat bei 100.000 Abfragen/Monat kostet, benötigen Sie nur 1,7 % Trefferquote, um die Gewinnschwelle zu erreichen.

Wie unterscheidet sich semantisches Caching vom prompten Caching?

Prompt-Caching (Anthropic cache_control, OpenAI automatisches Caching) verwendet die KV-Berechnung für identische Token-Präfixe wieder. Semantisches Caching erfolgt auf Anwendungsebene – es stellt vollständig zwischengespeicherte Antworten bereit, wenn Abfragen semantisch ähnlich sind. Sie ergänzen sich.

Welche Tools bieten semantisches Caching für LLMs?

Beliebte Optionen: GPTCache (Open Source), Momento Vector Index (verwaltet), Zep (Speicherebene), LangChain CacheBackedEmbeddings, Redis mit Vektorsuche. Verwaltete Optionen kosten 10–200 $/Monat; Selbst gehostetes Redis kostet auf einer kleinen VM 5 bis 30 US-Dollar pro Monat.