volles Gespräch
Letzte Runde alleine
vs. Pauschalkosten
mit Fenster/Cache

Die Kosten steigen mit der Anzahl der Runden

Mit zunehmender Historie steigt der Aufwand pro Runde weiter an, sodass die Kurve der kumulierten Kosten nach oben verläuft – eine Verdoppelung der Runden verdoppelt die Rechnung mehr als.

An der ReiheDieser Zug kostetKumulativ

Sie zahlen bei jeder Runde für die Geschichte

Ein Sprachmodell ist zustandslos: Es merkt sich nichts zwischen API-Aufrufen. Um also eine Konversation fortzusetzen, sendet Ihre Anwendung das gesamte Transkript – Systemeingabeaufforderung, jede frühere Benutzernachricht und jede frühere Antwort – als Eingabe für jede neue Anfrage erneut. Das bedeutet, dass der Input mit jedem Austausch zunimmt und die Kosten für das gesamte Gespräch ungefähr im Quadrat mit der Anzahl der Gesprächsrunden steigen, nicht linear. Die letzte Runde eines langen Chats ist die teuerste, da sie die meiste Historie enthält und die feste Systemansage einmal pro Runde zusätzlich in Rechnung gestellt wird. Drei Hebel bringen es wieder nach unten: a Schiebefenster das nur die letzten Runden behält (Kosten werden linear, auf Kosten des Speichers), sofortiges Caching Dadurch wird das wiederholte Präfix mit einem erheblichen Rabatt abgerechnet, und die Zusammenfassung des Alten ergibt eine kurze Zusammenfassung. Vergleichen Sie ein einzelnes Fenster auf dem Kostenrechner für Kontextfenster, Größe des Caching-Gewinns auf der Rechner für schnelle Caching-Einsparungen, und kostet einen vollwertigen Assistenten Chatbot-Kostenrechner.

Hosten Sie Ihr Projekt:DigitalOcean – 200 $ kostenlos ↗Hostinger VPS
Rechner für bereitgestellten Durchsatz (PTU).AI Gateway Markup-RechnerPreisrechner für Sitzplatz vs. NutzungKostenkalkulator für KI-AppsAI Wrapper-Preise