So funktioniert dieser Rechner
Der Prompt-Rechner für Komprimierungseinsparungen Schätzt, wie viel Sie an API-Eingabekosten sparen, wenn Sie eine wiederholte Eingabeaufforderung verkleinern. Sie geben Ihre ein Aktuelle Prompt-Tokens pro Anruf, Die komprimierte Eingabeaufforderungstoken pro Anruf Nachdem Sie Ihre Systemaufforderung und Beispiele für wenige Aufnahmen gekürzt haben, erhalten Sie Ihre Anzahl von Anrufe pro Monat, und Ihr Eingabepreis pro Million Token. Es multipliziert die Token-Reduzierung pro Anruf mit Ihrem monatlichen Anrufvolumen und Ihrer Eingaberate, um die monatlichen Kosten anzuzeigen, die Sie vermeiden, und rechnet sie dann auf das Jahr um. Denn eine Systemaufforderung und deren Beispiele werden weitergesendet jede einzelne AnfrageSelbst eine geringfügige Reduzierung pro Anruf ergibt im Maßstab eine aussagekräftige Zahl, die dieses Tool sichtbar macht.
Der wichtigste Kompromiss, den es zu beachten gilt, besteht darin, dass weniger Token weniger Kontext für das Modell bedeuten können. Das Kürzen von Anweisungen oder das Weglassen von Beispielen mit wenigen Schüssen kann die Genauigkeit verringern, die Wiederholungsversuche erhöhen oder zu längeren Ausgaben führen – und Ausgabe-Tokens sind in der Regel teurer und sind es auch nicht hier gezählt, da dieser Rechner nur Input-Einsparungen modelliert. Verwenden Sie es, um die Komprimierung auf Ihren Endpunkten mit dem höchsten Volumen zu priorisieren, wo sich die gleiche Bearbeitung am meisten auszahlt Überprüfen Sie die Qualität nach jedem Schnitt bevor man davon ausgeht, dass die Ersparnis real ist. Eine Eingabeaufforderung, die pro Anruf günstiger ist, aber einen zweiten Versuch erfordert, kann insgesamt mehr kosten. Messen Sie daher die Antwortqualität zusammen mit der Token-Anzahl, anstatt die Token isoliert zu optimieren.
Häufig gestellte Fragen
Wie viel spart das Kürzen meiner Eingabeaufforderung tatsächlich?
Jeder Token, den Sie von einer Eingabeaufforderung entfernen, wird von jedem einzelnen Aufruf entfernt, der ihn verwendet. Multiplizieren Sie die pro Anruf eingesparten Token mit Ihrem monatlichen Anrufvolumen und dem Eingabepreis pro Million Token. Eine Reduzierung um 1.000 Token bei einem Prompt, der eine Million Mal im Monat bei 3 US-Dollar pro Million ausgeführt wird, spart monatlich 3.000 US-Dollar – die Größe des Prompts ist weitaus wichtiger, als die meisten Teams annehmen, da er bei jeder Anfrage erneut auftritt.
Beeinflusst die sofortige Komprimierung die Ausgabekosten oder die Qualität?
Die Komprimierung betrifft nur die Eingabeseite – Ausgabetoken und deren Preis bleiben unverändert. Durch das Kürzen redundanter Anweisungen, ausführlicher Beispiele mit wenigen Bildern und dupliziertem Kontext bleibt die Qualität normalerweise erhalten, aber zu aggressives Schneiden kann die Genauigkeit beeinträchtigen. Kombinieren Sie das Trimmen mit Prompt-Caching für stabile Präfixe, sodass der verbleibende feste Kontext mit der ermäßigten Cache-Leserate abgerechnet wird.