So funktioniert dieser Rechner
Der Kostenrechner für die LLM-Evaluierung schätzt die Tokenausgaben eines einzelnen Evaluierungslaufs, bei dem eine Reihe von Testfällen ein oder mehrere Modelle durchlaufen und von einem Richtermodell bewertet werden. Es vervielfacht die Anzahl von Testfälle durch die Modelle verglichen, dann durch die Token pro Karton – deckt sowohl die Generationen-Tokens ab, die die getesteten Modelle produzieren, als auch die Richter-Tokens, die für die Bewertung jeder Antwort aufgewendet wurden – und wendet Ihre an $ pro 1 Million Token Wechselkurs, um diese Summe in einen Dollarwert umzurechnen. Die Haupttreiber sind daher die Größe Ihres Testsatzes, die Anzahl der Modelle, die Sie parallel bewerten, und die Anzahl der Token, die jeder Generierungs-plus-Beurteilungszyklus verbraucht.
Der wichtigste Kompromiss, den es zu beachten gilt, ist die Kostenskalierung multiplikativ: Durch das Hinzufügen von Modellen oder das Erweitern des Testsatzes werden nicht nur Token hinzugefügt, sondern sie werden auch zusammengesetzt, und der Richterpass kann die Nutzung pro Fall stillschweigend verdoppeln. Bevor Sie einen großen Sweep durchführen, verwenden Sie den Rechner, um die Größe einer kleineren repräsentativen Stichprobe zu ermitteln und sicherzustellen, dass die Kosten pro Durchgang akzeptabel sind, da eine umfangreiche Beurteilungsaufforderung oder eine lange Testsuite wiederholte Bewertungsläufe weitaus teurer machen können, als eine einzelne Generation vermuten lässt. Wenn Sie zunächst den Kostenvoranschlag überprüfen, können Sie entscheiden, ob Sie die Fälle kürzen, die verglichenen Modelle verkleinern oder einen günstigeren Richter verwenden möchten.
Häufig gestellte Fragen
Wie viel kostet die LLM-Evaluierung?
Die Kosten betragen Testfälle mal Modelle mal Token pro Fall, einschließlich des Vorlesens jeder Antwort durch das Richtermodell. Ein LLM-Richter verdoppelt ungefähr die Anzahl der Token, da jede generierte Antwort auch bewertet wird. Wenn Sie die Suite bei jedem Commit ausführen, vervielfacht sich dieser Wert im Laufe des Monats.
Wie halte ich die Evaluierungskosten niedrig?
Verwenden Sie ein kleineres, günstigeres Modell als Richter, behalten Sie ein fokussiertes goldenes Set anstelle von Tausenden von Fällen bei und führen Sie jeden Abend die gesamte Suite mit einem schnellen Smoke-Set bei jedem Commit durch. Sie müssen nicht jedes Modell bei jedem Versuch bewerten.