Häufig gestellte Fragen
Wie berechne ich die Kosten pro Token auf meiner eigenen GPU?
Nehmen Sie den GPU-Stundenpreis und dividieren Sie ihn durch die Anzahl der Token, die tatsächlich pro Stunde bereitgestellt werden. Das ist der Durchsatz (Tokens/Sek.) mal 3600, skaliert durch Ihre tatsächliche Auslastung. Eine GPU, die kontinuierlich abgerechnet wird, sich aber im Halbleerlauf befindet, stellt die Hälfte der Token bereit, sodass sich ihre Kosten pro Token im Vergleich zum Datenblattdurchsatz verdoppeln.
Warum sind meine selbst gehosteten Kosten höher als erwartet?
Fast immer Nutzung und Batchierung. Beim Benchmark-Durchsatz wird eine vollständige, gebündelte Auslastung vorausgesetzt. Der tatsächliche Datenverkehr ist stoßweise, sodass die GPU zwischen den Anforderungen im Leerlauf bleibt, während der Zähler läuft. Kontinuierliches Batching, die richtige Dimensionierung der GPU und die Konsolidierung des Datenverkehrs auf weniger, ausgelastete GPUs sind die wichtigsten Möglichkeiten, die Kosten pro Token zu senken.