Die Kosten steigen, da Dokumente pro Abfrage steigen

Dieselben Raten wie oben, die durchschnittlichen neu eingestuften Dokumente pro Abfrage schwankten über einen repräsentativen Bereich (Abfragen/Monat und festgehaltene Token-Größen). Beobachten Sie die „Klippe“ jedes Mal, wenn die Dokumentenzahl bei Cohere ein Vielfaches von 100 überschreitet, während bei Voyage AI und Jina AI ein sanfter Anstieg pro Token zu verzeichnen ist.

Dokumente / AbfrageZusammenhängenReise-KIJina AIGünstigstes

Zwei grundlegend unterschiedliche Reranker-Abrechnungsformen

Kohärente Neubewertung misst die Nutzung in ganzen „Sucheinheiten“: Eine Sucheinheit deckt eine Abfrage plus bis zu 100 Dokumente ab, wobei jedes Dokument auf 500 Token begrenzt ist. Wenn eine Abfrage mehr als 100 Dokumente sendet oder ein Dokument die 500-Token-Obergrenze überschreitet, wird der Überlauf auf eine zusätzliche ganze Sucheinheit aufgerundet – das Neuranking von 101 Dokumenten kostet also genau das Gleiche wie das Neuranking von 200. Die von diesem Rechner verwendete Formel lautet effectiveDocs = docs × ceil(tokensPerDoc / 500); units = ceil(effectiveDocs / 100); searches = queries × units; cost = searches / 1000 × rate (Preis ≈ 2,00 $/1.000 Suchanfragen für Rerank 3.5 und Rerank 4 Fast, ≈ 2,50 $/1.000 für Rerank 4 Pro). Reise-KI Und Jina AI Stattdessen wird jedes tatsächlich verarbeitete Token in Rechnung gestellt – Abfragetext plus die Token jedes Kandidatendokuments – ohne gebündelten Headroom und ohne Rundungsklippe: tokens = queries × (docs × tokensPerDoc + queryTokens); cost = tokens / 1,000,000 × rate (Voyage rerank-2.5 ≈$0.05/1M Token, rerank-2.5-lite ≈$0.02/1M Token; Jina jina-reranker-v2-base-multilingual ≈$0.02/1M Token, jina-reranker-v3.5 ≈$0.05/1M Token).

Der praktische Effekt: Die meisten RAG-Pipelines ordnen nur eine Auswahlliste mit 10–50 Kandidatenblöcken pro Abfrage neu, was weit unter der Obergrenze von 100 Dokumenten von Cohere liegt – was bedeutet, dass Sie für eine vollständige Sucheinheit mit der Größe von bis zu 100 Dokumenten bezahlen, obwohl Sie nur einen Bruchteil davon verwenden, und die tokenbasierten Anbieter normalerweise günstiger sind. Cohere wird wettbewerbsfähiger, sobald eine Pipeline kontinuierlich in die Nähe der vollen Obergrenze von 100 Dokumenten wechselt, da Sie zu diesem Zeitpunkt tatsächlich den Headroom nutzen, für den Sie bezahlen. Beobachten Sie die Anzahl der Dokumente, die knapp über einem Vielfachen von 100 liegen (101, 201, 301 …) – hier steigen die Kosten von Cohere im Vergleich zu den tokenbasierten Anbietern am stärksten an. Führen Sie Ihr eigenes Abfragevolumen und Ihre eigene Dokumentanzahl mit dem oben stehenden Rechner durch, anstatt die Schlagzeilenraten pro Einheit oder pro Token isoliert zu vergleichen.

Aktie: 𝕏 Posten Reddit
Hosten Sie Ihr Projekt:DigitalOcean – 200 $ kostenlos ↗Hostinger VPS
RAG vs. FeinabstimmungKosten für die Site Search-API