28. Juli 2026 · KI & LLMs · 6 Minuten Lesezeit
Ich habe letzten Monat einen ganzen Dokumentationssatz eingebettet – etwa 50 Millionen Text-Tokens – und der OpenAI-Gesetzentwurf kam zustande ein Dollar. Ein einziger Dollar. Ich habe die Rechnung tatsächlich noch einmal gelesen, weil ich sicher war, dass ich eine Dezimalstelle vergessen hatte. Einbettungen sind die günstigste Sache im gesamten KI-Stack, so günstig, dass ein Vergleich von Anbietern allein anhand der Einbettungsrate fast sinnlos ist. Die Nummer, die Ihnen tatsächlich weh tun wird, steht woanders, und ich werde darauf zurückkommen. Aber zuerst die tatsächlichen Preise, denn die Leute fragen immer noch nach.
Dies sind die Pay-as-you-go-Eingaberaten, die ich verfolge. Bei Einbettungen wird nur die Eingabe berechnet – Sie senden Text, Sie erhalten Vektoren zurück, es gibt keine „Ausgabe-Token“-Seite auf der Rechnung. Alles unten ist in Dollar pro einer Million eingebetteter Textmarken angegeben.
| Modell | Preis / 1 Mio. Token | Abmessungen | Notizen |
|---|---|---|---|
| OpenAI text-embedding-3-small | $0.02 | 1536 | Der Standardwert wird ausgewählt |
| Voyage-3-lite | $0.02 | 512 | Günstige + winzige Vektoren |
| Reise-3 | $0.06 | 1024 | Starke Abrufqualität |
| Cohere Embed v3 | $0.10 | 1024 | Gute Mehrsprachigkeit |
| Mistral Embed | $0.10 | 1024 | Von der EU gehostete Option |
| OpenAI text-embedding-3-large | $0.13 | 3072 | Beste OpenAI-Qualität |
| Google gemini-embedding-001 | $0.15 | 3072 | Großzügiges kostenloses Kontingent zuerst |
Die Spanne vom günstigsten zum teuersten beträgt ungefähr 7× – 0,02 bis 0,15 US-Dollar. Das klingt dramatisch, bis man es mit einem realistischen Korpus multipliziert und sieht, wie klein die absoluten Zahlen bleiben.
Hier sind die einmaligen Kosten für die Einbettung von drei Korpusgrößen aufgeführt. 50 Millionen Token sind eine Dokumentationsseite oder Wissensdatenbank mittlerer Größe. 200M ist das gesamte Hilfecenter und die Geschichte eines großen Produkts. 1B ist unternehmensweit – denken Sie an jedes Support-Ticket, das Sie jemals eingereicht haben.
| Korpus | 3-klein / Voyage-lite | Reise-3 | Kohärent / Mistral | 3-groß | Zwillinge |
|---|---|---|---|---|---|
| 50 Millionen Token | $1.00 | $3.00 | $5.00 | $6.50 | $7.50 |
| 200 Millionen Token | $4.00 | $12.00 | $20.00 | $26.00 | $30.00 |
| 1B-Token | $20.00 | $60.00 | $100.00 | $130.00 | $150.00 |
Selbst bei einer Milliarde Token liegt die teuerste Option hier bei 150 US-Dollar – einmal. Ihre Abfrageseite ist sogar noch günstiger: Eine RAG-App, die eine Million Benutzerfragen pro Monat mit jeweils ca. 80 Token einbettet, verbraucht 80 Millionen Token, was bei 3-small 1,60 US-Dollar entspricht. Ich habe noch nie erlebt, dass die Einbettungswerbebuchung auch nur 2 % der monatlichen Rechnung eines KI-Produkts geknackt hat. Warum interessiert es also irgendjemanden, welches Sie auswählen?
Schauen Sie noch einmal auf die Dimensionsspalte. Das ist die Zahl, die tatsächlich Geld kostet, und zwar jeden einzelnen Monat, nicht einmal. Eine Vektordatenbank kostet Sie speichern und suchen diese Vektoren, und der Preis richtet sich danach, wie viele Dimensionen jeder einzelne hat. text-embedding-3-large erzeugt 3072-Dimension Vektoren. Voyage-3-lite produziert 512. Das ist ein 6-facher Unterschied in Speicher und Arbeitsspeicher für genau die gleichen Dokumente.
Die Einbettung des „Premium“-Modells für 0,13 US-Dollar kostet also nicht nur sechsmal mehr, sondern kann sogar ein Vielfaches kosten Gastgeber, für immer. In einer verwalteten Vektordatenbank stellen ein paar Millionen 3072-Dim-Vektoren im Speicher einen echten monatlichen Einzelposten dar, während derselbe Korpus mit 512 Dims möglicherweise in eine freie oder nahezu freie Ebene passt. Bei der Einbettungs-API handelt es sich um einen Rundungsfehler. Der Index, den es füttert, ist die wiederkehrende Gebühr. Ich habe die Speicherseite separat im Preis angegeben Aufschlüsselung von Tannenzapfen vs. pgvector – dort lebt das Geld tatsächlich.
Einbettungen aus verschiedenen Modellen sind möglich nicht kompatibel. Ein Vektor von OpenAI hat für einen Cohere-Index keine Bedeutung. An dem Tag, an dem Sie sich entscheiden, den Anbieter zu wechseln – oder sogar von 3-Small auf 3-Large umzusteigen – müssen Sie das tun Integrieren Sie Ihren gesamten Korpus von Grund auf neu und den Index neu erstellen. Dieser 1-Dollar-Job ist in der einmaligen Ausführung günstig; Die Ausführung ist lästig, weil Sie nach sechs Monaten die Modelle ausgetauscht haben und jetzt jeder gespeicherte Vektor Müll ist.
Aus diesem Grund besteht der kluge Schachzug nicht darin, „das günstigste pro Token auszuwählen“. Es heißt: „Wählen Sie ein Modell aus, dessen Dimensionsanzahl Ihre Vektor-DB hosten kann und dessen Abrufqualität gut genug ist, dass Sie es nie erneut einbetten müssen.“ Für die meisten Leute ist die Antwort text-embedding-3-small oder Voyage-3-lite: zwei Cent pro Million Token, kleine Vektoren, Qualität, die hält. Sie greifen nur dann zu 3-groß oder einem Reranker, wenn die Abrufqualität messbar nachlässt, nicht standardmäßig.
Ich verwende standardmäßig Texteinbettung-3-klein. Es kostet 0,02 $/1 Mio., die Vektoren haben überschaubare 1536 Dimensionen und OpenAI ermöglicht es Ihnen, sie weiter zu kürzen, wenn Ihre Datenbank über wenig Speicher verfügt. Wenn ich eine bessere mehrsprachige Erinnerung benötige, teste ich Voyage oder Cohere auf meinem eigenen Evaluierungsset, bevor ich mich entscheide – denn ein späterer Wechsel bedeutet, dass alles neu eingebettet werden muss. Und ich veranschlage die Vektordatenbank als die tatsächlichen Kosten, nicht die API. Berechnen Sie Ihre eigenen Zahlen, bevor Sie sich auf eine Dimensionszählung festlegen, für die Sie jeden Monat bezahlen müssen:
Neu bei der nutzungsbasierten API-Preisgestaltung? Beginnen Sie mit dem kostenlose API-Kostenleitfäden. Und wenn Sie die vollständige Retrieval-App erstellen, sind Einbettungen die kostengünstige dritte Lösung – sehen Sie was die LLM-Seite nach dem Caching kostet wohin das echte Geld pro Anruf fließt.
Bei den Preisen handelt es sich um Listenpreise der Anbieter, die in unserem Katalog (Juli 2026) aufgeführt sind, und um Referenzschätzungen. Überprüfen Sie vor der Budgetierung die aktuellen Preise auf der Preisseite jedes Anbieters. Dimensionszählungen sind Standardmodellausgaben; Einige Modelle (einschließlich OpenAIs) unterstützen die Verkürzung. Korpuskosten sind einmalig; Die Speicherung der Vektordatenbank erfolgt wiederkehrend und wird separat abgerechnet.