Gleiches Bild, jedes Visionsmodell
Wie jedes Modell Ihr Image tokenisiert und die monatlichen Eingabekosten bei Ihrem Volumen – das günstigste zuerst. Prompt-Tokens pro Bild sind in der monatlichen Zahl enthalten.
| Modell | Bild-Tokens | Pro Bild | Pro Monat |
|---|
Ein Bild ist ein getarntes Eingabezeichen
Wenn Sie ein Bild an ein Vision-Modell senden, liest es die Pixel nicht kostenlos, sondern wandelt das Bild in Token um und berechnet diese direkt neben Ihrer Textaufforderung mit der Eingaberate. Der Haken daran ist, dass jeder Anbieter diese Token unterschiedlich zählt und keiner von ihnen nach Dateigröße zählt. GPT-4o von OpenAI fügt das Bild in ein Raster aus 512-Pixel-Kacheln ein und berechnet 85 Basis-Tokens plus 170 pro Kachel. Claude von Anthropic verwendet ungefähr Breite mal Höhe dividiert durch 750. Gemini von Google berechnet pauschal 258 Token für kleine Bilder und kachelt größere. Derselbe 1024×1024-Screenshot kann daher bei einem Modell 765 Token und bei einem anderen 1.400 Token umfassen – ein fast zweifacher Schwung, bevor Sie ein einziges Wort der Anweisung geschrieben haben.
Das ist bei der Lautstärke am wichtigsten. Eine Dokumentenverarbeitungs-Pipeline, ein Moderations-Feed oder eine Funktion zum „Chatten mit Ihren Screenshots“ können Zehntausende Bilder pro Tag übertragen, und bei dieser Anzahl stellen die Bild-Tokens die Eingabeaufforderung in den Schatten. Dieser Rechner macht den Kompromiss sichtbar: Er zeigt, wie jedes Modell Ihre genaue Auflösung tokenisiert und was das pro Monat kostet. So können Sie das günstigste Vision-Modell für Ihren Bildmix auswählen und sofort sehen, wie viel Sie durch eine Verkleinerung sparen würden. Kombinieren Sie es mit dem Token-Zähler für die Textseite und die günstigstes LLM-API-Tool für die Gesamtmodellwahl.
Wie man es benutzt
1. Geben Sie die Breite und Höhe der von Ihnen gesendeten Bilder ein – die Auflösung nach eventuellen Größenänderungen, die Sie bereits vorgenommen haben.
2. Wählen Sie den Detailmodus von OpenAI: Bei „Hoch“ werden feiner Text und kleine Beschriftungen gelesen, bei „Niedrig“ wird ein Miniaturbild mit 85 Token angezeigt.
3. Geben Sie ein, wie viele Bilder Sie pro Monat senden, und optional die dazugehörigen Eingabeaufforderungs-Tokens.
4. Lesen Sie die Rangliste, um das günstigste Vision-Modell für Ihre Bildgröße und die monatlichen Kosten zu sehen.
Häufige Fehler
Senden in voller Auflösung, wenn ein Ausschnitt ausreichen würde. Die Token-Kosten steigen mit der Pixelfläche, sodass ein 2048²-Bild viermal so viel kosten kann wie ein 1024²-Bild für Details, die das Modell nie benötigte. Die Details bleiben standardmäßig hoch. Wenn Sie nur das Wesentliche benötigen, kostet der Low-Detail-Modus pauschal 85 Token – oft eine 5- bis 10-fache Ersparnis. Es zählt immer noch, die Aufforderung zu vergessen. Die Bild-Tokens befinden sich zusätzlich zu Ihrer Textaufforderung und jeder Systemaufforderung, sodass die tatsächlichen Kosten pro Anruf addiert werden. Ausgabe ignorieren. Dieses Tool bewertet das Bild als Eingabe; Die schriftliche Antwort des Models wird zum Leistungssatz gesondert in Rechnung gestellt.
FAQ
Kostet eine größere Datei mehr?
Nein – die Token-Kosten verfolgen die Pixelabmessungen, nicht die Bytes. Ein stark komprimiertes 2048²-JPEG und ein gestochen scharfes 2048²-PNG kosten die gleiche Anzahl an Token; Nur die Breite und Höhe sind wichtig.
Wie reduziere ich die Kosten für die Bildeingabe am meisten?
Skalieren Sie auf die kleinste Auflösung herunter, die immer noch die benötigten Details zeigt, und verwenden Sie den Low-Detail-Modus überall dort, wo die Aufgabe nur das Wesentliche erfordert. Zusammen reduzieren diese beiden Hebel die Kosten für die visuelle Eingabe routinemäßig um ein Vielfaches.
Sind das die genauen Anbieterformeln?
Es handelt sich um originalgetreue Referenzimplementierungen der veröffentlichten Kachel- und Pixelregeln von 2026, die von den Anbietern jedoch abgerundet und überarbeitet werden. Behandeln Sie die Anzahl der Token als knappe Schätzungen und vergleichen Sie sie mit dem Tokenisierer Ihres Anbieters, um abrechnungsfähige Zahlen zu erhalten.
Was ist mit Videos?
Videos werden in der Regel als Folge von gesampelten Bildern abgerechnet, wobei jedes Bild wie ein Bild berechnet wird. Schätzen Sie die Bilder pro Sekunde, die das Modell abtastet, multiplizieren Sie es mit Sekunden und behandeln Sie jedes Bild in diesem Tool als ein Bild.
Nur Schätzung. Vision-Tokenisierung und Eingaberaten pro Million ändern sich – erkundigen Sie sich bei Ihrem Anbieter, bevor Sie sich auf diese Zahlen verlassen.