Häufig gestellte Fragen
Wie werden die Bildkosten für Vision-Modelle berechnet?
Vision-Modelle teilen ein Bild in 512-Pixel-Kacheln auf. Bei der Preisgestaltung im GPT-4o-Stil wird eine feste Basis (etwa 85 Token) plus etwa 170 Token pro Kachel berechnet und diese dann als normale Eingabe-Token abgerechnet. Ein 1024×1024-Bild besteht aus vier Kacheln, also etwa 765 Token – je mehr Megapixel, desto mehr Kacheln und Token.
Wie reduziere ich die Kosten für die Vision-API?
Skalieren Sie Bilder vor dem Senden herunter – die Auflösung bestimmt die Anzahl der Kacheln und für die meisten Aufgaben ist nicht die volle Auflösung erforderlich. Verwenden Sie den Low-Detail-Modus, wenn das Modell dies anbietet (pauschale, günstige Token-Kosten), schneiden Sie das Bild auf den wichtigen Bereich zu und vermeiden Sie, das gleiche Bild in mehreren Gesprächsrunden erneut zu senden.