Stessa immagine, ogni modello di visione
Il modo in cui ciascun modello tokenizza la tua immagine e il costo di input mensile in base al tuo volume: classificato per primo come il più economico. I token di richiesta per immagine sono inclusi nella cifra mensile.
| Modello | Token di immagine | Per immagine | Al mese |
|---|
Un'immagine è un token di input sotto mentite spoglie
Quando invii un'immagine a un modello di visione, questo non legge i pixel gratuitamente: converte l'immagine in token e li addebita alla velocità di input, proprio accanto al messaggio di testo. Il problema è che ogni provider conta questi token in modo diverso e nessuno di essi conta in base alla dimensione del file. GPT-4o di OpenAI inserisce l'immagine in una griglia di riquadri da 512 pixel e addebita 85 token base più 170 per riquadro. Claude di Anthropic utilizza all'incirca larghezza per altezza divisa per 750. Gemini di Google addebita 258 token fissi per le immagini piccole e per quelle più grandi. Lo stesso screenshot 1024×1024 può quindi corrispondere a 765 token su un modello e 1.400 su un altro: uno swing quasi 2× prima di aver scritto una singola parola di istruzioni.
Ciò conta di più a volume. Una pipeline di elaborazione dei documenti, un feed di moderazione o una funzione "chatta con i tuoi screenshot" possono inviare decine di migliaia di immagini al giorno, e a questi conteggi i token di immagine sminuiscono il prompt. Questo calcolatore rende visibile il compromesso: mostra come ogni modello tokenizza la tua esatta risoluzione e quanto costa al mese, così puoi scegliere il modello di visione più economico per il tuo mix di immagini e vedere immediatamente quanto risparmieresti riducendolo. Abbinalo al contatore di gettoni per il lato testo e il Strumento API LLM più economico per la scelta complessiva del modello.
Come usarlo
1. Inserisci la larghezza e l'altezza delle immagini che invii: la risoluzione dopo qualsiasi ridimensionamento già eseguito.
2. Scegli la modalità dettaglio di OpenAI: alta legge testo fine ed etichette piccole, bassa appiattisce su una miniatura da 85 token.
3. Inserisci il numero di immagini che invii al mese e, facoltativamente, i token di richiesta associati a ciascuna.
4. Leggi la tabella classificata per vedere il modello di visione più economico per la dimensione della tua immagine e il costo mensile.
Errori comuni
Invio a piena risoluzione quando andrebbe bene un ritaglio. Il costo del token cresce con l'area dei pixel, quindi un'immagine di 2048² può costare quattro volte un'immagine di 1024² per i dettagli di cui il modello non ha mai avuto bisogno. Lasciando i dettagli alti per impostazione predefinita. Se hai solo bisogno dell'essenza, la modalità a basso dettaglio costa 85 gettoni, spesso un risparmio di 5-10 volte. Dimenticare il suggerimento conta ancora. I token immagine si trovano sopra il messaggio di testo e qualsiasi messaggio di sistema, quindi il costo reale per chiamata viene sommato. Ignorare l'output. Questo strumento valuta l'immagine come input; la risposta scritta del modello viene fatturata separatamente alla tariffa di output.
Domande frequenti
Un file più grande costa di più?
No: il costo del token tiene traccia delle dimensioni in pixel, non dei byte. Un JPEG 2048² fortemente compresso e un PNG 2048² nitido costano lo stesso numero di token; contano solo la larghezza e l'altezza.
Come posso ridurre al massimo i costi di input delle immagini?
Riduci la risoluzione alla risoluzione più piccola che mostra comunque i dettagli di cui hai bisogno e utilizza la modalità a basso dettaglio ogni volta che l'attività richiede solo l'essenza. Insieme, queste due leve riducono sistematicamente di parecchie volte i costi di input per la visione.
Sono queste le formule esatte del fornitore?
Si tratta di implementazioni di riferimento fedeli alle regole dei pixel e dei riquadri 2026 pubblicate, ma i fornitori le arrotondano e le rivedono. Considera i conteggi dei token come stime precise e confrontali con il tokenizzatore del tuo provider per i numeri di livello di fatturazione.
E il video?
Il video viene generalmente addebitato come sequenza di fotogrammi campionati, ciascuno valutato come un'immagine. Stimare i fotogrammi al secondo campionati dal modello, moltiplicarli per secondi e trattare ciascun fotogramma come un'immagine in questo strumento.
Solo stima. La tokenizzazione della visione e i tassi di input per milione cambiano: verifica con il tuo fornitore prima di fare affidamento su queste cifre.