HomeAI APIs › Costo di input dell'immagine visiva
più economico/mese
token per immagine (più economico)

Stessa immagine, ogni modello di visione

Il modo in cui ciascun modello tokenizza la tua immagine e il costo di input mensile in base al tuo volume: classificato per primo come il più economico. I token di richiesta per immagine sono inclusi nella cifra mensile.

ModelloToken di immaginePer immagineAl mese
⚠️ Un preventivo. Le formule di tokenizzazione delle immagini cambiano e variano in base alla versione del modello esatto; i fornitori arrotondano i riquadri e applicano i minimi per immagine. I prezzi sono valori di riferimento per il 2026: conferma le attuali tariffe di input per milione e le regole di tokenizzazione della visione per il tuo modello esatto prima di definire il budget. · Segnala prezzo obsoleto →

Un'immagine è un token di input sotto mentite spoglie

Quando invii un'immagine a un modello di visione, questo non legge i pixel gratuitamente: converte l'immagine in token e li addebita alla velocità di input, proprio accanto al messaggio di testo. Il problema è che ogni provider conta questi token in modo diverso e nessuno di essi conta in base alla dimensione del file. GPT-4o di OpenAI inserisce l'immagine in una griglia di riquadri da 512 pixel e addebita 85 token base più 170 per riquadro. Claude di Anthropic utilizza all'incirca larghezza per altezza divisa per 750. Gemini di Google addebita 258 token fissi per le immagini piccole e per quelle più grandi. Lo stesso screenshot 1024×1024 può quindi corrispondere a 765 token su un modello e 1.400 su un altro: uno swing quasi 2× prima di aver scritto una singola parola di istruzioni.

Ciò conta di più a volume. Una pipeline di elaborazione dei documenti, un feed di moderazione o una funzione "chatta con i tuoi screenshot" possono inviare decine di migliaia di immagini al giorno, e a questi conteggi i token di immagine sminuiscono il prompt. Questo calcolatore rende visibile il compromesso: mostra come ogni modello tokenizza la tua esatta risoluzione e quanto costa al mese, così puoi scegliere il modello di visione più economico per il tuo mix di immagini e vedere immediatamente quanto risparmieresti riducendolo. Abbinalo al contatore di gettoni per il lato testo e il Strumento API LLM più economico per la scelta complessiva del modello.

Come usarlo

1. Inserisci la larghezza e l'altezza delle immagini che invii: la risoluzione dopo qualsiasi ridimensionamento già eseguito.
2. Scegli la modalità dettaglio di OpenAI: alta legge testo fine ed etichette piccole, bassa appiattisce su una miniatura da 85 token.
3. Inserisci il numero di immagini che invii al mese e, facoltativamente, i token di richiesta associati a ciascuna.
4. Leggi la tabella classificata per vedere il modello di visione più economico per la dimensione della tua immagine e il costo mensile.

Errori comuni

Invio a piena risoluzione quando andrebbe bene un ritaglio. Il costo del token cresce con l'area dei pixel, quindi un'immagine di 2048² può costare quattro volte un'immagine di 1024² per i dettagli di cui il modello non ha mai avuto bisogno. Lasciando i dettagli alti per impostazione predefinita. Se hai solo bisogno dell'essenza, la modalità a basso dettaglio costa 85 gettoni, spesso un risparmio di 5-10 volte. Dimenticare il suggerimento conta ancora. I token immagine si trovano sopra il messaggio di testo e qualsiasi messaggio di sistema, quindi il costo reale per chiamata viene sommato. Ignorare l'output. Questo strumento valuta l'immagine come input; la risposta scritta del modello viene fatturata separatamente alla tariffa di output.

Domande frequenti

Un file più grande costa di più?

No: il costo del token tiene traccia delle dimensioni in pixel, non dei byte. Un JPEG 2048² fortemente compresso e un PNG 2048² nitido costano lo stesso numero di token; contano solo la larghezza e l'altezza.

Come posso ridurre al massimo i costi di input delle immagini?

Riduci la risoluzione alla risoluzione più piccola che mostra comunque i dettagli di cui hai bisogno e utilizza la modalità a basso dettaglio ogni volta che l'attività richiede solo l'essenza. Insieme, queste due leve riducono sistematicamente di parecchie volte i costi di input per la visione.

Sono queste le formule esatte del fornitore?

Si tratta di implementazioni di riferimento fedeli alle regole dei pixel e dei riquadri 2026 pubblicate, ma i fornitori le arrotondano e le rivedono. Considera i conteggi dei token come stime precise e confrontali con il tokenizzatore del tuo provider per i numeri di livello di fatturazione.

E il video?

Il video viene generalmente addebitato come sequenza di fotogrammi campionati, ciascuno valutato come un'immagine. Stimare i fotogrammi al secondo campionati dal modello, moltiplicarli per secondi e trattare ciascun fotogramma come un'immagine in questo strumento.

Solo stima. La tokenizzazione della visione e i tassi di input per milione cambiano: verifica con il tuo fornitore prima di fare affidamento su queste cifre.

Ospita il tuo progetto:DigitalOcean: $ 200 gratis ↗Hostinger VPS
Google GemelliCoinGeckoAI e LLMScambi di criptovalutePagamenti