HomeAI APIs › Costo del token di ragionamento
costo mensile reale
costo per richiesta
pensiero nascosto / mo
se ignorassi il ragionamento

Quanto costa ogni sforzo di ragionamento

Stesso prompt e volume sul modello selezionato: il moltiplicatore del ragionamento fa la differenza.

SforzoSegnalini di ragionamentoPer richiestaMensile
⚠️ Preventivo di riferimento. Il conteggio dei token di ragionamento varia in base alla difficoltà immediata e all'impostazione dell'impegno del fornitore: leggi il numero reale dalle API usage.reasoning_tokens (o equivalente) per il tuo traffico. I tassi riportati di seguito sono prezzi rappresentativi di output/input per il 2026; confermare i prezzi attuali con ciascun fornitore. · Segnala prezzo obsoleto →

Perché il tuo disegno di legge basato sul modello di ragionamento è più grande di quanto sembri

Un normale modello di chat ti addebita i token che invii (input) e i token che riscrive (output). Un modello di ragionamento aggiunge una terza categoria invisibile: la gettoni pensanti genera internamente per risolvere un problema prima di comporre la risposta che vedi. Non ricevi mai quel lavoro zero, ma lo paghi: i fornitori lo misurano al tasso di uscita, il livello più costoso. Il risultato è un conto che può essere molte volte superiore a quello previsto da una stima ingenua di "input + output visibile", perché su un prompt difficile il modello potrebbe bruciare 5.000 token di ragionamento per produrre una risposta di 400 token.

Questa calcolatrice rende visibile la metà nascosta. Inserisci l'input e l'output visibile che ti aspetti, scegli uno sforzo di ragionamento (o digita l'esatto conteggio dei token di ragionamento dal campo di utilizzo dell'API) e valuta tutti e tre i flussi. Il "vero costo mensile" include il pensiero; la cifra "se hai ignorato il ragionamento" è la trappola: il numero che otterresti da un contatore di token che vede solo il prompt e la risposta. Il divario tra loro è ciò che sorprende le squadre alla fine del mese.

Le tre leve del ragionamento costano

1. Sforzo. Most reasoning APIs expose a low / medium / high (or a token-budget) control. Dropping from high to medium on prompts that don't need deep thought can halve the bill with no visible change in answer quality — the table above shows the exact difference for your workload. 2. Itinerario. Vale la pena pagare per il ragionamento nei compiti veramente difficili e puro spreco in quelli facili; inviare richieste semplici a un modello più economico e non ragionante e riservarsi di pensare alla coda dura. Dimensiona la divisione con il calcolatore del risparmio di routing del modello. 3. Progettazione rapida. Prompt più chiari e più vincolati richiedono meno esplorazione, quindi generano meno token di ragionamento: un caso raro in cui i prompt migliori sono anche prompt più economici.

Come usarlo

1. Scegli un modello di ragionamento e inserisci il volume della tua richiesta mensile.
2. Inserisci i token di input e output visibili tipici per richiesta.
3. Scegli uno sforzo di ragionamento oppure seleziona "Manuale" e digita i token di ragionamento che hai misurato.
4. Read the true cost, see how much is hidden thinking, and use the table to find the effort level that fits your budget.

Errori comuni

Budgeting solo sulla produzione visibile. I gettoni pensanti sono solitamente la metà più grande: ignorali e la tua previsione sarà sbagliata per multipli. Lasciando lo sforzo in alto ovunque. L'impegno elevato è un valore predefinito, non un requisito; la maggior parte dei prompt non ne hanno bisogno. Confronto tra un modello di ragionamento e un modello di chat sul prezzo principale. Stessa tariffa per token, conteggi di token molto diversi: confronta il costo reale per richiesta, non per milione. Supponendo che la memorizzazione nella cache aiuti il ​​ragionamento. Richiedi sconti sulla memorizzazione nella cache ripetuti ingresso; non fa nulla per i token ragionamento appena generati.

Domande frequenti

Mi vengono addebitati token che non riesco nemmeno a leggere?

SÌ. I modelli di ragionamento nascondono i token di pensiero dalla risposta ma li fatturano comunque, al tasso di output. L'API restituisce il conteggio in un campo di utilizzo in modo da poterlo controllare.

Quanti gettoni di ragionamento sono "normali"?

Si adatta allo sforzo e alla difficoltà: circa 2 volte il risultato visibile con uno sforzo basso, circa 5 volte con uno sforzo medio e 10–15 volte più con uno sforzo elevato per problemi difficili. Misura il tuo traffico per ottenere un moltiplicatore esatto.

Un modello di ragionamento è mai più economico di un modello di chat?

Raramente solo in termini di costi: è più economico in termini di risultati quando un compito difficile richiederebbe altrimenti un modello più grande o diversi tentativi. Per compiti facili, un modello non ragionante vince ogni volta in termini di prezzo.

Posso limitare la spesa per il ragionamento?

Su molte API sì, tramite l'impostazione dello sforzo di ragionamento o un budget esplicito di token di pensiero. Abbassarlo è la leva più importante su questo disegno di legge; la tabella mostra il risparmio.

Solo stima. L'utilizzo del token di ragionamento dipende dalle tue richieste e dal controllo dell'impegno del provider: verifica rispetto ai dati di utilizzo reali dell'API prima di definire il budget.

Ospita il tuo progetto:DigitalOcean: $ 200 gratis ↗Hostinger VPS
Cloud e sviluppoConfronta i prezzi di oltre 300 modelli AICalcolatore della latenza e del tempo di risposta LLMCalcolatore dei costi di archiviazione DB vettorialeCalcolatore da parole a token