Quanto costa ogni sforzo di ragionamento
Stesso prompt e volume sul modello selezionato: il moltiplicatore del ragionamento fa la differenza.
| Sforzo | Segnalini di ragionamento | Per richiesta | Mensile |
|---|
usage.reasoning_tokens (o equivalente) per il tuo traffico. I tassi riportati di seguito sono prezzi rappresentativi di output/input per il 2026; confermare i prezzi attuali con ciascun fornitore. · Segnala prezzo obsoleto →Perché il tuo disegno di legge basato sul modello di ragionamento è più grande di quanto sembri
Un normale modello di chat ti addebita i token che invii (input) e i token che riscrive (output). Un modello di ragionamento aggiunge una terza categoria invisibile: la gettoni pensanti genera internamente per risolvere un problema prima di comporre la risposta che vedi. Non ricevi mai quel lavoro zero, ma lo paghi: i fornitori lo misurano al tasso di uscita, il livello più costoso. Il risultato è un conto che può essere molte volte superiore a quello previsto da una stima ingenua di "input + output visibile", perché su un prompt difficile il modello potrebbe bruciare 5.000 token di ragionamento per produrre una risposta di 400 token.
Questa calcolatrice rende visibile la metà nascosta. Inserisci l'input e l'output visibile che ti aspetti, scegli uno sforzo di ragionamento (o digita l'esatto conteggio dei token di ragionamento dal campo di utilizzo dell'API) e valuta tutti e tre i flussi. Il "vero costo mensile" include il pensiero; la cifra "se hai ignorato il ragionamento" è la trappola: il numero che otterresti da un contatore di gettoni che vede solo il prompt e la risposta. Il divario tra loro è ciò che sorprende le squadre alla fine del mese.
Le tre leve del ragionamento costano
1. Effort. La maggior parte delle API di ragionamento espongono un controllo basso/medio/alto (o un budget token). Passare da alto a medio su prompt che non richiedono una riflessione approfondita può dimezzare il conto senza alcun cambiamento visibile nella qualità della risposta: la tabella sopra mostra la differenza esatta per il tuo carico di lavoro. 2. Itinerario. Vale la pena pagare per il ragionamento nei compiti veramente difficili e puro spreco in quelli facili; inviare richieste semplici a un modello più economico e non ragionante e riservarsi di pensare alla coda dura. Dimensiona la divisione con il calcolatore del risparmio di routing del modello. 3. Progettazione rapida. Prompt più chiari e più vincolati richiedono meno esplorazione, quindi generano meno token di ragionamento: un caso raro in cui i prompt migliori sono anche prompt più economici.
Come usarlo
1. Scegli un modello di ragionamento e inserisci il volume della tua richiesta mensile.
2. Inserisci i token di input e output visibili tipici per richiesta.
3. Scegli uno sforzo di ragionamento oppure seleziona "Manuale" e digita i token di ragionamento che hai misurato.
4. Leggi il costo reale, scopri quanto è nascosto il pensiero e utilizza la tabella per trovare il livello di impegno adatto al tuo budget.
Errori comuni
Budgeting solo sulla produzione visibile. I gettoni pensanti sono solitamente la metà più grande: ignorali e la tua previsione sarà sbagliata per multipli. Lasciando lo sforzo in alto ovunque. L'impegno elevato è un valore predefinito, non un requisito; la maggior parte dei prompt non ne hanno bisogno. Confronto tra un modello di ragionamento e un modello di chat sul prezzo principale. Stessa tariffa per token, conteggi di token molto diversi: confronta il costo reale per richiesta, non per milione. Supponendo che la memorizzazione nella cache aiuti il ragionamento. Richiedi sconti sulla memorizzazione nella cache ripetuti ingresso; non fa nulla per i token ragionamento appena generati.
Solo stima. L'utilizzo del token di ragionamento dipende dalle tue richieste e dal controllo dell'impegno del provider: verifica rispetto ai dati di utilizzo reali dell'API prima di definire il budget.