In sintesi:
- Il cost per token rappresenta l’unità di misura fondamentale per governare la spesa AI: comprende cicli GPU, consumo energetico e margini del provider.
- Il costo inferenza AI è crollato del 90% in tre anni, ridisegnando le soglie di convenienza tra API cloud e self-hosting.
- Per un budget progetti AI realistico, occorre calcolare il break-even considerando volumi, latenza e costi nascosti dell’infrastruttura.
- Chi non monitora il cost per token rischia di scoprire troppo tardi che il proprio progetto AI consuma più di quanto produce.
Indice dei contenuti
Il silenzio delle fatture
La sala riunioni al terzo piano di un’azienda manifatturiera lombarda, un martedì di novembre. Sul tavolo, tre fogli stampati. Il CFO li osserva come si osservano radiografie che non si vorrebbero vedere. Sono le fatture del provider cloud per i servizi di intelligenza artificiale. Tremila euro a ottobre. Cinquemila a novembre. La proiezione per dicembre supera gli ottomila.
Nessuno, in quella stanza, sa spiegare con precisione cosa stia accadendo. Il progetto pilota di customer service automatizzato funziona. I clienti rispondono bene. Ma i costi crescono con una velocità che nessun business plan aveva previsto.
Il problema non è l’AI. Il problema è che nessuno ha mai guardato davvero al cost per token.
Anatomia del costo inferenza AI: cosa paga davvero un’azienda
Un token non è una parola. È un frammento di testo — talvolta una sillaba, talvolta un segno di punteggiatura — che il modello elabora come unità minima. In italiano, una parola media corrisponde a circa 1,5 token. Una frase di dieci parole ne genera quindici o sedici.
Quando un’azienda interroga un modello linguistico tramite API, paga per ogni token in ingresso e per ogni token in uscita. Il costo inferenza AI si compone di tre strati invisibili:
- Cicli GPU: ogni token richiede milioni di operazioni matematiche su processori grafici specializzati. Il tempo di calcolo si misura in millisecondi, ma moltiplicato per milioni di richieste diventa una voce di spesa rilevante.
- Consumo energetico: un singolo data center AI può assorbire quanto una cittadina di ventimila abitanti. Il kWh entra nel prezzo finale, anche se il cliente non lo vede.
- Margine del provider: OpenAI, Anthropic, Google applicano ricarichi che variano dal 30% al 200% rispetto al costo computazionale puro.
Il cost per token pubblicato nelle pagine pricing è solo la superficie. Sotto, c’è un’economia complessa che premia chi sa leggere i numeri.
La differenza tra input e output
I provider distinguono tra token di input (il prompt inviato) e token di output (la risposta generata). Il rapporto di prezzo varia: GPT-4o costa 2,50 dollari per milione di token in input e 10 dollari per milione in output. Claude 3.5 Sonnet applica 3 dollari e 15 dollari rispettivamente.
Un chatbot che risponde con messaggi lunghi costa quattro volte di più di uno che sintetizza. Questa asimmetria sfugge a chi progetta senza guardare i token.
Il crollo dei prezzi: tre anni che hanno cambiato il budget progetti AI
Nel marzo 2023, GPT-4 debuttò a 60 dollari per milione di token di output. Oggi, modelli di capacità comparabile costano meno di un dollaro. Il calo supera il 95%.
I dati raccolti da Artificial Analysis mostrano una curva di discesa senza precedenti nella storia del software:
| Periodo | Modello di riferimento | Costo output ($/1M token) |
|---|---|---|
| Marzo 2023 | GPT-4 | 60,00 |
| Novembre 2023 | GPT-4 Turbo | 30,00 |
| Maggio 2024 | GPT-4o | 15,00 |
| Gennaio 2025 | DeepSeek V3 | 0,28 |
| Aprile 2025 | Gemini 2.5 Flash | 0,40 |
Questo crollo ridefinisce ogni calcolo di budget progetti AI. Applicazioni che nel 2023 costavano centomila euro l’anno oggi ne richiedono cinquemila. Ma il risparmio si materializza solo per chi aggiorna i propri modelli di costo.
Perché i prezzi scendono
Tre fattori convergono. Primo: l’efficienza dei chip. Le GPU Nvidia H100 elaborano il doppio dei token rispetto alle A100 a parità di consumo. Secondo: l’ottimizzazione dei modelli. Tecniche come la quantizzazione riducono la memoria necessaria senza perdite percepibili di qualità. Terzo: la competizione. L’ingresso di DeepSeek, Mistral e dei modelli open-weight ha spezzato il duopolio OpenAI-Google.
Per chi governa progetti AI, la lezione è chiara: i preventivi di sei mesi fa sono già obsoleti.
API cloud o self-hosting: dove si sposta il break-even del costo inferenza AI
Immagina di gestire un servizio che elabora due milioni di token al giorno. Con le API di GPT-4o, la spesa mensile si aggira sui 750 dollari. Con un modello open-weight come Llama 3 su server proprietario, il costo computazionale scende a 200 dollari — ma servono hardware, competenze, manutenzione.
Il calcolo del break-even richiede variabili che raramente compaiono nei pitch dei vendor:
- Costo hardware: una GPU A100 costa 15.000 euro. L’ammortamento su tre anni incide per 400 euro al mese.
- Energia: un server con due GPU consuma 1.500 kWh mensili. In Italia, al prezzo industriale medio di 0,25 €/kWh, sono 375 euro.
- Personale: gestire un’infrastruttura ML richiede competenze che sul mercato italiano costano 60-80.000 euro lordi annui.
- Latenza e uptime: i provider cloud garantiscono SLA del 99,9%. Replicare quella affidabilità in-house ha un prezzo.
La soglia di convenienza del self-hosting si è alzata. Tre anni fa, bastava elaborare un milione di token al giorno per giustificare l’investimento. Oggi, con il cost per token delle API crollato, servono volumi dieci volte superiori.
Il caso ibrido
Alcune aziende adottano architetture miste: modelli leggeri on-premise per task ripetitivi, API cloud per richieste complesse. Un’azienda di e-commerce veneta ha ridotto la spesa del 40% instradando le domande frequenti verso un modello locale da 7 miliardi di parametri, riservando GPT-4o alle conversazioni che richiedono ragionamento articolato.
La scelta non è tecnica. È strategica.
Costruire un budget progetti AI che regga alla prova dei fatti
Il direttore IT di un gruppo assicurativo romano racconta di aver presentato tre volte il budget AI al board. Le prime due, i numeri erano sbagliati. Non per incompetenza, ma perché nessuno aveva misurato il consumo reale di token.
Un budget progetti AI credibile parte da quattro domande:
- Quanti token consuma ogni singola interazione? (Non la media teorica: il dato reale, misurato in produzione.)
- Qual è la distribuzione delle richieste? (Il 10% delle query può generare il 60% dei costi.)
- Come evolverà il volume nei prossimi dodici mesi?
- Quali ottimizzazioni sono possibili senza degradare l’esperienza utente?
Chi risponde a queste domande prima di firmare contratti con i provider risparmia mesi di rinegoziazioni.
Le leve di ottimizzazione
Ridurre il costo per token AI non significa sempre cambiare modello. Spesso basta intervenire sui prompt. Un system prompt di 500 token ripetuto in ogni chiamata costa, su un milione di richieste mensili, quanto un’auto utilitaria.
Tecniche come il caching semantico — riutilizzare risposte a domande simili — abbattono i volumi del 20-30%. La compressione dei contesti lunghi, dove il modello lo consente, riduce ulteriormente la spesa.
Nessuna di queste ottimizzazioni appare nei materiali marketing dei provider. Emergono solo dall’esperienza operativa.
Cosa significa tutto questo per chi decide
Il cost per token non è una metrica tecnica da delegare agli sviluppatori. È un indicatore economico che determina la sostenibilità di ogni iniziativa AI.
Chi lo ignora si trova, come il CFO di quella sala riunioni lombarda, a rincorrere fatture che crescono senza spiegazione. Chi lo governa trasforma l’AI da centro di costo a leva competitiva.
I prossimi dodici mesi vedranno un’ulteriore compressione dei prezzi. I modelli diventeranno più efficienti, i provider più aggressivi. Ma il vantaggio non andrà a chi aspetta: andrà a chi oggi costruisce le competenze per misurare, confrontare, ottimizzare.
Il momento di iniziare non è domani. È adesso.
FAQ
Cos’è esattamente un token nel contesto dell’AI?
Un token è l’unità minima di testo elaborata da un modello linguistico. Può corrispondere a una parola, una sillaba o un carattere speciale. In italiano, una parola equivale mediamente a 1,3-1,5 token.
Come si calcola il cost per token di un progetto AI?
Si moltiplica il numero totale di token elaborati (input più output) per il prezzo unitario del provider. Il dato va poi confrontato con il valore generato dall’applicazione per valutare il ROI.
Perché il costo inferenza AI è sceso così rapidamente?
Tre fattori: hardware più efficiente (GPU di nuova generazione), ottimizzazione dei modelli (quantizzazione, distillazione) e aumento della competizione tra provider.
Quando conviene il self-hosting rispetto alle API cloud?
Generalmente sopra i 10-20 milioni di token giornalieri, ma il calcolo dipende da costi energetici locali, disponibilità di competenze e requisiti di latenza.
Come posso stimare il consumo di token prima di avviare un progetto?
Costruendo prototipi con dataset rappresentativi e misurando il consumo reale. I tokenizer dei principali provider sono disponibili gratuitamente per test preliminari.
Il prezzo per token è uguale per tutti i modelli?
No. Varia di oltre 100 volte tra modelli economici (come GPT-4o mini) e modelli premium (come Claude 3 Opus). La scelta del modello giusto per ogni task è cruciale.
Quali costi nascosti devo considerare nel budget progetti AI?
Oltre al cost per token: costi di integrazione, formazione del personale, monitoraggio, gestione degli errori, e potenziale lock-in con il provider scelto.
Come posso ridurre il costo inferenza AI senza cambiare provider?
Ottimizzando i prompt (più brevi e precisi), implementando caching per risposte ripetitive, usando modelli più leggeri per task semplici, e monitorando le query anomale che consumano token in eccesso.
