
Quanto costa una richiesta AI? Abbiamo misurato 9 operazioni
La versione breve: il 30 luglio 2026 abbiamo eseguito nove tipi di richieste tramite Google Vertex AI e registrato il conteggio dei token direttamente dalle risposte API. Il risultato principale: leggere è economico per un'AI, creare è costoso, e il divario raggiunge un fattore mille. Guardare un video YouTube di dieci minuti costa due centesimi. Generare otto secondi di video costa tre dollari e venti. Stessa tecnologia, stessa fattura, ma operazioni di natura completamente diversa — e non puoi pianificare un budget senza capire questa differenza.
Come l'abbiamo misurato
Non da calcolatori su pagine di marketing e non da promesse di blog dei fornitori. Ogni richiesta è andata a Vertex AI sull'account di servizio del nostro progetto, e da ogni risposta abbiamo preso il blocco usageMetadata — dove il modello stesso riporta quanti token è costato il tuo input e quanti la sua risposta.
Poi abbiamo moltiplicato per i prezzi pubblicati da Google al 30 luglio 2026 per la famiglia Gemini 2.5 Flash-Lite: $0.10 per milione di token di input (testo, immagini, video), $0.30 per milione di token di input audio e $0.40 per milione di token di output. I prezzi di generazione video provengono dall'elenco Veo 3.1: $0.40 al secondo in modalità standard.
Il metodo è importante perché ti permette di ripeterlo: gli stessi numeri si trovano nella risposta a qualsiasi richiesta tu faccia, se guardi usageMetadata.
La tabella: cosa costa cosa
| Operazione | Cosa succede | Costo per esecuzione |
|---|---|---|
| Una domanda di testo | ~300 token in input, ~500 in output | $0.0003 |
| Leggere una foto | immagine più una breve risposta | $0.001 |
| Trascrivere 30s di parlato | l'audio costa tre volte il testo | $0.0008 |
| Leggere un paragrafo ad alta voce | sintesi vocale | $0.0006 |
| Guardare un video di 3 minuti | 51k token | $0.006 |
| Guardare un video di 10 minuti | 171k token | $0.02 |
| Generare un'immagine | 1.290 token di output | $0.04 |
| 8s di video, modalità veloce | fatturato al secondo | $0.64 |
| 8s di video, modalità standard | fatturato al secondo | $3.20 |
Il risultato: guardare è più economico che creare
Confronta due righe. Analizzare un video di dieci minuti di qualcun altro: due centesimi. Generare otto secondi del tuo: tre dollari e venti. Questo è 160 volte di più per settantacinque volte meno secondi.
Il motivo è come funziona la fatturazione. Tutto ciò che invii al modello sono token di input — la cosa più economica nell'elenco prezzi. Tutto ciò che produce è output, e l'output costa diverse volte di più. Con Flash-Lite, l'input è $0.10 per milione e l'output è $0.40 — quattro volte. La generazione di immagini e video viene fatturata di nuovo separatamente, con tariffe completamente diverse.
Da qui la regola che fa risparmiare di più: accorcia la risposta, non la domanda. Una frase che dice «rispondi in un paragrafo» riduce la tua fattura più di quanto dimezzare la tua domanda. La frase più costosa che puoi scrivere a un modello è «spiega in dettaglio, con tutti gli esempi».
Video, secondo per secondo
L'abbiamo misurato separatamente tagliando un clip a diverse lunghezze. Il modello conta il video come 258 token per secondo di filmato e 25 token per secondo di audio. La relazione è strettamente lineare — cinque secondi hanno dato 1.290 token, dieci secondi hanno dato esattamente 2.580.
| Durata | Token | Costo per analizzare |
|---|---|---|
| 5 secondi | 1.415 | $0.0002 |
| 1 minuto | 17.000 | $0.002 |
| 5 minuti | 85.000 | $0.010 |
| 10 minuti | 171.000 | $0.020 |
Cosa significa in pratica: analizzare video non è un lusso. Estrarre il succo da una lezione di un'ora costa circa dodici centesimi. Il tuo tempo per inquadrare il compito costerà di più.
Perché devi comunque fare i conti
Una singola richiesta costa una frazione di centesimo, il che crea l'impressione che non ci sia nulla da contare. Questa impressione è sbagliata per due motivi.
Primo: una conversazione diventa più costosa a ogni messaggio. Il modello non ricorda i turni precedenti — affinché segua il contesto, l'intero scambio viene inviato di nuovo a ogni richiesta. Il tuo decimo messaggio si porta dietro i nove precedenti, e tutti contano di nuovo come input. Tu continui a scrivere risposte ugualmente brevi mentre la fattura aumenta da sola.
Secondo: alcune lingue costano circa il doppio dell'inglese. Il modello non conta né lettere né parole ma token — blocchi di testo. L'inglese si divide in blocchi più grandi: un token è circa quattro caratteri lì, mentre in molte altre lingue è più vicino a due. Lo stesso pensiero costa una volta e mezzo o due volte di più.
Cosa farci
- Limita esplicitamente la lunghezza della risposta. «Tre frasi», «un paragrafo», «un elenco di cinque» — questo è un risparmio diretto, non una pignoleria stilistica.
- Inizia una nuova chat per un nuovo compito. Un thread lungo e tutto-in-uno costa di più di una nuova chat con la stessa domanda — e funziona meglio, perché il contesto obsoleto smette di intralciare.
- Non generare ciò che puoi trovare. Leggere un clip o un documento esistente è quasi sempre più economico che crearne uno tuo.
- Per prompt tecnici lunghi, prova l'inglese. Non si tratta solo del prezzo: i modelli hanno imparato principalmente da testi in inglese e seguono un brief in inglese con maggiore precisione.
Le avvertenze, senza le quali i numeri mentono
Abbiamo misurato un modello — Gemini 2.5 Flash-Lite — su un solo cloud. Modelli più potenti costano diverse volte di più; i concorrenti hanno i loro listini prezzi. Ciò che vale ovunque è l'ordine di grandezza e, cosa più importante, il rapporto tra le operazioni: l'input è più economico dell'output, leggere è più economico che creare.
Secondo: le tariffe cambiano. I nostri dati sono aggiornati al 30 luglio 2026. Controlla il prezzo sulla pagina dei prezzi del fornitore piuttosto che negli articoli — incluso questo.
FAQ
Quanto costa una richiesta ChatGPT o Gemini a un utente?
Abbonamento chat: limiti in richieste, non denaro. Accesso API: paghi per token. Esempi: $0.0003 testo, $0.001 foto, $0.04 immagine generata.
Perché generare un'immagine costa più di leggere dieci foto?
Sono operazioni diverse. Leggere un'immagine (input) costa $0.001, creare un'immagine (output) $0.04. L'output è 40 volte più caro.
Quanto costa far analizzare un video YouTube a un'AI?
Misurato il 30 luglio 2026 con Gemini 2.5 Flash-Lite: un video di 10 minuti costa circa $0.02. Un'ora di video costa circa dodici centesimi.
È vero che la generazione video costa dollari al secondo?
Sì. Veo 3.1 è fatturato al secondo: $0.40/s in standard, da $0.05 in lite. Un clip di 8 secondi costa $3.20, più di 150 ore di analisi video.
Come tagliare i costi AI senza perdere qualità?
Tre abitudini: 1. Limita la risposta (output 4x input). 2. Nuova chat per nuovo compito. 3. Non generare ciò che puoi trovare e leggere.
Perché il testo in alcune lingue costa più dell'inglese?
Il modello non conta né lettere né parole, ma token — frammenti di testo. L'inglese si divide in frammenti più grandi: circa quattro caratteri per token, contro circa due in molte altre lingue. Lo stesso concetto richiede da una volta e mezzo a due volte più token, e costa proporzionalmente di più.
Dove posso vedere quanti token ha usato la mia richiesta?
La risposta dell'API contiene un blocco usageMetadata dove il modello riporta i conteggi dei token di input e output, suddivisi per modalità: text, image, video, audio. Ogni dato in questo articolo proviene da lì, e puoi ripetere la misurazione sulle tue richieste.