Tutti parlano di integrare l’IA nei propri prodotti. Pochi parlano della fattura che arriva a fine mese.
In Soamee abbiamo trascorso due anni a costruire funzionalità di IA per clienti di diversi settori: dai chatbot di supporto ai sistemi RAG per l’elaborazione di documenti legali. In quel tempo abbiamo imparato che il costo reale dell’esecuzione degli LLM in produzione ha ben poco a che fare con ciò che si immagina all’inizio. Le sorprese, quasi sempre, vanno nella direzione sbagliata.
Questo è l’articolo che avrei voluto avere quando abbiamo iniziato. Numeri reali, scenari concreti e strategie che funzionano davvero.
Prezzi dei token nel 2025-2026: la tabella che ti serve
Prima di parlare di scenari, dobbiamo avere chiari i prezzi base. I modelli rilevanti oggi in produzione sono questi:
| Modello | Input (per 1M token) | Output (per 1M token) | Contesto max. | Note |
|---|---|---|---|---|
| GPT-4o | $2,50 | $10,00 | 128K | Modello principale OpenAI |
| GPT-4o mini | $0,15 | $0,60 | 128K | Ideale per task semplici |
| o3-mini | $1,10 | $4,40 | 200K | Ragionamento, più lento |
| Claude Sonnet 4 | $3,00 | $15,00 | 200K | Miglior rapporto qualità/prezzo |
| Claude Haiku 3.5 | $0,80 | $4,00 | 200K | Economico e veloce |
| Claude Opus 4 | $15,00 | $75,00 | 200K | Capacità massima |
| Gemini 2.5 Pro | $1,25 | $10,00 | 1M | Cache di contesto aggressiva |
| Gemini 2.5 Flash | $0,075 | $0,30 | 1M | Ultra-economico |
| Llama 3.3 70B | ~$0,20-0,60 | ~$0,20-0,60 | 128K | Self-hosted o via Bedrock/Together |
Una precisazione importante: il prezzo per token è il costo dei token stessi generati o consumati. In produzione reale, il prompt di sistema (che si ripete a ogni chiamata), la cronologia della conversazione e il contesto RAG gonfiano enormemente il conteggio dei token in ingresso. Questo è l’errore più comune nelle stime dei costi.
Scenari reali: quanto costa esattamente?
Vediamo i numeri concreti per i quattro casi d’uso più comuni.
Scenario 1: Chatbot di assistenza clienti (1.000 query/giorno)
Parametri tipici:
- Prompt di sistema: 500 token (istruzioni, tono, FAQ base)
- Cronologia conversazione media: 800 token (4-5 turni)
- Query dell’utente: 100 token
- Risposta del modello: 300 token
Totale per chiamata: ~1.400 token di input + 300 token di output
| Modello | Costo/chiamata | Costo/giorno (1K chiamate) | Costo/mese |
|---|---|---|---|
| GPT-4o | $0,0064 | $6,40 | ~$192 |
| GPT-4o mini | $0,00039 | $0,39 | ~$12 |
| Claude Sonnet 4 | $0,0087 | $8,70 | ~$261 |
| Claude Haiku 3.5 | $0,0023 | $2,30 | ~$69 |
| Gemini 2.5 Flash | $0,000195 | $0,20 | ~$6 |
Per un chatbot semplice con volume basso-medio, GPT-4o mini, Claude Haiku o Gemini Flash sono opzioni perfettamente valide a costo minimo. La questione centrale è se la qualità delle risposte è sufficiente per il tuo caso d’uso.
Scenario 2: Elaborazione documenti (500 doc/giorno, ~5 pagine ciascuno)
I documenti cambiano radicalmente l’equazione. Una pagina A4 ha circa 400-500 parole, che corrispondono a circa 500-600 token.
Parametri:
- Documento di 5 pagine: ~2.500 token di input
- Prompt di istruzioni: 300 token
- Riassunto/estrazione generata: 500 token
Totale per documento: ~2.800 token di input + 500 token di output
| Modello | Costo/documento | Costo/giorno (500 doc) | Costo/mese |
|---|---|---|---|
| GPT-4o | $0,0120 | $6,00 | ~$180 |
| Claude Sonnet 4 | $0,0165 | $8,25 | ~$248 |
| Gemini 2.5 Pro | $0,0085 | $4,25 | ~$128 |
| Gemini 2.5 Flash | $0,00059 | $0,30 | ~$9 |
Per l’elaborazione di documenti dove la precisione è critica (contratti, documentazione medica, finanziaria), Claude Sonnet o GPT-4o giustificano il costo aggiuntivo. Per l’estrazione di dati strutturati da documenti più semplici, Gemini Flash offre un ROI imbattibile.
Scenario 3: Assistente di codice (200 sviluppatori attivi/giorno)
Un assistente di codice ha un profilo di token molto diverso: i frammenti di codice sono densi di token (il codice con la sua sintassi consuma più token per carattere rispetto al testo naturale).
Parametri stimati per sessione:
- Contesto di codice: 3.000 token
- Cronologia conversazione: 1.500 token
- Prompt di sistema: 400 token
- Risposta con codice: 800 token
- Media: 4 interazioni/sessione
Totale per sessione: ~23.600 token di input + 3.200 token di output
| Modello | Costo/sessione | Costo/giorno (200 dev) | Costo/mese |
|---|---|---|---|
| GPT-4o | $0,091 | $18,20 | ~$546 |
| Claude Sonnet 4 | $0,119 | $23,80 | ~$714 |
| Gemini 2.5 Pro | $0,062 | $12,40 | ~$372 |
Per gli assistenti di codice in team di medie dimensioni, il costo oscilla tra $370 e $714/mese a seconda del modello. Niente di esorbitante, ma c’è ampio margine di ottimizzazione con il caching del contesto del progetto.
Scenario 4: Sistema RAG (base documentale + 2.000 query/giorno)
I sistemi RAG aggiungono uno strato: il retrieval porta frammenti rilevanti da un database vettoriale che vengono inseriti nel prompt di ogni query.
Parametri:
- Frammenti recuperati: 3 chunk × 400 token = 1.200 token
- Prompt di sistema: 600 token
- Query dell’utente: 150 token
- Risposta generata: 400 token
Totale per query: ~1.950 token di input + 400 token di output
| Modello | Costo/query | Costo/giorno (2K query) | Costo/mese |
|---|---|---|---|
| GPT-4o | $0,0089 | $17,80 | ~$534 |
| Claude Sonnet 4 | $0,0122 | $24,40 | ~$732 |
| Gemini 2.5 Flash | $0,000267 | $0,53 | ~$16 |
| Llama 3.3 70B (self-hosted) | ~$0,0005 | ~$1,00 | ~$30 |
In RAG ad alto volume, la differenza tra modelli premium ed economici comincia a essere molto rilevante.
I costi nascosti che nessuno menziona
I token sono solo la punta dell’iceberg. In produzione reale, diverse categorie di costo vengono ignorate nelle stime iniziali:
Infrastruttura e osservabilità
- Database vettoriale: Pinecone parte da $70/mese per un indice piccolo. Weaviate Cloud o Qdrant hanno opzioni più economiche da $25/mese. Il self-hosted aggiunge costi di DevOps.
- Monitoring e tracciabilità: Strumenti come LangSmith (da $39/mese), Langfuse (open source con self-hosting) o Helicone (da $20/mese) sono indispensabili in produzione. Senza di essi, fare debug di un agente che fallisce è un incubo.
- API gateway e rate limiting: Gestire rate limit, retry e fallback richiede una soluzione SaaS o tempo di engineering.
Latenza e il suo costo indiretto
La latenza degli LLM è reale e ha un costo di business:
- GPT-4o: 500-1.500 ms tempo al primo token
- Claude Sonnet 4: 400-1.200 ms
- Gemini 2.5 Flash: 200-600 ms
- Llama 3.3 70B (self-hosted, buona GPU): 300-800 ms
Per interfacce utente conversazionali, una latenza superiore a 2 secondi ha un impatto diretto sulla soddisfazione dell’utente. Lo streaming mitiga la percezione, ma non il tempo di risposta reale.
Il costo indiretto: se hai worker che processano in batch e la latenza media è di 1 secondo per chiamata, per 100.000 chiamate/giorno hai bisogno di sufficiente concorrenza per evitare colli di bottiglia. Più concorrenza significa più infrastruttura.
Gestione degli errori e retry
Gli LLM falliscono. Le API di OpenAI e Anthropic hanno SLA di uptime elevati (>99,9%), ma in produzione con migliaia di chiamate giornaliere, gli errori si verificano. Un sistema robusto ha bisogno di:
- Logica di retry con exponential backoff
- Circuit breaker per evitare cascate di fallimenti
- Fallback a modelli alternativi quando il principale non è disponibile
Questo engineering ha un costo di sviluppo (tipicamente 2-4 settimane per farlo bene) e un costo infrastrutturale (se si mantiene ridondanza tra provider).
Costo delle chiamate fallite
Le chiamate che restituiscono errore, timeout o risposta non valida consumano comunque token (parzialmente) o tempo di compute in self-hosted. In un sistema mal ottimizzato, il 5-10% delle chiamate può essere “spreco”. Con 10.000 chiamate/giorno, si tratta di 500-1.000 chiamate/giorno di perdita netta.
Strategie di ottimizzazione: come ridurre la fattura del 40-70%
Dopo aver lavorato su diversi sistemi in produzione, queste sono le strategie che funzionano davvero:
1. Caching semantico (risparmio potenziale: 30-60%)
Il caching semantico va oltre il caching tradizionale delle risposte esatte. Invece di cercare corrispondenze esatte di stringhe, usa gli embedding per trovare query simili e riutilizzare la risposta se la similarità supera una soglia.
Implementazione tipica:
- Alla ricezione di una query, generare il suo embedding (costo: frazione di centesimo)
- Cercare nella cache di embedding se c’è qualcosa di simile (similarità coseno > 0,92)
- Se c’è un hit, restituire la risposta in cache senza chiamare l’LLM
- Se non c’è hit, chiamare l’LLM e memorizzare il risultato in cache
In chatbot con query ripetitive (supporto, FAQ), il tasso di hit può raggiungere il 40-60%. In sistemi RAG con domande più diverse, il 15-25%. Strumenti come GPTCache o implementazioni proprie su Redis sono opzioni valide.
2. Routing dei modelli (risparmio potenziale: 40-70%)
Non tutte le query necessitano dello stesso modello. Un sistema di routing classifica la complessità di ogni query e la invia al modello appropriato:
- Query semplice (“Qual è l’orario?”) → Gemini Flash o GPT-4o mini
- Query media (“Spiegami le condizioni del contratto”) → Claude Haiku o GPT-4o mini
- Query complessa (“Analizza questi tre contratti e dammi le differenze principali”) → Claude Sonnet o GPT-4o
Il classificatore può essere un altro LLM piccolo (costo minimo) o un classificatore tradizionale addestrato con esempi del tuo dominio. In sistemi con distribuzione tipica delle query (70% semplici, 20% medie, 10% complesse), il risparmio è enorme.
3. Ottimizzazione dei prompt (risparmio potenziale: 20-40%)
Il prompt di sistema è uno dei principali colpevoli dell’inflazione dei token. Abbiamo visto prompt di 2.000-3.000 token che potevano essere ridotti a 400-600 senza perdere efficacia. Alcune tecniche:
- Eliminare ridondanze: “Sei un assistente di supporto clienti professionale e cordiale che risponde sempre in modo educato e professionale” → “Assistente di supporto. Tono: professionale e diretto.”
- Usare strutture compatte: Liste invece di paragrafi, YAML invece di testo descrittivo
- Spostare informazioni statiche nel context caching (Anthropic e Google offrono prezzi ridotti per prompt in cache usati in molte chiamate)
Il context caching di Anthropic addebita il prompt di sistema a prezzo ridotto (~$0,30/1M token vs $3,00/1M su Sonnet) quando viene usato in più chiamate consecutive. Per un prompt di sistema di 1.000 token con 10.000 chiamate/giorno, il risparmio è sostanziale.
4. Batching e processing asincrono
Per task che non richiedono risposta in tempo reale (elaborazione documenti, generazione report, analisi), il processing in batch consente di:
- Usare la Batch API di OpenAI (50% di sconto in cambio di latenza fino a 24h)
- Ottimizzare l’uso delle GPU in self-hosted evitando sottoutilizzo
- Gestire meglio i rate limit senza infrastruttura aggiuntiva di code
Per 500 documenti/giorno senza necessità di risultato immediato, la Batch API di OpenAI dimezza la fattura.
5. Ottimizzazione del contesto in RAG
Nei sistemi RAG, quante informazioni di contesto vengono passate all’LLM è critico:
- Retrieval preciso: Migliorare la qualità del retrieval per recuperare solo i chunk più rilevanti (3 buoni chunk > 10 mediocri)
- Chunking ottimizzato: Chunk più piccoli e precisi riducono i token senza sacrificare la qualità
- Reranking: Un modello di reranking economico (es: Cohere Rerank) migliora la selezione dei chunk prima di passarli all’LLM
Self-hosted vs API: quando ha senso ciascuna opzione
La domanda che ci viene posta più spesso: “Non sarebbe più economico hostare il modello noi stessi?”
La risposta onesta: dipende, ma per la maggior parte delle aziende l’API commerciale vince fino a volumi elevati.
Costi del self-hosting (Llama 3.3 70B come riferimento)
Per eseguire Llama 3.3 70B con performance di produzione hai bisogno di:
- GPU necessaria: Minimo 2× A100 80GB o equivalente per buona throughput
- Costo su AWS: p4d.24xlarge (
$32/ora) o g5.48xlarge ($16/ora) - Istanza dedicata 24/7: $32 × 24 × 30 = ~$23.000/mese (AWS on-demand)
- Con Reserved Instances (1 anno): Può scendere a ~$11.000-14.000/mese
- Alternativa spot: Possibile, ma l’instabilità in produzione richiede gestione aggiuntiva
Alternative di self-hosting più economiche:
- RunPod o Lambda Labs: $2-4/ora per A100, contro $8-16 su AWS. Per carichi intermittenti, molto più conveniente.
- Ollama + server proprio: Per volumi molto bassi o uso interno, un server con 2× RTX 4090 (costo ~$3.000) può ammortizzarsi in 6-12 mesi se il volume lo giustifica.
Punto di pareggio
Il break-even tra API e self-hosting (assumendo RunPod a $3/ora per Llama 70B equivalente a Claude Haiku in qualità):
- RunPod 24/7: ~$2.160/mese
- Equivalente Claude Haiku: $0,0023/chiamata × N chiamate/mese
Break-even: 2.160 / 0,0023 ≈ 940.000 chiamate/mese (~31.000 chiamate/giorno)
Al di sotto di quel volume, l’API commerciale è più economica quando si conta il costo reale del self-hosting (infrastruttura, DevOps, aggiornamenti dei modelli, monitoraggio). Al di sopra, il self-hosting comincia ad avere senso finanziario.
Ci sono casi in cui il self-hosting vince indipendentemente dal volume:
- Dati altamente sensibili che non possono uscire dalla tua infrastruttura (sanità, finanza regolamentata)
- Latenza ultra-bassa dove i millisecondi contano e hai la GPU vicina all’utente
- Fine-tuning intensivo dove hai bisogno di un modello altamente specializzato nel tuo dominio
Il costo reale di un progetto di IA completo
Per dare una prospettiva più completa, questi sono i range tipici di costo totale (non solo token) per diversi tipi di progetti:
Chatbot di supporto base (1.000 query/giorno):
- Token: $12-240/mese in base al modello
- Infrastruttura (hosting, DB vettoriale): $50-100/mese
- Monitoring: $20-40/mese
- Totale: $80-380/mese
Sistema RAG dipartimentale (500 utenti, base di 10K documenti):
- Token: $200-800/mese
- Vector DB (Pinecone o simile): $70-200/mese
- Infrastruttura aggiuntiva: $100-200/mese
- Monitoring e osservabilità: $40-80/mese
- Totale: $410-1.280/mese
Agente IA con integrazioni (200 utenti attivi, strumenti multipli):
- Token: $500-2.000/mese (gli agenti consumano più token per i tool call)
- Infrastruttura: $200-500/mese
- Monitoring avanzato: $80-150/mese
- Totale: $780-2.650/mese
Questi range assumono architetture ottimizzate. Senza ottimizzazione, i costi possono essere 2-3× più alti.
Conclusione: l’IA è conveniente se progettata bene
L’IA in produzione non è economica se fatta male, ma non è nemmeno proibitiva se progettata con criterio. Le differenze tra un’implementazione ingenua e una ottimizzata possono essere di 5-10× in termini di costi.
I principi che applico a ogni progetto:
- Iniziare con il modello più economico che risolve il problema. Scalare a uno più potente solo quando c’è evidenza che ne hai bisogno.
- Misurare tutto dal primo giorno: token per chiamata, tasso di errore, latenza, costo per utente. Senza metriche, non puoi ottimizzare.
- Implementare il caching fin dall’inizio, non come miglioramento successivo. È l’ottimizzazione ad alto impatto.
- Preventivare l’infrastruttura oltre ai token: l’errore più comune nelle stime iniziali.
- Rivedere la fattura mensilmente e correlarla con l’uso reale. I picchi di costo di solito rivelano bug o utilizzo inatteso.
Se stai valutando di integrare l’IA nel tuo prodotto o processo e vuoi una stima onesta adattata al tuo caso d’uso, in Soamee facciamo esattamente questo. Puoi consultare i nostri servizi di IA o contattarci direttamente.
Potrebbe interessarti anche il nostro articolo su come costruire un agente IA personalizzato con LLM per l’assistenza clienti se hai già chiaro il caso d’uso e vuoi capire l’architettura.