Che cos'è davvero un LLM — e come misurarlo con Artificial Analysis
Tradotto dall'originale in spagnolo. Leggi in spagnolo
C’è molto vocabolario cognitivo attorno a questi sistemi. Intelligenza, ragionamento, comprensione. E sì, i risultati sono impressionanti. Ma il vocabolario non è neutro: crea aspettative su come funziona il sistema, su come fallisce e su quali garanzie offre. Poi porti quelle aspettative in produzione, ed è lì che nascono i problemi.
Ecco come intendo il meccanismo: i concetti di base (LLM, MCP, AGI), cosa succede davvero dentro un transformer e cosa uso per misurare invece di discutere. Per quest’ultima parte mi affido ad Artificial Analysis, la fonte che consulto più spesso.

Tre termini che non sono sullo stesso piano
LLM, MCP e AGI compaiono di continuo nello stesso paragrafo, ma non sono lo stesso tipo di cosa. Uno è un tipo di modello, un altro è un protocollo, il terzo è un’ipotesi senza una definizione operativa.
LLM (Large Language Model). Un modello preaddestrato su grandi volumi di testo con l’obiettivo di prevedere il token successivo. Quel preaddestramento, però, è solo una parte del processo: i modelli attuali passano anche per un fine-tuning supervisionato, un’ottimizzazione basata sulle preferenze e il reinforcement learning. Al suo interno non c’è un database di fatti interrogabile né, nell’architettura di base, un motore di inferenza simbolica. La conoscenza è distribuita nei parametri.
MCP (Model Context Protocol). Uno standard aperto per collegare i modelli a strumenti e fonti di dati. Un server MCP espone tools, resources e prompts tramite un’interfaccia uniforme, e qualsiasi client compatibile li usa senza un’integrazione specifica. Sostituisce l’integrazione puntuale con un connettore comune. Cosa non è: un requisito per costruire un agent. Un sistema agentico può funzionare altrettanto bene con API dirette, function calling proprietario o browser automation. MCP porta interoperabilità, non agentività.
AGI (Artificial General Intelligence). Un sistema in grado di risolvere compiti intellettuali arbitrari con trasferimento tra domini. Il problema è che non esiste una definizione operativa condivisa né un test concordato. Ogni organizzazione ha la sua, e diverse sono convenientemente legate alla propria roadmap. Finché non specifichi i criteri in anticipo, il termine aggiunge poco.
Il meccanismo: dai token a una distribuzione
Prima dei passaggi, cos’è un transformer. È l’architettura di rete neurale su cui sono costruiti tutti questi modelli — è comparsa nel 2017, in Attention Is All You Need, e ha soppiantato le architetture ricorrenti che elaboravano il testo posizione per posizione. Il suo contributo è il meccanismo di attention: ogni posizione della sequenza guarda tutte le altre e pondera quali contano per prevedere ciò che viene dopo. Questo lo ha reso parallelizzabile e quindi addestrabile alla scala attuale. La T di GPT sta per transformer.
L’inferenza di un transformer si può descrivere in cinque passaggi.
- Tokenizzazione — il testo viene suddiviso in token e ognuno diventa un indice intero. Il modello non vede mai lettere né parole: vede indici.
- Embedding — ogni indice viene proiettato in un vettore ad alta dimensionalità. Questa rappresentazione non è statica: negli strati successivi si trasforma in base al contesto. La semantica non risiede nella vicinanza tra gli embedding iniziali, ma è distribuita nello spazio di rappresentazione.
- Strati di attention — decine o centinaia di strati in cui ogni posizione combina informazioni dalle altre, tramite operazioni matriciali su queries, keys e values.
- Proiezione sul vocabolario — l’ultimo strato produce un vettore di logit, uno per ogni token del vocabolario. Un softmax lo normalizza in una distribuzione di probabilità.
- Decodifica — il token successivo viene scelto con una strategia di decoding, che può essere stocastica (sampling con temperature o top-p) o deterministica. Viene aggiunto al contesto e il processo si ripete per intero per la posizione successiva.
L’addestramento è consistito nel regolare i parametri con la discesa del gradiente per minimizzare l’errore di previsione su un corpus. Nel modello base non c’è alcun passaggio che verifichi un fatto rispetto a una fonte. Se una risposta risulta corretta, è perché la continuazione corretta aveva un’alta probabilità. Ed ecco la distinzione più trascurata: il sistema che costruisci attorno, invece, può verificare — ricerca, esecuzione di codice, interrogazione di un database. È una proprietà del sistema, non del modello.
Cosa cambia nei modelli frontier
Quei cinque passaggi sono lo schema di base. I modelli frontier funzionano sugli stessi principi ma con architetture molto più avanzate del transformer del 2017: gli strati feed-forward densi sono spesso Mixture of Experts, in cui un router attiva solo un sottoinsieme di parametri per token; la multi-head attention classica ha lasciato il posto a varianti come la Grouped-Query Attention o la Multi-head Latent Attention, per ridurre il costo sulle sequenze lunghe e la dimensione della KV cache; e alcuni modelli alternano blocchi di state-space model a pochi strati di attention completa.
Ciò che nessuno ha programmato
Il risultato che conta è che una procedura del genere produca un testo coerente a livello di discorso. Sintassi valida. Argomentazioni che reggono per diversi paragrafi. Codice che compila e fa quello che dice.
Nessuno ha codificato regole grammaticali né vincoli di coerenza del discorso. È emerso come sottoprodotto dell’ottimizzazione di una previsione statistica su larga scala. E ammette due letture: una sulla capacità di un approssimatore statistico di grandi dimensioni, l’altra su quanta regolarità strutturale avesse il linguaggio naturale — che si è rivelata maggiore di quanto pensassimo.
Perché il vocabolario conta in produzione
Il problema non è usare termini funzionali per descrivere un comportamento. Il problema è dare per scontate proprietà che la fluidità non garantisce: comprensione in senso umano, veridicità, tracciabilità causale, o l’idea che una serie di risposte corrette implichi una conoscenza affidabile del dominio. Niente di tutto ciò deriva dal meccanismo.
Trovo più utile considerarli sistemi probabilistici ad alta complessità. Questa caratterizzazione spiega i comportamenti che condizionano qualsiasi design in produzione:
- Le hallucination sono una modalità di errore intrinseca, non un bug — la distribuzione ottimizza la plausibilità della continuazione, non la veridicità. Per questo il risultato può essere convincente e fattualmente sbagliato anche quando l’informazione rilevante è nel contesto.
- La sicurezza espressa non è, da sola, una misura affidabile dell’accuratezza — il tono assertivo è uno schema stilistico appreso dal corpus. I modelli possono essere mal calibrati, anche se la calibrazione si può misurare e migliorare.
- La variabilità dipende dal decoding — con un decoding stocastico, lo stesso input può produrre output diversi. Nei sistemi reali varia anche in base allo stato degli strumenti o dell’ambiente.
- Le prestazioni peggiorano fuori distribuzione — alcuni tipi di distribution shift producono comportamenti particolarmente fragili, anche se il peggioramento non è sempre brusco. È la zona in cui conviene di più avere guardrail.
Il reasoning non è un nuovo modulo
I modelli di reasoning rendono sensibilmente meglio sui compiti difficili, e da qui si salta alla conclusione che incorporino un processo inferenziale di natura diversa. Conviene distinguere tre livelli: la generazione del modello, il suo addestramento e il sistema completo che lo circonda.
Questi modelli sono ottimizzati per dedicare più calcolo prima di rispondere, in diversi casi tramite reinforcement learning su catene di ragionamento. La sequenza intermedia viene generata con la stessa procedura autoregressiva descritta sopra: nel modello non compare alcun modulo logico né un verificatore simbolico. Il sistema completo, invece, può includere strumenti, ricerca o verificatori. Ciò che si osserva è che generare quel testo intermedio condiziona il modello sul proprio output e sposta la distribuzione finale verso regioni in cui le risposte corrette sono più probabili. In termini pratici: più calcolo in fase di inferenza.
Ed ecco la parte scomoda per chiunque abbia bisogno di tracciabilità. Ci sono prove che la catena intermedia non sempre riflette il processo che ha determinato la risposta — il modello può produrre una giustificazione plausibile che non corrisponde ai fattori che l’hanno davvero influenzata. La catena è testo generato. Non conviene prenderla automaticamente come una registrazione causale fedele né come una traccia di esecuzione completa.
Artificial Analysis: misurare invece di discutere
Se il comportamento di questi sistemi è statistico, scegliere un modello o un provider è una decisione che richiede dati. Artificial Analysis è un sito indipendente che esegue le proprie valutazioni su modelli, provider e agent e pubblica i risultati in un formato confrontabile. Queste sono le sezioni che uso di più.
Intelligence Index
Un indice composito invece di un benchmark singolo. La v4.3 aggrega dieci valutazioni: AA-Briefcase, GDPval-AA v2, AutomationBench-AA, Terminal-Bench v4.0, SciCode, Humanity’s Last Exam, GDP.pdf, CritPt, AA-Omniscience e AA-LCR. Il vantaggio di un indice composito è che riduce il rischio di overfitting: ottimizzare per dieci valutazioni eterogenee è molto più difficile che per una sola.
Cost per Task e Time per Task
È la vista che ha cambiato di più il mio modo di confrontare. Invece del prezzo per milione di token, calcolano quanto costa e quanto tempo richiede risolvere un compito completo dell’indice, compreso il consumo di token — anche i reasoning token, quando il modello li espone. La differenza è concreta: un modello con un prezzo per token basso può avere un costo per compito alto se consuma molti reasoning token. Il grafico a dispersione di Intelligence Index contro Cost per Task, con la sua frontiera di Pareto, permette di individuare le opzioni non dominate per il livello di qualità che ti serve.
Benchmark agentici
Oltre all’indice, pubblicano valutazioni specializzate del lavoro agentico. Non vanno confuse con le dieci componenti della v4.3 — alcune fanno parte dell’indice, altre vengono pubblicate a parte. È la categoria cresciuta di più e la più pertinente se il tuo sistema esegue compiti invece di rispondere a domande:
- AA-Briefcase — knowledge work a lungo orizzonte: produrre fogli di calcolo, presentazioni e memo all’interno di workflow aziendali.
- GDPval-AA — compiti con un reale valore economico in diverse professioni, con un Elo ancorato a una baseline umana di 1.000. Misurare la distanza rispetto a una persona è un riferimento impegnativo.
- AutomationBench-AA ed EnterpriseOps-Gym-AA — workflow su applicazioni SaaS e operazioni aziendali.
- Terminal-Bench — uso agentico del terminale e coding end-to-end.
- APEX-Agents-AA — lungo orizzonte, dove l’accumulo di errori tra un passaggio e l’altro è il principale fattore di fallimento.
- ITBench-AA — root-cause analysis di incidenti su Kubernetes. Particolarmente pertinente se lavori in IT ops.
- AA-AnalystAgent — analisi quantitativa su fogli di calcolo e documenti, riportata come pass^5: la quota di compiti risolti correttamente in tutte e cinque le esecuzioni. È riproducibilità, non capacità massima. Serve a valutare la robustezza di un’automazione, anche se da sola non ti dice se puoi eliminare la supervisione umana.
Coding Agent Index
È separato dalla classifica dei modelli, e a ragione: un agent è modello + scaffold + strumenti, e lo scaffold conta. La v1.5 combina DeepSWE, Terminal-Bench e SWE-Atlas-QnA e riporta anche costo per compito e tempo di esecuzione. C’è inoltre una tabella comparativa di agent per il lavoro generale — Claude Cowork, ChatGPT Work, Microsoft Copilot Cowork, Manus, OpenClaw, Hermes Agent, Gemini Enterprise, tra gli altri — con piattaforma, se è open source, se supporta il bring-your-own-model, accesso ai file locali, browser automation e prezzo.
