Ce qu'est vraiment un LLM — et comment le mesurer avec Artificial Analysis
Traduit de l'original en espagnol. Lire en espagnol
Il y a beaucoup de vocabulaire cognitif autour de ces systèmes. Intelligence, raisonnement, compréhension. Et oui, les résultats sont impressionnants. Mais ce vocabulaire n’est pas neutre : il installe des attentes sur la façon dont le système fonctionne, sur ses modes d’échec et sur les garanties qu’il offre. Ensuite, vous emportez ces attentes en production, et c’est là que les problèmes apparaissent.
Voici comment je comprends le mécanisme : les notions de base (LLM, MCP, AGI), ce qui se passe vraiment dans un transformer, et ce que j’utilise pour mesurer au lieu de débattre. Pour ce dernier point, je m’appuie sur Artificial Analysis, la source que je consulte le plus souvent.

Trois termes qui ne sont pas au même niveau
LLM, MCP et AGI apparaissent tout le temps dans le même paragraphe, et ce ne sont pas des choses de même nature. L’un est un type de modèle, l’autre un protocole, le troisième une hypothèse sans définition opérationnelle.
LLM (Large Language Model). Un modèle pré-entraîné sur de grands volumes de texte avec un objectif de prédiction du token suivant. Ce pré-entraînement n’est toutefois qu’une partie du processus : les modèles actuels passent aussi par un ajustement supervisé, une optimisation par préférences et du reinforcement learning. Il n’y a pas, à l’intérieur, de base de faits interrogeable ni, dans l’architecture de base, de moteur d’inférence symbolique. La connaissance est répartie dans les paramètres.
MCP (Model Context Protocol). Un standard ouvert pour connecter des modèles à des outils et à des sources de données. Un serveur MCP expose des tools, des resources et des prompts via une interface uniforme, et n’importe quel client compatible les consomme sans intégration spécifique. Il remplace l’intégration ponctuelle par un connecteur commun. Ce qu’il n’est pas : une condition pour construire un agent. Un système agentique peut fonctionner tout aussi bien avec des API directes, du function calling propriétaire ou de la browser automation. MCP apporte l’interopérabilité, pas l’agentivité.
AGI (Artificial General Intelligence). Un système capable de résoudre des tâches intellectuelles arbitraires avec transfert entre domaines. Le problème, c’est qu’il n’existe ni définition opérationnelle consensuelle ni test convenu. Chaque organisation a la sienne, et plusieurs sont opportunément liées à leur propre roadmap. Tant que vous ne précisez pas les critères à l’avance, le terme n’apporte pas grand-chose.
Le mécanisme : des tokens à une distribution
Avant les étapes, ce qu’est un transformer. C’est l’architecture de réseau neuronal sur laquelle reposent tous ces modèles — elle est apparue en 2017, dans Attention Is All You Need, et a supplanté les architectures récurrentes qui traitaient le texte position par position. Son apport est le mécanisme d’attention : chaque position de la séquence regarde toutes les autres et pondère celles qui comptent pour prédire la suite. Cela l’a rendu parallélisable, et donc entraînable à l’échelle actuelle. Le T de GPT, c’est pour transformer.
L’inférence d’un transformer peut se décrire en cinq étapes.
- Tokenisation — le texte est découpé en tokens et chacun devient un indice entier. Le modèle ne voit jamais de lettres ni de mots : il voit des indices.
- Embeddings — chaque indice est projeté dans un vecteur de grande dimension. Cette représentation n’est pas statique : dans les couches suivantes, elle se transforme selon le contexte. La sémantique ne réside pas dans la proximité entre les embeddings initiaux, mais est répartie dans l’espace de représentation.
- Couches d’attention — des dizaines ou des centaines de couches où chaque position combine des informations provenant des autres, au moyen d’opérations matricielles sur les queries, keys et values.
- Projection sur le vocabulaire — la dernière couche produit un vecteur de logits, un par token du vocabulaire. Un softmax le normalise en distribution de probabilité.
- Décodage — le token suivant est choisi selon une stratégie de decoding, qui peut être stochastique (sampling avec temperature ou top-p) ou déterministe. Il est ajouté au contexte et le processus se répète intégralement pour la position suivante.
L’entraînement a consisté à ajuster les paramètres par descente de gradient pour minimiser l’erreur de prédiction sur un corpus. Dans le modèle de base, aucune étape ne vérifie un fait auprès d’une source. Si une réponse est juste, c’est parce que la bonne continuation avait une forte probabilité. Et voici la distinction que l’on néglige le plus : le système que vous construisez autour, lui, peut vérifier — recherche, exécution de code, requête sur une base. C’est une propriété du système, pas du modèle.
Ce qui change dans les modèles frontier
Ces cinq étapes constituent le schéma de base. Les modèles frontier reposent sur les mêmes principes, mais avec des architectures nettement plus avancées que le transformer de 2017 : les couches feed-forward denses sont souvent des Mixture of Experts, où un router n’active qu’un sous-ensemble de paramètres par token ; la multi-head attention classique a cédé la place à des variantes comme la Grouped-Query Attention ou la Multi-head Latent Attention, pour réduire le coût sur les longues séquences et la taille du KV cache ; et certains modèles intercalent des blocs de state-space models avec quelques couches d’attention complète.
Ce que personne n’a programmé
Le résultat qui compte, c’est qu’une telle procédure produise un texte cohérent au niveau du discours. Une syntaxe valide. Une argumentation qui tient sur plusieurs paragraphes. Du code qui compile et fait ce qu’il annonce.
Personne n’a codé de règles de grammaire ni de contraintes de cohérence du discours. Cela a émergé comme sous-produit de l’optimisation d’une prédiction statistique à grande échelle. Et cela admet deux lectures : l’une sur la capacité d’un approximateur statistique de très grande taille, l’autre sur la quantité de régularité structurelle que contenait le langage naturel — bien plus que nous ne le pensions.
Pourquoi le vocabulaire compte en production
Le problème n’est pas d’utiliser des termes fonctionnels pour décrire un comportement. Le problème, c’est de tenir pour acquises des propriétés que la fluidité ne garantit pas : une compréhension au sens humain, la véracité, la traçabilité causale, ou l’idée qu’un historique de bonnes réponses implique une connaissance fiable du domaine. Rien de tout cela ne découle du mécanisme.
Je trouve plus utile de les considérer comme des systèmes probabilistes de haute complexité. Cette caractérisation explique les comportements qui conditionnent toute conception en production :
- Les hallucinations sont un mode d’échec inhérent, pas un bug — la distribution optimise la plausibilité de la continuation, pas la véracité. C’est pourquoi le résultat peut être convaincant et factuellement faux, même lorsque l’information pertinente se trouve dans le contexte.
- La confiance exprimée n’est pas, à elle seule, une mesure fiable de l’exactitude — le ton assuré est un motif stylistique appris du corpus. Les modèles peuvent être mal calibrés, même si la calibration peut être mesurée et améliorée.
- La variabilité dépend du décodage — avec un decoding stochastique, une même entrée peut produire des sorties différentes. Dans les systèmes réels, elle varie aussi selon l’état des outils ou de l’environnement.
- Les performances se dégradent hors distribution — certains types de distribution shift produisent des comportements particulièrement fragiles, même si la dégradation n’est pas toujours brutale. C’est là que les guardrails sont le plus utiles.
Le reasoning n’est pas un nouveau module
Les modèles de reasoning obtiennent des résultats nettement meilleurs sur les tâches difficiles, et l’on en déduit trop vite qu’ils intègrent un processus inférentiel d’une autre nature. Il vaut mieux distinguer trois niveaux : la génération du modèle, son entraînement et le système complet qui l’entoure.
Ces modèles sont optimisés pour consacrer plus de calcul avant de répondre, dans plusieurs cas grâce au reinforcement learning sur des chaînes de raisonnement. La séquence intermédiaire est générée avec la même procédure autorégressive que celle décrite plus haut : aucun module logique ni vérificateur symbolique n’apparaît dans le modèle. Le système complet, lui, peut intégrer des outils, de la recherche ou des vérificateurs. Ce que l’on observe, c’est que générer ce texte intermédiaire conditionne le modèle sur sa propre sortie et déplace la distribution finale vers des régions où les bonnes réponses sont plus probables. Concrètement : plus de calcul à l’inférence.
Et voici la partie inconfortable pour quiconque a besoin de traçabilité. Des éléments montrent que la chaîne intermédiaire ne reflète pas toujours le processus qui a déterminé la réponse — le modèle peut produire une justification plausible qui ne correspond pas aux facteurs qui l’ont réellement influencé. La chaîne est du texte généré. Il ne faut pas la considérer d’office comme un enregistrement causal fidèle ni comme une trace d’exécution complète.
Artificial Analysis : mesurer au lieu de débattre
Si le comportement de ces systèmes est statistique, choisir un modèle ou un provider est une décision qui exige des données. Artificial Analysis est un site indépendant qui mène ses propres évaluations de modèles, de providers et d’agents et publie les résultats dans un format comparable. Voici les sections que j’utilise le plus.
Intelligence Index
Un indice composite plutôt qu’un benchmark unique. La v4.3 agrège dix évaluations : AA-Briefcase, GDPval-AA v2, AutomationBench-AA, Terminal-Bench v4.0, SciCode, Humanity’s Last Exam, GDP.pdf, CritPt, AA-Omniscience et AA-LCR. L’avantage d’un indice composite est de réduire le risque de surapprentissage : optimiser pour dix évaluations hétérogènes est bien plus difficile que pour une seule.
Cost per Task et Time per Task
C’est la vue qui a le plus changé ma façon de comparer. Au lieu du prix par million de tokens, ils calculent combien coûte et combien de temps prend la résolution d’une tâche complète de l’indice, consommation de tokens comprise — y compris les reasoning tokens, quand le modèle les expose. La différence est concrète : un modèle au prix par token bas peut avoir un coût par tâche élevé s’il consomme beaucoup de reasoning tokens. Le nuage de points Intelligence Index contre Cost per Task, avec sa frontière de Pareto, permet d’identifier les options non dominées pour le niveau de qualité dont vous avez besoin.
Benchmarks agentiques
Au-delà de l’indice, ils publient des évaluations spécialisées du travail agentique. Il ne faut pas les confondre avec les dix composantes de la v4.3 — certaines font partie de l’indice, d’autres sont publiées séparément. C’est la catégorie qui a le plus progressé, et la plus pertinente si votre système exécute des tâches plutôt que de répondre à des questions :
- AA-Briefcase — knowledge work à long horizon : produire des tableurs, des présentations et des notes au sein de workflows métier.
- GDPval-AA — des tâches à réelle valeur économique dans différents métiers, avec un Elo ancré sur une baseline humaine de 1 000. Mesurer l’écart avec une personne est une référence exigeante.
- AutomationBench-AA et EnterpriseOps-Gym-AA — des workflows sur des applications SaaS et des opérations métier.
- Terminal-Bench — usage agentique du terminal et coding de bout en bout.
- APEX-Agents-AA — long horizon, où l’accumulation d’erreurs d’une étape à l’autre est le principal facteur d’échec.
- ITBench-AA — root-cause analysis d’incidents Kubernetes. Particulièrement pertinent si vous travaillez dans l’IT ops.
- AA-AnalystAgent — analyse quantitative sur des tableurs et des documents, exprimée en pass^5 : la proportion de tâches résolues correctement lors des cinq exécutions. C’est de la reproductibilité, pas une capacité maximale. Utile pour juger de la robustesse d’une automatisation, même si à elle seule elle ne permet pas de décider si l’on peut supprimer la supervision humaine.
Coding Agent Index
Il est séparé du classement des modèles, et à juste titre : un agent, c’est modèle + scaffold + outils, et le scaffold compte. La v1.5 combine DeepSWE, Terminal-Bench et SWE-Atlas-QnA, et indique aussi le coût par tâche et le temps d’exécution. Il existe également un tableau comparatif d’agents de travail général — Claude Cowork, ChatGPT Work, Microsoft Copilot Cowork, Manus, OpenClaw, Hermes Agent, Gemini Enterprise, entre autres — avec la plateforme, le fait d’être open source ou non, la prise en charge du bring-your-own-model, l’accès aux fichiers locaux, la browser automation et le prix.
