O que é realmente um LLM — e como medi-lo com o Artificial Analysis

Traduzido do original em espanhol. Ler em espanhol

Há muito vocabulário cognitivo em torno desses sistemas. Inteligência, raciocínio, compreensão. E sim, os resultados são impressionantes. Mas o vocabulário não é neutro: cria expectativas sobre como o sistema funciona, como falha e que garantias oferece. Depois você leva essas expectativas para produção, e é aí que aparecem os problemas.

Aqui deixo como entendo o mecanismo: os conceitos básicos (LLM, MCP, AGI), o que acontece de fato dentro de um transformer, e o que uso para medir em vez de discutir. Para esta última parte recorro ao Artificial Analysis, que é a fonte que consulto com mais frequência.

Representación conceptual de un cerebro digital con el rótulo AGI LLM Powered, rodeado de nodos que enumeran capacidades como language understanding, reasoning, problem solving y world knowledge


Três termos que não estão no mesmo nível

LLM, MCP e AGI aparecem no mesmo parágrafo o tempo todo, e não são o mesmo tipo de coisa. Um é um tipo de modelo, outro é um protocolo, o terceiro é uma hipótese sem definição operacional.

LLM (Large Language Model). Um modelo pré-treinado sobre grandes volumes de texto com um objetivo de previsão do próximo token. Esse pré-treinamento, no entanto, é só uma parte do processo: os modelos atuais passam também por ajuste supervisionado, otimização por preferências e reinforcement learning. Não há, dentro dele, um banco de dados de fatos consultável nem, na arquitetura básica, um motor de inferência simbólica. O conhecimento fica distribuído nos parâmetros.

MCP (Model Context Protocol). Um padrão aberto para conectar modelos a ferramentas e fontes de dados. Um servidor MCP expõe tools, resources e prompts com uma interface uniforme, e qualquer cliente compatível os consome sem integração específica. Substitui a integração pontual por um conector comum. O que ele não é: um requisito para construir um agent. Um sistema agêntico pode funcionar do mesmo jeito com APIs diretas, function calling proprietário ou browser automation. O MCP traz interoperabilidade, não agência.

AGI (Artificial General Intelligence). Um sistema capaz de resolver tarefas intelectuais arbitrárias com transferência entre domínios. O problema é que não existe uma definição operacional de consenso nem um teste acordado. Cada organização tem a sua, e várias estão convenientemente atreladas ao próprio roadmap. Enquanto você não especificar os critérios de antemão, o termo acrescenta pouco.


O mecanismo: de tokens a uma distribuição

Antes dos passos, o que é um transformer. É a arquitetura de rede neural sobre a qual todos esses modelos foram construídos — surgiu em 2017, em Attention Is All You Need, e substituiu as arquiteturas recorrentes que processavam o texto posição por posição. Sua contribuição é o mecanismo de attention: cada posição da sequência olha para todas as outras e pondera quais importam para prever o que vem depois. Isso o tornou paralelizável e, portanto, treinável na escala atual. O T de GPT é de transformer.

A inferência de um transformer pode ser descrita em cinco passos.

  1. Tokenização — o texto é segmentado em tokens e cada um vira um índice inteiro. O modelo nunca vê letras nem palavras: vê índices.
  2. Embeddings — cada índice é projetado em um vetor de alta dimensionalidade. Essa representação não é estática: nas camadas seguintes ela se transforma de forma contextual. A semântica não reside na proximidade entre os embeddings iniciais, mas fica distribuída no espaço de representação.
  3. Camadas de attention — dezenas ou centenas de camadas em que cada posição combina informação das outras, por meio de operações matriciais sobre queries, keys e values.
  4. Projeção no vocabulário — a última camada produz um vetor de logits, um por token do vocabulário. Um softmax o normaliza em uma distribuição de probabilidade.
  5. Decodificação — o próximo token é escolhido com uma estratégia de decoding, que pode ser estocástica (sampling com temperature ou top-p) ou determinística. Ele é adicionado ao contexto e o processo se repete por inteiro para a posição seguinte.

O treinamento consistiu em ajustar parâmetros por descida de gradiente para minimizar o erro de previsão sobre um corpus. No modelo base não há nenhum passo que verifique um fato contra uma fonte. Quando uma resposta sai correta, é porque a continuação correta tinha alta probabilidade. E aqui está a distinção que mais passa despercebida: o sistema que você constrói em volta, sim, pode verificar — busca, execução de código, consulta a um banco. Isso é uma propriedade do sistema, não do modelo.

O que muda nos modelos frontier

Esses cinco passos são o esquema base. Os modelos frontier operam sobre os mesmos princípios, mas com arquiteturas consideravelmente mais avançadas que o transformer de 2017: as camadas feed-forward densas costumam ser Mixture of Experts, em que um router ativa apenas um subconjunto de parâmetros por token; a multi-head attention clássica deu lugar a variantes como Grouped-Query Attention ou Multi-head Latent Attention, para reduzir o custo em sequências longas e o tamanho do KV cache; e alguns modelos intercalam blocos de state-space models com poucas camadas de attention completa.


O que ninguém programou

O resultado que importa é que um procedimento assim produza texto coerente no nível do discurso. Sintaxe válida. Argumentação que se sustenta por vários parágrafos. Código que compila e faz o que diz.

Ninguém codificou regras gramaticais nem restrições de coerência discursiva. Isso surgiu como subproduto de otimizar uma previsão estatística em grande escala. E admite duas leituras: uma sobre a capacidade de um aproximador estatístico de grande porte, e outra sobre quanta regularidade estrutural a linguagem natural tinha — que acabou sendo maior do que supúnhamos.


Por que o vocabulário importa em produção

O problema não é usar termos funcionais para descrever comportamento. O problema é dar como certas propriedades que a fluência não garante: compreensão no sentido humano, veracidade, rastreabilidade causal, ou que um histórico de acertos implique conhecimento confiável do domínio. Nada disso decorre do mecanismo.

Para mim, é mais útil pensar neles como sistemas probabilísticos de alta complexidade. Essa caracterização explica os comportamentos que condicionam qualquer design em produção:

  • As hallucinations são um modo de falha inerente, não um bug — a distribuição otimiza a plausibilidade da continuação, não a veracidade. Por isso o resultado pode ser convincente e factualmente incorreto mesmo quando a informação relevante está no contexto.
  • A confiança expressa não é, por si só, uma medida confiável de exatidão — o tom assertivo é um padrão estilístico aprendido do corpus. Os modelos podem estar mal calibrados, embora a calibração possa ser medida e melhorada.
  • A variabilidade depende do decoding — com decoding estocástico, a mesma entrada pode produzir saídas diferentes. Em sistemas reais, também varia conforme o estado das ferramentas ou do ambiente.
  • O desempenho se degrada fora da distribuição — alguns tipos de distribution shift produzem comportamentos especialmente frágeis, embora a degradação nem sempre seja abrupta. É a zona em que mais vale a pena ter guardrails.

O reasoning não é um módulo novo

Os modelos de reasoning rendem substancialmente melhor em tarefas difíceis, e daí se pula para a suposição de que incorporam um processo inferencial de outra natureza. Convém separar três níveis: a geração do modelo, seu treinamento e o sistema completo que o cerca.

Esses modelos são otimizados para gastar mais cômputo antes de responder, em vários casos por meio de reinforcement learning sobre cadeias de raciocínio. A sequência intermediária é gerada com o mesmo procedimento autorregressivo descrito acima: no modelo não aparece um módulo lógico nem um verificador simbólico. O sistema completo, sim, pode incorporar ferramentas, busca ou verificadores. O que se observa é que gerar esse texto intermediário condiciona o modelo à sua própria saída e desloca a distribuição final para regiões em que as respostas corretas são mais prováveis. Em termos práticos: mais cômputo na inferência.

E aqui vem a parte incômoda para quem precisa de rastreabilidade. Há evidências de que a cadeia intermediária nem sempre reflete o processo que determinou a resposta — o modelo pode produzir uma justificativa plausível que não corresponde aos fatores que realmente influenciaram. A cadeia é texto gerado. Não convém tomá-la automaticamente como registro causal fiel nem como traço completo de execução.


Artificial Analysis: medir em vez de discutir

Se o comportamento desses sistemas é estatístico, escolher modelo ou provider é uma decisão que exige dados. O Artificial Analysis é um site independente que roda suas próprias avaliações sobre modelos, providers e agents e publica os resultados em formato comparável. Estas são as seções que mais uso.

Intelligence Index

Um índice composto, em vez de um benchmark único. A v4.3 agrega dez avaliações: AA-Briefcase, GDPval-AA v2, AutomationBench-AA, Terminal-Bench v4.0, SciCode, Humanity’s Last Exam, GDP.pdf, CritPt, AA-Omniscience e AA-LCR. A vantagem do composto é que reduz o risco de sobreajuste: otimizar para dez avaliações heterogêneas é bem mais difícil do que para uma.

Cost per Task e Time per Task

Esta é a visão que mais mudou minha forma de comparar. Em vez do preço por milhão de tokens, eles calculam quanto custa e quanto demora resolver uma tarefa completa do índice, com o consumo de tokens incluído — os reasoning tokens também, quando o modelo os expõe. A diferença é concreta: um modelo com preço por token baixo pode ter um custo por tarefa alto se consumir muitos reasoning tokens. O gráfico de dispersão de Intelligence Index contra Cost per Task, com sua fronteira de Pareto, permite identificar as opções não dominadas para o nível de qualidade de que você precisa.

Benchmarks agênticos

Além do índice, eles publicam avaliações especializadas de trabalho agêntico. Não convém confundi-las com os dez componentes da v4.3 — algumas estão dentro do índice e outras são publicadas à parte. É a categoria que mais cresceu e a mais pertinente se o seu sistema executa tarefas em vez de responder perguntas:

  • AA-Briefcase — knowledge work de horizonte longo: gerar planilhas, apresentações e memorandos dentro de workflows de negócio.
  • GDPval-AA — tarefas de valor econômico real em diferentes ocupações, com Elo ancorado em um baseline humano de 1.000. Medir a distância em relação a uma pessoa é uma referência exigente.
  • AutomationBench-AA e EnterpriseOps-Gym-AA — workflows sobre aplicações SaaS e operações de negócio.
  • Terminal-Bench — uso agêntico do terminal e coding end-to-end.
  • APEX-Agents-AA — horizonte longo, em que o acúmulo de erros entre os passos é o principal fator de falha.
  • ITBench-AA — root-cause analysis de incidentes em Kubernetes. Especialmente pertinente se você trabalha com IT ops.
  • AA-AnalystAgent — análise quantitativa sobre planilhas e documentos, reportada como pass^5: a proporção de tarefas resolvidas corretamente nas cinco execuções. É reprodutibilidade, não capacidade máxima. Serve para avaliar a robustez de uma automação, embora sozinha não determine se você pode tirar a supervisão humana.

Coding Agent Index

Fica separado do ranking de modelos, e com razão: um agent é modelo + scaffold + ferramentas, e o scaffold pesa. A v1.5 combina DeepSWE, Terminal-Bench e SWE-Atlas-QnA e reporta também custo por tarefa e tempo de execução. Há ainda uma tabela comparativa de agents de trabalho geral — Claude Cowork, ChatGPT Work, Microsoft Copilot Cowork, Manus, OpenClaw, Hermes Agent, Gemini Enterprise, entre outros — com plataforma, se é open source, se suporta bring-your-own-model, acesso a arquivos locais, browser automation e preço.

Maximiliano Díaz Doglia

AI Platform Engineer & Full-Stack Developer
Building Enterprise Integrations & Automations

Publicado em: IA