Semana passada, tivemos o lançamento do Anti Gravity e o Gemini Pro 3, logo depois o Codex Max 5.1 e essa semana (26/11/2025) temos o Opus 4.5 com um Benchmark superando os seus “adversários”. Mas o que, afinal, cada benchmark realmente mede? E como eles ajudam a entender se um modelo está melhor — ou, se preferir, mais próximo da tal AGI?

Benchmark em tradução livre fica como “ponto de referência”. No contexto atual, a palavra é muito usada como uma ferramenta de aferição de desempenho, seja de um produto, investimento ou um LLM. No nosso caso, eu vou explicar (ou pelo menos tentar) de maneira simples e direta, os principais benchmarks que aparecem nesses gráficos comparativos que tanto vemos nas redes.

Tabela comparando Opus 4.5, Sonnet 4.5, Opus 4.1, Gemini 3 Pro e GPT-5.1 em nove benchmarks; a coluna do Opus 4.5 está destacada e lidera em agentic coding com 80,9%, uso de ferramentas e ARC-AGI-2 com 37,6%.

Agentic coding — SWE-bench

SWE vem do termo Software Engineer (Engenheiro de Software), basicamente esse benchmark avalia a capacidade de um modelo resolver tarefas reais em repositórios Python no GitHub. O modelo recebe o código do projeto, a tarefa e precisa propor uma correção que realmente resolve o problema.

Nesse caso, na avaliação de cima do Opus, teve mais ou menos um subconjunto com ~500 tarefas revisadas à mão, com testes e correções validados por humanos para evitar falsos positivos.

As tarefas podem ser amplas, mas elas costumam ser mais ou menos assim:

  • “Esse teste está quebrando, conserte o bug.”
  • “Essa função precisa suportar um novo parâmetro.”
  • “Essa API está retornando o valor errado, ajuste a lógica.”

O agente deve:

  1. Entender a descrição da tarefa.
  2. Ler o código (às vezes vários arquivos).
  3. Editar arquivos corretos.
  4. Rodar testes e garantir que tudo passa.

Quando você pede para o CoPilot, Codex, Claude executar uma tarefa, ele precisa executar ela e ter uma resposta aceitável. É o mesmo aqui.

Um score acima de 80%, como o obtido pelo Opus 4.5, é impressionante.
 Mas há limitações: o benchmark é focado em Python, depende de repositórios fixos e sempre existe o risco de “contaminação” — o modelo já ter visto partes do código durante o treinamento.

Ranking do Terminal-Bench 2.0 em barras horizontais, com Codex CLI (GPT-5.1-Codex-Max) em primeiro com 60,4% e Terminus 2 (Claude Opus 4.5) com 57,8%.

Agentic terminal coding — Terminal-Bench 2.0

Esse aqui é bem parecido com o SWE, mas a diferença é que ele roda como um Linux real pela linha de comando. Os cenários vão desde compilar projetos até treinar modelos de ML, configurar servidores e resolver dependências quebradas. Por exemplo, o agente consegue clonar um repo, instalar dependências, rodar testes e corrigir erros ou configurar um servidor web, ajustar firewall, subir serviço.

O agente precisa navegar no terminal (git, pip, sed, systemctl, etc.), editar arquivos com editores CLI e, no fim, deixar o ambiente no estado correto. Basicamente é o que você faz com o Claude Code/Codex Cli atualmente.

Uma pontuação alta em Terminal-Bench indica um modelo que consegue agir como “dev Ops full stack” no terminal, executando pipelines de ponta a ponta. Da mesma forma que o SWE tem suas limitações, o Terminal Bench, não consegue capturar cenários usando GUI (Interface Gráfica do Usuário) e os cenários por mais que sejam realistas, ainda são vários cenários em Docker, não necessariamente reflete o mundo real.

Figura do artigo do τ²-bench: em cima, o agente e o usuário conversam cada um com suas próprias ferramentas e bancos de dados; embaixo, um diálogo de suporte técnico em que o agente descobre que o roaming está desligado e o ativa.

Agentic tool use — τ²-bench

τ²-bench (lê “tau-quadrado”) é um benchmark para agentes conversacionais que usam ferramentas em cenários de atendimento ao cliente, principalmente em domínios como varejo e telecom. Ou seja esse benchmark é especifico para ser usado como um ChatBot.

Esse benchmark avalia a capacidade do modelo de resolver problemas de cobranças, diagnosticar problema de conexão usando ferramentas de rede. No fim é importante para “agentes de call center”, chatbots corporativos.

Mas há limitações importantes:

  • não mede interação com clientes confusos ou hostis,
  • não testa ruído de voz,
  • nem ambiguidade humana real.

É um benchmark ótimo para “chatbot ideal”, não para o caos do mundo real.

Scaled tool use — MCP Atlas

MCP Atlas é um benchmark feito pela Scale/SEAL para avaliar uso de ferramentas em larga escala através do Model Context Protocol (MCP). A ideia é medir como o modelo se sai quando tem acesso a muitas ferramentas diferentes (bancos de dados, APIs, buscadores, etc.) e precisa orquestrar chamadas em cadeias complexas.

Ele testa cenários onde o modelo tem acesso a:

  • APIs,
  • bancos de dados,
  • buscadores,
  • sistemas internos,
  • cadeias de complexas de ações.

A pergunta aqui é:
O modelo sabe orquestrar várias ferramentas diferentes para resolver um problema complexo?

Como é recente, ainda não existe uma base de comparação tão sólida quanto em outros benchmarks.

Figura do OSWorld com dois exemplos de tarefa — atualizar uma planilha de contabilidade a partir de recibos e corrigir o código de um jogo da cobrinha — e, embaixo, o diagrama do ambiente em que o agente recebe captura de tela e árvore de acessibilidade e responde com mouse e teclado.

Computer use — OSWorld

OSWorld é um benchmark de uso de computador: o agente controla um desktop de verdade (ou ambiente simulado bem próximo) com apps como navegador, editor de texto, planilha, e ferramentas de sistema. As tasks são rotinas reais de trabalho, com múltiplos passos e janelas. Como:

  • Baixar um arquivo da web, organizar em pastas, descompactar.
  • Preencher planilhas, fazer gráficos e enviar por e-mail.
  • Ajustar configurações do sistema, instalar programas, etc.

O benchmark mede se a tarefa foi concluída e, em versões mais novas, também a eficiência (quantos passos a mais o agente deu comparado a um humano). O problema é que as Interfaces podem mudar com o tempo, e há uma quantidade finita de tarefas.

Gráfico de dispersão do ARC-AGI-2 cruzando pontuação e custo por tarefa; Gemini 3 Deep Think aparece isolado perto de 45% a mais de 50 dólares por tarefa, e o Opus 4.5 com 64K de raciocínio chega a 37% por cerca de um dólar.

Novel problem solving — ARC-AGI-2

Esse é o mais “místico”, o mais hypado, o mais temido, o grande ARC-AGI! O ARC-AGI, criado pelo François Chollet, tenta medir razão abstrata e generalização forte, ou seja: a capacidade do modelo de inferir regras que não estão explícitas em texto, mas escondidas em padrões visuais.

Cada problema mostra pequenas grades de quadradinhos coloridos (input/output) e o modelo precisa inferir a regra implícita e aplicá-la em novos exemplos. O ARC-AGI-2 é a nova versão, ainda mais difícil, usada hoje como um “stress test” de sistemas rumo a AGI. O ARC-AGI-2 é ainda mais difícil e é usado como um stress test de “inteligência de sistema” — o famoso “o quão longe estamos da AGI?”.

Um humano “treinado” conseguiria em teoria resolver 100% do painel do ARC-AGI 2, entretanto se um modelo consegue resolver 45% como foi feito pela última versão do Gemini 3 Deep Think é algo fora da curva.

Mas é importante deixar claro, as tarefas que você visualiza no ARC AGI, não costumam “acontecer “na vida real. E o uso de ferramentas externas também impacta no resultado.

Barras do GPQA Diamond com dezesseis modelos, de Gemini 3 Pro Preview em 90,8% até MiniMax-M2 em 77,7%.

Graduate-level reasoning — GPQA Diamond

O GPQA é uma prova de múltipla escolha em física, química e biologia em nível de pós-graduação.

A versão Diamond é a elite da elite:

  • questões difíceis,
  • curadas manualmente,
  • resolvidas apenas por especialistas PhD.

Uma boa nota significa que o modelo consegue lidar com raciocínios complexos e conteúdo avançado — algo como um “bom aluno de pós”.

O problema é que o foco fica somente em três áreas (física, química, biologia); nada de ciências humanas, engenharias específicas etc. E como é multipla escolha, limita a “criatividade” do modelo.

Gráfico do MMMU acompanhando modelos multimodais de janeiro de 2023 a meados de 2025, com linhas de tendência separadas para código aberto e proprietários e as faixas de especialistas humanos marcadas em 76,2%, 82,6% e 88,6%.

Visual reasoning — MMMU

MMMU (Massive Multi-discipline Multimodal Understanding) é um benchmark multimodal que mistura imagem + texto em perguntas de múltipla escolha. Ele tem mais de 11 mil questões coletadas de provas, livros e quizzes de nível universitário em várias áreas (arte, negócios, medicina, ciências, engenharia, humanidades) e vários idiomas.

Um bom resultado indica que o modelo consegue raciocinar e recuperar conhecimento em vários idiomas, não só traduzir literalmente do inglês, mas também entender nuances culturais e contextuais.

O problema que traduções podem introduzir ruídos, ambiguidades ou diferenças culturais fora uma possibilidade de contaminação dos dados.

Conclusão

Benchmarks são essenciais para medir o progresso dos LLMs e entender onde cada modelo é mais forte.
Mas não existe um benchmark único que indique “proximidade da AGI”.

Cada teste mede um pedaço diferente da inteligência:

  • alguns focam em capacidade prática,
  • outros em raciocínio abstrato,
  • outros em conhecimento técnico,
  • outros em uso de ferramentas.

A interpretação correta exige olhar o conjunto, não um número isolado no gráfico. E é importante lembrar, mesmo com tudo isso, ainda não quer dizer que a AGI está logo ali, e sim que cada vez que um modelo faz uma pontuação mais alta que os anteriores, estamos um passo mais próximo dela. E ainda faltam muitos passos, muitos pra chegar lá.

Referências e links úteis

Agentic coding — SWE-bench (e variantes)

Agentic terminal coding — Terminal-Bench 2.0

Agentic tool use — τ²-bench (tau-squared bench)

Scaled tool use — MCP Atlas

Computer use — OSWorld

Novel problem solving — ARC-AGI / ARC Prize

Graduate-level reasoning — GPQA / GPQA Diamond

Visual reasoning — MMMU

Multilingual Q&A — MMMLU / Multilingual MMLU