Qual IA é a melhor hoje? Com a fonte de cada número.
Todo mundo tem uma opinião sobre qual modelo é o melhor. Aqui não tem opinião: tem 185 modelos de 30 laboratórios, medidos por quem mede de verdade, com a origem de cada número declarada e a coluna vazia quando não houve apuração.
Duas réguas, lado a lado
ECI é capacidade medida em provas difíceis. ELO é preferência de pessoas comuns em conversas às cegas. Os dois rankings não coincidem, e a diferença entre eles é justamente a informação mais útil da tabela. Ordenamos pelo ECI.
| # | Modelo | Laboratório | ECI | ELO | Acesso | Lançamento |
|---|---|---|---|---|---|---|
| 1 | GPT-5.6 Sol (medium) | OpenAI | 161,65 | 1.528 | API access | 09/07/2026 |
| 2 | Claude Fable 5 (high) | Anthropic | 161,53 | 1.544 | API access | 09/06/2026 |
| 3 | GPT-5.5 Pro (xhigh) | OpenAI | 161,49 | sem par | API access | 23/04/2026 |
| 4 | Claude Opus 5 (max) | Anthropic | 161,02 | 1.592 | API access | 24/07/2026 |
| 5 | GPT-5.5 (medium) | OpenAI | 159,21 | 1.541 | API access | 23/04/2026 |
| 6 | GPT-5.6 Terra (none) | OpenAI | 158,96 | 1.514 | API access | 09/07/2026 |
| 7 | GPT-5.4 Pro (xhigh) | OpenAI | 158,46 | sem par | API access | 05/03/2026 |
| 8 | Claude Opus 4.8 | Anthropic | 157,88 | 1.508 | API access | 28/05/2026 |
| 9 | Kimi K3 (low) | Moonshot | 157,01 | sem par | Open weights (non-commercial) | 16/07/2026 |
| 10 | GPT-5.4 (high) | OpenAI | 156,69 | 1.518 | API access | 05/03/2026 |
| 11 | GPT-5.6 Luna (none) | OpenAI | 156,13 | 1.479 | API access | 09/07/2026 |
| 12 | Qwen3.8 Max (xhigh) | Alibaba | 156,05 | 1.555 | API access | 02/08/2026 |
| 13 | Claude Opus 4.7 (high) | Anthropic | 155,76 | 1.536 | API access | 16/04/2026 |
| 14 | GPT-5.3 Codex (high) | OpenAI | 155,69 | sem par | API access | 05/02/2026 |
| 15 | Claude Sonnet 5 (max) | Anthropic | 155,53 | 1.489 | API access | 30/06/2026 |
| 16 | Claude Opus 4.6 (max) | Anthropic | 155,15 | 1.555 | API access | 05/02/2026 |
| 17 | GPT-5.2 Pro | OpenAI | 155,03 | sem par | API access | 11/12/2025 |
| 18 | Gemini 3.1 Pro Preview | Google DeepMind | 154,75 | 1.531 | API access | 19/02/2026 |
| 19 | Muse Spark 1.1 (high) | Meta AI | 154,75 | 1.526 | API access | 09/07/2026 |
| 20 | Gemini 3.5 Flash | 154,56 | 1.534 | API access | 19/05/2026 | |
| 21 | Grok 4.5 (high) | xAI | 154,02 | 1.507 | API access | 08/07/2026 |
| 22 | Gemini 3.6 Flash | Google DeepMind | 153,98 | 1.535 | API access | 21/07/2026 |
| 23 | Qwen3.7 Max | Alibaba | 153,81 | 1.524 | API access | 19/05/2026 |
| 24 | GPT-5.2 (high) | OpenAI | 153,52 | 1.451 | API access | 11/12/2025 |
| 25 | Gemini 3 Pro Preview | Google DeepMind | 153,20 | 1.529 | API access | 18/11/2025 |
Cada ponto é um modelo. A linha é o recorde da época.
Capacidade (ECI) pela data de lançamento. A linha verde liga os modelos que, no dia em que saíram, eram o melhor que existia. É a leitura mais direta de quanto o ritmo acelerou.
O melhor modelo de cada laboratório
Ordenado pelo ECI do modelo mais capaz que cada organização tem no ranking.
OpenAI
Anthropic
Moonshot
Alibaba
Google DeepMind
Meta AI
xAI
DeepSeek
Z.ai (Zhipu AI)
Thinking Machines
MiniMax
Recém-lançados, ainda sem nota
A Epoch AI cadastra o modelo no dia em que ele sai e calcula a nota de capacidade depois. Nessa janela o modelo existe, já pode estar na mão de todo mundo, e ainda não tem ECI. Ele fica fora do ranking acima, que é ordenado por capacidade, e espera aqui. Quando a Arena já tiver medido a preferência humana, o ELO aparece; quando não, a coluna fica vazia, como no resto da página. Hoje são 251 modelos nessa situação.
| Modelo | Laboratório | Lançamento | ELO | Capacidade | Acesso |
|---|---|---|---|---|---|
| Gemini 3.7 Flash | Google DeepMind | 13/08/2026 | sem par | aguardando medição | API access |
| Grok 4.6 | xAI | 12/08/2026 | 1.522 | aguardando medição | API access |
| Qwen3.7 Flash | Alibaba | 27/07/2026 | sem par | aguardando medição | API access |
| Gemini 3.5 Flash-Lite | Google DeepMind | 21/07/2026 | 1.476 | aguardando medição | API access |
| Inkling-Small | Thinking Machines | 15/07/2026 | sem par | aguardando medição | Open weights (unrestricted) |
| SWE-1.7 | Cognition | 08/07/2026 | sem par | aguardando medição | não informado |
| Qwen3.7-Plus | Alibaba | 02/06/2026 | 1.510 | aguardando medição | não informado |
| Step 3.7 Flash | StepFun | 29/05/2026 | sem par | aguardando medição | não informado |
| Grok Build 0.1 | xAI | 29/05/2026 | sem par | aguardando medição | API access |
| Command A+ | Cohere,Cohere Labs (formerly Cohere for AI) | 20/05/2026 | sem par | aguardando medição | Open weights (unrestricted) |
| Composer 2.5 | Cursor | 18/05/2026 | sem par | aguardando medição | API access |
| Ring-2.6-1T | Ant Group | 14/05/2026 | sem par | aguardando medição | Open weights (unrestricted) |
A ROO3 não mede modelo nenhum
Esta página não tem laboratório e não roda benchmark. Ela reúne, traduz e credita duas medições públicas feitas por quem tem estrutura para isso. Dizer o contrário seria a primeira mentira, e a partir dela nenhum número aqui valeria nada.
Ordenamos pelo ECI, e não por média
ECI e ELO estão em escalas diferentes: o ECI gira em torno de 150, o ELO em torno de 1400. Somar os dois num "score próprio" produziria um número bonito que não significa nada. O ranking segue o ECI, e o ELO fica ao lado para você comparar com os próprios olhos.
Coluna vazia é resposta, não falha
As duas fontes escrevem o mesmo modelo de jeitos diferentes. Casar por semelhança de texto é exatamente como um agregador começa a mentir sem dar erro: basta colar o ELO de um "Flash" no "Pro" de mesmo nome. Aqui o casamento é exato ou não existe. Hoje, 75 dos 185 modelos têm par confirmado na Arena.
Um modelo, o teto dele
O mesmo modelo aparece nas fontes várias vezes, uma por ajuste de esforço de raciocínio. Em vez de repetir o topo do ranking com o mesmo nome cinco vezes, guardamos o melhor resultado de cada família nas duas colunas. É o teto real daquele modelo.
Fonte fora do ar não zera coluna
Quando uma das fontes não responde, a apuração mantém o número do dia anterior e registra a falha. O contrário, apagar a coluna em silêncio, é o tipo de defeito que ninguém percebe: a página continua no ar, bonita, com um dado a menos.
Só fonte que permite redistribuir
Existem rankings mais famosos que estes. Ficaram de fora porque os termos de uso deles proíbem republicar o dado em site comercial de terceiro. Preferimos duas fontes que autorizam por escrito a uma terceira que renderia mais visita e um problema jurídico.
Uma vez por dia, automático
Um processo agendado baixa as duas fontes, confere que a licença continua sendo CC BY, guarda a impressão digital do arquivo do dia e grava. Se a licença mudar, a sincronização daquela fonte para sozinha, antes de baixar qualquer coisa.
De quem é o dado
As duas fontes estão sob Creative Commons Attribution 4.0, que permite uso comercial e redistribuição desde que creditadas. O crédito abaixo é gerado a partir do registro da própria apuração, e não escrito à mão, para não se perder numa edição futura.
Epoch AI, "AI Benchmarking Hub". Publicado em epoch.ai. Dados sob licença CC BY 4.0, reordenados por roo3.co.
Leaderboard da Arena (LMArena), do dataset público lmarena-ai/leaderboard-dataset no Hugging Face, sob licença CC BY 4.0. Não somos afiliados à Arena.
A ROO3 não é afiliada à Epoch AI nem à Arena (LMArena). Os dados foram reunidos, ordenados e traduzidos para o português; os valores não foram alterados. Marcas citadas pertencem aos respectivos donos.
O que estes números querem dizer
Qual é a melhor IA hoje?
Depende do que você chama de melhor. Por capacidade medida em provas difíceis, vale o topo do ECI. Por preferência de pessoas comuns em conversas do dia a dia, vale o topo do ELO. Os dois rankings não coincidem, e é por isso que esta página mostra as duas colunas em vez de inventar uma nota única.
O que é o ECI?
Epoch Capabilities Index, da Epoch AI. Um índice composto que junta o desempenho do modelo em vários benchmarks difíceis numa escala só, o que permite comparar modelos que nunca fizeram exatamente as mesmas provas. Quanto maior, melhor.
O que é o ELO da Arena?
É a nota de preferência humana da Arena. Pessoas mandam a mesma pergunta para dois modelos sem saber quais são, escolhem a melhor resposta, e o sistema calcula uma nota no mesmo esquema de rating do xadrez. Mede o que as pessoas gostam de receber, que não é a mesma coisa que capacidade bruta.
Por que alguns modelos estão com a coluna de ELO vazia?
Porque aquele modelo não foi encontrado na Arena com certeza. Casar nome por semelhança é como um ranking passa a mentir sem dar erro nenhum. Quando não há casamento exato, a coluna fica vazia. Preferimos a lacuna ao número errado.
Não achei um modelo que acabou de sair. Cadê?
Se ele saiu há pouco, provavelmente está na lista "Recém-lançados, ainda sem nota" logo abaixo da tabela. A Epoch AI cadastra o modelo no dia do lançamento e calcula a nota de capacidade depois, então existe uma janela em que o modelo é público mas ainda não foi medido. Nessa janela ele fica fora do ranking, que é ordenado por capacidade, mas aparece na lista de espera com a data de lançamento e, quando já existir, a nota de preferência humana da Arena. Não estimamos a nota que falta.
Modelo de peso aberto aparece aqui?
Aparece, e dá para filtrar só por eles na barra acima da tabela. A coluna Acesso mostra se o modelo é servido por API, se os pesos são abertos ou se o acesso é restrito, conforme a classificação da própria Epoch AI.
Posso usar estes dados no meu trabalho?
Os dados originais são das duas fontes citadas nos créditos, sob licença Creative Commons Attribution 4.0. Você pode usar, inclusive comercialmente, desde que credite as fontes originais do mesmo jeito que fazemos aqui. O crédito não é gentileza: é a condição da licença.
Com que frequência atualiza?
Uma vez por dia, automaticamente. A data e a hora da última apuração ficam no topo da página e no rodapé da tabela. Se uma das fontes estiver fora do ar, a página mantém os números da apuração anterior em vez de zerar a coluna.
Saber qual é a melhor IA é fácil. Difícil é usar no seu negócio.
A gente implanta IA em empresa de verdade: atendimento, conteúdo, processo. Com número no fim do mês, não com promessa.
Falar sobre IA na minha empresa