Início › AI Benchmark
Apurado em 18/08/2026 às 05:26

Qual IA é a melhor hoje? Com a fonte de cada número.

Todo mundo tem uma opinião sobre qual modelo é o melhor. Aqui não tem opinião: tem 185 modelos de 30 laboratórios, medidos por quem mede de verdade, com a origem de cada número declarada e a coluna vazia quando não houve apuração.

185modelos no ranking
30laboratórios acompanhados
75com nota de preferência humana
2fontes, ambas CC BY 4.0
O ranking

Duas réguas, lado a lado

ECI é capacidade medida em provas difíceis. ELO é preferência de pessoas comuns em conversas às cegas. Os dois rankings não coincidem, e a diferença entre eles é justamente a informação mais útil da tabela. Ordenamos pelo ECI.

# Modelo Laboratório ECI ELO Acesso Lançamento
1 GPT-5.6 Sol (medium) OpenAI 161,65 1.528 API access 09/07/2026
2 Claude Fable 5 (high) Anthropic 161,53 1.544 API access 09/06/2026
3 GPT-5.5 Pro (xhigh) OpenAI 161,49 sem par API access 23/04/2026
4 Claude Opus 5 (max) Anthropic 161,02 1.592 API access 24/07/2026
5 GPT-5.5 (medium) OpenAI 159,21 1.541 API access 23/04/2026
6 GPT-5.6 Terra (none) OpenAI 158,96 1.514 API access 09/07/2026
7 GPT-5.4 Pro (xhigh) OpenAI 158,46 sem par API access 05/03/2026
8 Claude Opus 4.8 Anthropic 157,88 1.508 API access 28/05/2026
9 Kimi K3 (low) Moonshot 157,01 sem par Open weights (non-commercial) 16/07/2026
10 GPT-5.4 (high) OpenAI 156,69 1.518 API access 05/03/2026
11 GPT-5.6 Luna (none) OpenAI 156,13 1.479 API access 09/07/2026
12 Qwen3.8 Max (xhigh) Alibaba 156,05 1.555 API access 02/08/2026
13 Claude Opus 4.7 (high) Anthropic 155,76 1.536 API access 16/04/2026
14 GPT-5.3 Codex (high) OpenAI 155,69 sem par API access 05/02/2026
15 Claude Sonnet 5 (max) Anthropic 155,53 1.489 API access 30/06/2026
16 Claude Opus 4.6 (max) Anthropic 155,15 1.555 API access 05/02/2026
17 GPT-5.2 Pro OpenAI 155,03 sem par API access 11/12/2025
18 Gemini 3.1 Pro Preview Google DeepMind 154,75 1.531 API access 19/02/2026
19 Muse Spark 1.1 (high) Meta AI 154,75 1.526 API access 09/07/2026
20 Gemini 3.5 Flash Google 154,56 1.534 API access 19/05/2026
21 Grok 4.5 (high) xAI 154,02 1.507 API access 08/07/2026
22 Gemini 3.6 Flash Google DeepMind 153,98 1.535 API access 21/07/2026
23 Qwen3.7 Max Alibaba 153,81 1.524 API access 19/05/2026
24 GPT-5.2 (high) OpenAI 153,52 1.451 API access 11/12/2025
25 Gemini 3 Pro Preview Google DeepMind 153,20 1.529 API access 18/11/2025
Mostrando 25 de 185 modelos. Apuração de 18/08/2026 às 05:26, horário de Brasília.
A fronteira

Cada ponto é um modelo. A linha é o recorde da época.

Capacidade (ECI) pela data de lançamento. A linha verde liga os modelos que, no dia em que saíram, eram o melhor que existia. É a leitura mais direta de quanto o ritmo acelerou.

modelo recorde na data Fonte: Epoch AI, CC BY 4.0.
Quem está na frente

O melhor modelo de cada laboratório

Ordenado pelo ECI do modelo mais capaz que cada organização tem no ranking.

OpenAI

GPT-5.6 Sol (medium)
161,65
34 modelos no ranking · United States of America

Anthropic

Claude Fable 5 (high)
161,53
22 modelos no ranking · United States of America

Moonshot

Kimi K3 (low)
157,01
7 modelos no ranking · China

Alibaba

Qwen3.8 Max (xhigh)
156,05
17 modelos no ranking · China

Google DeepMind

Gemini 3.1 Pro Preview
154,75
17 modelos no ranking · United States of America

Meta AI

Muse Spark 1.1 (high)
154,75
19 modelos no ranking · United States of America

Google

Gemini 3.5 Flash
154,56
2 modelos no ranking · United States of America

xAI

Grok 4.5 (high)
154,02
8 modelos no ranking · United States of America

DeepSeek

DeepSeek V4 Flash 0731 (max)
152,53
7 modelos no ranking · China

Z.ai (Zhipu AI)

GLM-5.2
152,21
4 modelos no ranking · China

Thinking Machines

Inkling (xhigh)
149,54
1 modelo no ranking · United States of America

MiniMax

MiniMax-M3
148,74
3 modelos no ranking · China
Fila de medição

Recém-lançados, ainda sem nota

A Epoch AI cadastra o modelo no dia em que ele sai e calcula a nota de capacidade depois. Nessa janela o modelo existe, já pode estar na mão de todo mundo, e ainda não tem ECI. Ele fica fora do ranking acima, que é ordenado por capacidade, e espera aqui. Quando a Arena já tiver medido a preferência humana, o ELO aparece; quando não, a coluna fica vazia, como no resto da página. Hoje são 251 modelos nessa situação.

Modelo Laboratório Lançamento ELO Capacidade Acesso
Gemini 3.7 Flash Google DeepMind 13/08/2026 sem par aguardando medição API access
Grok 4.6 xAI 12/08/2026 1.522 aguardando medição API access
Qwen3.7 Flash Alibaba 27/07/2026 sem par aguardando medição API access
Gemini 3.5 Flash-Lite Google DeepMind 21/07/2026 1.476 aguardando medição API access
Inkling-Small Thinking Machines 15/07/2026 sem par aguardando medição Open weights (unrestricted)
SWE-1.7 Cognition 08/07/2026 sem par aguardando medição não informado
Qwen3.7-Plus Alibaba 02/06/2026 1.510 aguardando medição não informado
Step 3.7 Flash StepFun 29/05/2026 sem par aguardando medição não informado
Grok Build 0.1 xAI 29/05/2026 sem par aguardando medição API access
Command A+ Cohere,Cohere Labs (formerly Cohere for AI) 20/05/2026 sem par aguardando medição Open weights (unrestricted)
Composer 2.5 Cursor 18/05/2026 sem par aguardando medição API access
Ring-2.6-1T Ant Group 14/05/2026 sem par aguardando medição Open weights (unrestricted)
Os 12 lançamentos mais recentes sem nota de capacidade. Assim que a Epoch AI publicar o ECI, o modelo entra no ranking sozinho.
Como isto é apurado

A ROO3 não mede modelo nenhum

Esta página não tem laboratório e não roda benchmark. Ela reúne, traduz e credita duas medições públicas feitas por quem tem estrutura para isso. Dizer o contrário seria a primeira mentira, e a partir dela nenhum número aqui valeria nada.

Ordenamos pelo ECI, e não por média

ECI e ELO estão em escalas diferentes: o ECI gira em torno de 150, o ELO em torno de 1400. Somar os dois num "score próprio" produziria um número bonito que não significa nada. O ranking segue o ECI, e o ELO fica ao lado para você comparar com os próprios olhos.

Coluna vazia é resposta, não falha

As duas fontes escrevem o mesmo modelo de jeitos diferentes. Casar por semelhança de texto é exatamente como um agregador começa a mentir sem dar erro: basta colar o ELO de um "Flash" no "Pro" de mesmo nome. Aqui o casamento é exato ou não existe. Hoje, 75 dos 185 modelos têm par confirmado na Arena.

Um modelo, o teto dele

O mesmo modelo aparece nas fontes várias vezes, uma por ajuste de esforço de raciocínio. Em vez de repetir o topo do ranking com o mesmo nome cinco vezes, guardamos o melhor resultado de cada família nas duas colunas. É o teto real daquele modelo.

Fonte fora do ar não zera coluna

Quando uma das fontes não responde, a apuração mantém o número do dia anterior e registra a falha. O contrário, apagar a coluna em silêncio, é o tipo de defeito que ninguém percebe: a página continua no ar, bonita, com um dado a menos.

Só fonte que permite redistribuir

Existem rankings mais famosos que estes. Ficaram de fora porque os termos de uso deles proíbem republicar o dado em site comercial de terceiro. Preferimos duas fontes que autorizam por escrito a uma terceira que renderia mais visita e um problema jurídico.

Uma vez por dia, automático

Um processo agendado baixa as duas fontes, confere que a licença continua sendo CC BY, guarda a impressão digital do arquivo do dia e grava. Se a licença mudar, a sincronização daquela fonte para sozinha, antes de baixar qualquer coisa.

Fontes e créditos

De quem é o dado

As duas fontes estão sob Creative Commons Attribution 4.0, que permite uso comercial e redistribuição desde que creditadas. O crédito abaixo é gerado a partir do registro da própria apuração, e não escrito à mão, para não se perder numa edição futura.

Epoch AI, "AI Benchmarking Hub". Publicado em epoch.ai. Dados sob licença CC BY 4.0, reordenados por roo3.co.

Epoch AI, AI Benchmarking Hub · CC BY 4.0

436 registros lidos em 18/08/2026 às 05:26.

Leaderboard da Arena (LMArena), do dataset público lmarena-ai/leaderboard-dataset no Hugging Face, sob licença CC BY 4.0. Não somos afiliados à Arena.

Arena (LMArena), leaderboard-dataset · CC BY 4.0

361 registros lidos em 18/08/2026 às 05:26.

A ROO3 não é afiliada à Epoch AI nem à Arena (LMArena). Os dados foram reunidos, ordenados e traduzidos para o português; os valores não foram alterados. Marcas citadas pertencem aos respectivos donos.

Perguntas frequentes

O que estes números querem dizer

Qual é a melhor IA hoje?

Depende do que você chama de melhor. Por capacidade medida em provas difíceis, vale o topo do ECI. Por preferência de pessoas comuns em conversas do dia a dia, vale o topo do ELO. Os dois rankings não coincidem, e é por isso que esta página mostra as duas colunas em vez de inventar uma nota única.

O que é o ECI?

Epoch Capabilities Index, da Epoch AI. Um índice composto que junta o desempenho do modelo em vários benchmarks difíceis numa escala só, o que permite comparar modelos que nunca fizeram exatamente as mesmas provas. Quanto maior, melhor.

O que é o ELO da Arena?

É a nota de preferência humana da Arena. Pessoas mandam a mesma pergunta para dois modelos sem saber quais são, escolhem a melhor resposta, e o sistema calcula uma nota no mesmo esquema de rating do xadrez. Mede o que as pessoas gostam de receber, que não é a mesma coisa que capacidade bruta.

Por que alguns modelos estão com a coluna de ELO vazia?

Porque aquele modelo não foi encontrado na Arena com certeza. Casar nome por semelhança é como um ranking passa a mentir sem dar erro nenhum. Quando não há casamento exato, a coluna fica vazia. Preferimos a lacuna ao número errado.

Não achei um modelo que acabou de sair. Cadê?

Se ele saiu há pouco, provavelmente está na lista "Recém-lançados, ainda sem nota" logo abaixo da tabela. A Epoch AI cadastra o modelo no dia do lançamento e calcula a nota de capacidade depois, então existe uma janela em que o modelo é público mas ainda não foi medido. Nessa janela ele fica fora do ranking, que é ordenado por capacidade, mas aparece na lista de espera com a data de lançamento e, quando já existir, a nota de preferência humana da Arena. Não estimamos a nota que falta.

Modelo de peso aberto aparece aqui?

Aparece, e dá para filtrar só por eles na barra acima da tabela. A coluna Acesso mostra se o modelo é servido por API, se os pesos são abertos ou se o acesso é restrito, conforme a classificação da própria Epoch AI.

Posso usar estes dados no meu trabalho?

Os dados originais são das duas fontes citadas nos créditos, sob licença Creative Commons Attribution 4.0. Você pode usar, inclusive comercialmente, desde que credite as fontes originais do mesmo jeito que fazemos aqui. O crédito não é gentileza: é a condição da licença.

Com que frequência atualiza?

Uma vez por dia, automaticamente. A data e a hora da última apuração ficam no topo da página e no rodapé da tabela. Se uma das fontes estiver fora do ar, a página mantém os números da apuração anterior em vez de zerar a coluna.

Saber qual é a melhor IA é fácil. Difícil é usar no seu negócio.

A gente implanta IA em empresa de verdade: atendimento, conteúdo, processo. Com número no fim do mês, não com promessa.

Falar sobre IA na minha empresa
Resposta rápida no WhatsApp. São José do Rio Preto, SP e todo o Brasil.