As melhores IA
Pontuação global
-
1
Claude Opus 5
99,44
-
2
Claude Opus 4.6
98,24
-
3
Claude Fable 5
97,34
A classificação geral: quatro capacidades reunidas em uma única pontuação, para comparar os modelos como um todo e não por uma única tarefa. É construída com comparações às cegas feitas por pessoas reais: responde a quais respostas são preferidas com mais frequência, não a quantas tarefas foram resolvidas. Para uma habilidade específica, a seleção dedicada é mais precisa.
de 235 modelos
99 sem diferença significativa
IA para programação
Pontuação por tarefas
-
1
Claude Opus 4.7
59,79
-
2
Claude Opus 4.6
59,43
-
3
GPT 5.4 2026-03-05
57,49
Quantas tarefas de programação o modelo realmente resolveu em conjuntos fixos de testes — um resultado verificável, não uma opinião. A seleção tem um segundo olhar, baseado em votos humanos às cegas: a ordem lá é diferente, e a distância entre as duas listas diz mais do que cada uma delas separadamente.
de 41 modelos
IA para raciocínio
Pontuação por tarefas
-
1
GPT-5.6 Sol
71,53
-
2
Claude Opus 5
65,91
-
3
Gemini 3.1 Pro Preview
64,89
Tarefas de raciocínio em que a resposta é certa ou errada: conta-se a parte de problemas resolvidos, não as respostas que agradam. Ao lado há um segundo olhar, com votos humanos às cegas. A lógica é onde preferência e problema resolvido mais se separam: um raciocínio bem escrito agrada mesmo quando a sua resposta é errada.
de 91 modelos
IA por amplitude de conhecimento
Pontuação por tarefas
-
1
Gemini 3 Flash Preview
55,84
-
2
Qwen3.6 Max Preview
55,18
-
3
GPT-5.6 Sol
54,72
Um teste de conhecimentos factuais com perguntas que têm uma única resposta correta. Difere das seleções vizinhas porque aqui o modelo não raciocina nem escreve código — ele lembra. O segundo olhar sobre o mesmo tema vem dos votos humanos às cegas.
de 79 modelos
IA para matemática
Pontuação por tarefas
-
1
Claude Fable 5
74,77
-
2
GPT-5.6 Sol
72,1
-
3
Claude Opus 5
71,39
A parte de problemas matemáticos resolvidos, do nível olimpíada ao nível pesquisa. As porcentagens são mais baixas do que nas outras seleções, e isso é uma propriedade dos problemas, não dos modelos: compará-las com os números da seleção de conhecimentos não faz sentido. O segundo olhar vem dos votos humanos às cegas.
de 88 modelos
IA para tarefas de agente
Pontuação por tarefas
-
1
Claude Opus 4.6
40,67
-
2
Claude 4.5 Opus
40,11
-
3
Claude Sonnet 4.5
39,89
Aqui o modelo não responde a uma pergunta, faz o trabalho: edita arquivos em um sistema operacional, pesquisa, completa tarefas em um ambiente de trabalho. Por isso as porcentagens são baixas mesmo nos modelos fortes, e não se comparam com as pontuações da seleção de conhecimentos — é um trabalho diferente, não uma força diferente.
de 32 modelos
IA para inglês
Arena Score, inglês
-
1
Claude Opus 4.6
1.505,8
-
2
Claude Opus 5
1.500,16
-
3
Claude Fable 5
1.498,82
Comparação às cegas de respostas em inglês — a língua em que a maior parte dos modelos foi mais treinada. Um recorte próprio é necessário porque a ordem dos modelos muda visivelmente de uma língua para outra, e a classificação geral não mostra essa diferença.
de 233 modelos
99 sem diferença significativa
IA para francês
Arena Score, francês
-
1
Claude Opus 5
1.522,24
-
2
Claude Fable 5
1.519,66
-
3
GPT-5.6 Terra
1.503,02
Comparação às cegas de respostas em francês. Como nos outros recortes de língua, o interessante não é tanto a pontuação, mas a posição do modelo em relação à sua própria posição nas outras línguas: a constância de língua para língua diz mais do que uma única linha alta.
de 185 modelos
99 sem diferença significativa
IA para espanhol
Arena Score, espanhol
-
1
Claude Opus 4.6
1.511,71
-
2
Claude Fable 5
1.504,09
-
3
Gemini 3.1 Pro Preview
1.479,93
Comparação às cegas de respostas em espanhol. Vale ler ao lado do recorte de inglês: a distância entre as duas posições de um mesmo modelo mostra o quanto ele perde fora da língua em que mais foi treinado.
de 184 modelos
99 sem diferença significativa
As IA mais baratas
Preço, $ por 1M de tokens
-
1
Llama 3.2 1b Instruct
0,01
-
2
Ling 2.6 Flash
0,02
-
3
Google Gemma 2
0,02
O preço do acesso por API por milhão de tokens, em dólares, pela oferta mais barata entre os fornecedores. Entrada e saída são reunidas em um único número: a saída costuma custar várias vezes mais, e ordenar os modelos apenas pelo preço de entrada colocaria no topo algo diferente do mais barato.
de 1508 modelos
IA com contexto longo
Contexto, tokens
-
1
Qwen Long 10M
10.000.000
-
2
Llama 4 Scout 17B 16E Instruct
10.000.000
-
3
Llama 4 Scout 17B 128e Instruct
10.000.000
Quanto texto o modelo aceita em uma única solicitação. O número é declarado pelo desenvolvedor e por enquanto não conseguimos verificá-lo: em janelas longas a qualidade costuma cair muito antes do limite. Esta seleção responde, portanto, se o texto vai caber — não se o modelo vai entendê-lo.
de 1666 modelos
IA multimodais
Arena Score, imagens
-
1
Claude Fable 5
1.334,18
-
2
Claude Opus 5
1.328,68
-
3
Gemini 3.6 Flash
1.315,75
Até que ponto o modelo entende uma imagem junto com o texto: comparação às cegas de respostas a solicitações que trazem uma imagem anexada. Não confundir com a geração de imagens — lá o modelo desenha, aqui ele olha.
de 90 modelos
84 sem diferença significativa
IA para gerar imagens
Arena Score, geração
-
1
GPT Image 2
1.384,81
-
2
Mai Image 2.5
1.256,56
-
3
Nano Banana 2 Lite
1.249,66
Comparação às cegas de imagens prontas: as pessoas escolhem a melhor sem saber qual modelo a desenhou. É um julgamento do resultado a olho, não uma verificação contra uma tarefa; por isso a diferença entre posições vizinhas na maioria das vezes não é estatisticamente significativa.
de 33 modelos
19 sem diferença significativa
IA para gerar vídeo
Arena Score, vídeo
-
1
Sora 2 Pro
1.365,62
-
2
Sora 2
1.337,11
-
3
Seedance v1.5 Pro
1.256,99
A mesma comparação às cegas das imagens, mas para vídeo. Aqui há dez vezes menos modelos do que nas seleções de texto, e as primeiras posições se destacam do resto com mais clareza — simplesmente porque os participantes são poucos.
de 7 modelos
2 sem diferença significativa
IA para desenvolvimento web
Arena Score, web
-
1
Claude Opus 5
1.704,67
-
2
Kimi K3
1.675,56
-
3
Claude Fable 5
1.630,02
Solicitações sobre layout e aplicações web, avaliadas às cegas por pessoas. Difere da seleção de programação na medida: lá são contadas as tarefas resolvidas, aqui qual resultado as pessoas preferiram. Para a web isso é mais próximo do assunto, porque a aparência do resultado é parte do que se julga.
de 77 modelos
70 sem diferença significativa
IA para escrever textos
Arena Score, texto
-
1
Claude Opus 5
1.510,88
-
2
Claude Fable 5
1.498,96
-
3
Gemini 3 Pro
1.481,7
Textos literários e escrita livre, avaliados às cegas por pessoas: um trabalho assim não tem resposta correta, então a preferência é a medida mais honesta disponível. Há também um segundo olhar, de uma rodada de tarefas com nota; ele mede outra coisa e dá outra ordem.
de 236 modelos
99 sem diferença significativa
As melhores IA abertas
Pontuação global
-
1
MiMo V2.5 Pro
99,87
-
2
Kimi K3
99,5
-
3
GLM 5.1
98,05
A mesma pontuação global da classificação geral, mas só entre modelos de pesos abertos — os que podem ser baixados e executados no próprio hardware. A seleção mostra o quanto os modelos abertos ficam atrás dos fechados, e em que tarefas não ficam atrás de forma alguma.
de 106 modelos
98 sem diferença significativa