Recursos

Ranking de redes neurais

Modelos de IA, os preços dos seus fornecedores e rankings a partir de medições independentes. Sob cada tabela está escrito de onde vem o número, quem o mediu, quando e até que ponto se pode confiar nele.

2219modelos
144desenvolvedores
257fornecedores de API
9fontes de dados

Último recálculo: 7 agosto 2026

As melhores IA

Pontuação global

  1. 1 Claude Opus 5 99,44
  2. 2 Claude Opus 4.6 98,24
  3. 3 Claude Fable 5 97,34

A classificação geral: quatro capacidades reunidas em uma única pontuação, para comparar os modelos como um todo e não por uma única tarefa. É construída com comparações às cegas feitas por pessoas reais: responde a quais respostas são preferidas com mais frequência, não a quantas tarefas foram resolvidas. Para uma habilidade específica, a seleção dedicada é mais precisa.

de 235 modelos 99 sem diferença significativa

IA para programação

Pontuação por tarefas

  1. 1 Claude Opus 4.7 59,79
  2. 2 Claude Opus 4.6 59,43
  3. 3 GPT 5.4 2026-03-05 57,49

Quantas tarefas de programação o modelo realmente resolveu em conjuntos fixos de testes — um resultado verificável, não uma opinião. A seleção tem um segundo olhar, baseado em votos humanos às cegas: a ordem lá é diferente, e a distância entre as duas listas diz mais do que cada uma delas separadamente.

de 41 modelos

IA para raciocínio

Pontuação por tarefas

  1. 1 GPT-5.6 Sol 71,53
  2. 2 Claude Opus 5 65,91
  3. 3 Gemini 3.1 Pro Preview 64,89

Tarefas de raciocínio em que a resposta é certa ou errada: conta-se a parte de problemas resolvidos, não as respostas que agradam. Ao lado há um segundo olhar, com votos humanos às cegas. A lógica é onde preferência e problema resolvido mais se separam: um raciocínio bem escrito agrada mesmo quando a sua resposta é errada.

de 91 modelos

IA para matemática

Pontuação por tarefas

  1. 1 Claude Fable 5 74,77
  2. 2 GPT-5.6 Sol 72,1
  3. 3 Claude Opus 5 71,39

A parte de problemas matemáticos resolvidos, do nível olimpíada ao nível pesquisa. As porcentagens são mais baixas do que nas outras seleções, e isso é uma propriedade dos problemas, não dos modelos: compará-las com os números da seleção de conhecimentos não faz sentido. O segundo olhar vem dos votos humanos às cegas.

de 88 modelos

IA para tarefas de agente

Pontuação por tarefas

  1. 1 Claude Opus 4.6 40,67
  2. 2 Claude 4.5 Opus 40,11
  3. 3 Claude Sonnet 4.5 39,89

Aqui o modelo não responde a uma pergunta, faz o trabalho: edita arquivos em um sistema operacional, pesquisa, completa tarefas em um ambiente de trabalho. Por isso as porcentagens são baixas mesmo nos modelos fortes, e não se comparam com as pontuações da seleção de conhecimentos — é um trabalho diferente, não uma força diferente.

de 32 modelos

IA para inglês

Arena Score, inglês

  1. 1 Claude Opus 4.6 1.505,8
  2. 2 Claude Opus 5 1.500,16
  3. 3 Claude Fable 5 1.498,82

Comparação às cegas de respostas em inglês — a língua em que a maior parte dos modelos foi mais treinada. Um recorte próprio é necessário porque a ordem dos modelos muda visivelmente de uma língua para outra, e a classificação geral não mostra essa diferença.

de 233 modelos 99 sem diferença significativa

IA para francês

Arena Score, francês

  1. 1 Claude Opus 5 1.522,24
  2. 2 Claude Fable 5 1.519,66
  3. 3 GPT-5.6 Terra 1.503,02

Comparação às cegas de respostas em francês. Como nos outros recortes de língua, o interessante não é tanto a pontuação, mas a posição do modelo em relação à sua própria posição nas outras línguas: a constância de língua para língua diz mais do que uma única linha alta.

de 185 modelos 99 sem diferença significativa

IA para espanhol

Arena Score, espanhol

  1. 1 Claude Opus 4.6 1.511,71
  2. 2 Claude Fable 5 1.504,09
  3. 3 Gemini 3.1 Pro Preview 1.479,93

Comparação às cegas de respostas em espanhol. Vale ler ao lado do recorte de inglês: a distância entre as duas posições de um mesmo modelo mostra o quanto ele perde fora da língua em que mais foi treinado.

de 184 modelos 99 sem diferença significativa

As IA mais baratas

Preço, $ por 1M de tokens

  1. 1 Llama 3.2 1b Instruct 0,01
  2. 2 Ling 2.6 Flash 0,02
  3. 3 Google Gemma 2 0,02

O preço do acesso por API por milhão de tokens, em dólares, pela oferta mais barata entre os fornecedores. Entrada e saída são reunidas em um único número: a saída costuma custar várias vezes mais, e ordenar os modelos apenas pelo preço de entrada colocaria no topo algo diferente do mais barato.

de 1508 modelos

IA com contexto longo

Contexto, tokens

  1. 1 Qwen Long 10M 10.000.000
  2. 2 Llama 4 Scout 17B 16E Instruct 10.000.000
  3. 3 Llama 4 Scout 17B 128e Instruct 10.000.000

Quanto texto o modelo aceita em uma única solicitação. O número é declarado pelo desenvolvedor e por enquanto não conseguimos verificá-lo: em janelas longas a qualidade costuma cair muito antes do limite. Esta seleção responde, portanto, se o texto vai caber — não se o modelo vai entendê-lo.

de 1666 modelos

IA multimodais

Arena Score, imagens

  1. 1 Claude Fable 5 1.334,18
  2. 2 Claude Opus 5 1.328,68
  3. 3 Gemini 3.6 Flash 1.315,75

Até que ponto o modelo entende uma imagem junto com o texto: comparação às cegas de respostas a solicitações que trazem uma imagem anexada. Não confundir com a geração de imagens — lá o modelo desenha, aqui ele olha.

de 90 modelos 84 sem diferença significativa

IA para gerar imagens

Arena Score, geração

  1. 1 GPT Image 2 1.384,81
  2. 2 Mai Image 2.5 1.256,56
  3. 3 Nano Banana 2 Lite 1.249,66

Comparação às cegas de imagens prontas: as pessoas escolhem a melhor sem saber qual modelo a desenhou. É um julgamento do resultado a olho, não uma verificação contra uma tarefa; por isso a diferença entre posições vizinhas na maioria das vezes não é estatisticamente significativa.

de 33 modelos 19 sem diferença significativa

IA para gerar vídeo

Arena Score, vídeo

  1. 1 Sora 2 Pro 1.365,62
  2. 2 Sora 2 1.337,11
  3. 3 Seedance v1.5 Pro 1.256,99

A mesma comparação às cegas das imagens, mas para vídeo. Aqui há dez vezes menos modelos do que nas seleções de texto, e as primeiras posições se destacam do resto com mais clareza — simplesmente porque os participantes são poucos.

de 7 modelos 2 sem diferença significativa

IA para desenvolvimento web

Arena Score, web

  1. 1 Claude Opus 5 1.704,67
  2. 2 Kimi K3 1.675,56
  3. 3 Claude Fable 5 1.630,02

Solicitações sobre layout e aplicações web, avaliadas às cegas por pessoas. Difere da seleção de programação na medida: lá são contadas as tarefas resolvidas, aqui qual resultado as pessoas preferiram. Para a web isso é mais próximo do assunto, porque a aparência do resultado é parte do que se julga.

de 77 modelos 70 sem diferença significativa

IA para escrever textos

Arena Score, texto

  1. 1 Claude Opus 5 1.510,88
  2. 2 Claude Fable 5 1.498,96
  3. 3 Gemini 3 Pro 1.481,7

Textos literários e escrita livre, avaliados às cegas por pessoas: um trabalho assim não tem resposta correta, então a preferência é a medida mais honesta disponível. Há também um segundo olhar, de uma rodada de tarefas com nota; ele mede outra coisa e dá outra ordem.

de 236 modelos 99 sem diferença significativa

As melhores IA abertas

Pontuação global

  1. 1 MiMo V2.5 Pro 99,87
  2. 2 Kimi K3 99,5
  3. 3 GLM 5.1 98,05

A mesma pontuação global da classificação geral, mas só entre modelos de pesos abertos — os que podem ser baixados e executados no próprio hardware. A seleção mostra o quanto os modelos abertos ficam atrás dos fechados, e em que tarefas não ficam atrás de forma alguma.

de 106 modelos 98 sem diferença significativa

Fontes de dados

O catálogo, os preços e as avaliações são coletados de fontes abertas; o direito de republicação é verificado na licença antes de um número chegar ao site. Sob cada tabela indicamos quem mediu o que ela mostra e quando. Os números que não podem ser publicados servem apenas para conferência e não são mostrados no site.