A classificação geral: quatro capacidades reunidas em uma única pontuação, para comparar os modelos como um todo e não por uma única tarefa. É construída com comparações às cegas feitas por pessoas reais: responde a quais respostas são preferidas com mais frequência, não a quantas tarefas foram resolvidas. Para uma habilidade específica, a seleção dedicada é mais precisa.
| # | Modelo | Desenvolvedor | Pontuação global | Acesso$ / 1M | Saída$ / 1M | Contextotokens | código31 % | matemática19 % | conhecimento25 % | raciocínio25 % |
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Claude Opus 5 | Anthropic | 99,44 94–100 | $5 | $25 | 1.000K | 99,9 | 100 | 97,9 | 100 |
| 2 | Claude Opus 4.6 ≈ | Anthropic | 98,24 97–99 | $5 | $25 | 1.000K | 100 | 93,2 | 100 | 98,1 |
| 3 | Claude Fable 5 ≈ | Anthropic | 97,34 95–99 | $10 | $50 | 1.000K | 97 | 98,1 | 98,2 | 96,4 |
| 4 | Claude Opus 4.7 ≈ | Anthropic | 94,76 93–96 | $5 | $25 | 1.000K | 96,5 | 89,6 | 97,5 | 93,7 |
| 5 | Gemini 3.5 Flash ≈ | Google DeepMind | 93,42 91–96 | $1,5 | $9 | 1.049K | 91,9 | 96,2 | 95,3 | 91,3 |
| 6 | Gemini 3.6 Flash ≈ | Google DeepMind | 92,86 89–96 | $1,5 | $7,5 | 1.049K | 92,6 | 93,3 | 94,2 | 91,6 |
| 7 | Kimi K3 ≈ | Moonshot AI (Kimi) | 92,55 89–96 | $2 | $8 | 1.049K | 93,4 | — | 92,9 | 91,2 |
| 8 | MiMo V2.5 Pro ≈ | Xiaomi | 91,91 90–93 | $0,44 | $0,87 | 1.050K | 93,1 | 87,6 | 94,3 | 91,3 |
| 9 | Claude Sonnet 4.6 ≈ | Anthropic | 91,46 90–93 | $3 | $15 | 1.000K | 93,9 | 84,5 | 93,9 | 91,2 |
| 10 | Muse Spark 1.1 ≈ | Meta AI | 90,77 88–94 | $1,25 | $4,25 | 1.049K | 92,6 | 86,3 | 91,3 | 91,4 |
| 11 | Gemini 3.1 Pro Preview ≈ | Google DeepMind | 90,7 90–92 | $2 | $12 | 1.049K | 90,4 | 89,7 | 91,4 | 91,1 |
| 12 | GPT-5.6 Terra ≈ | OpenAI | 90,54 88–94 | $2 | $12 | 1.050K | 91,3 | 86,6 | 94,7 | 88,4 |
| 13 | ERNIE 5.1 ≈ | Baidu (Ernie) | 90,44 89–92 | $0,75 | $3 | 119K | 91,3 | 87,8 | 91,4 | 90,4 |
| 14 | GLM 5.1 ≈ | Zhipu AI / Z.ai | 90,32 89–92 | $0,06 | $0,22 | 205K | 92,1 | 87,8 | 90,9 | 89,5 |
| 15 | Claude 4.5 Opus ≈ | Anthropic | 90,05 89–91 | $5 | $25 | 200K | 93,1 | 84,2 | 91,4 | 89,4 |
| 16 | GPT-5.6 Sol ≈ | OpenAI | 89,99 87–93 | $5 | $30 | 1.050K | 90,8 | 83 | 94,6 | 89,6 |
| 17 | Kimi K2.6 ≈ | Moonshot AI (Kimi) | 89,81 88–91 | $0,22 | $1,14 | 262K | 91 | 87 | 92 | 88,4 |
| 18 | Gemini 3 Pro ≈ | Google DeepMind | 89,79 88–91 | $1,6 | $9,6 | 1.049K | 90,2 | 87,3 | 90,3 | 90,7 |
| 19 | Claude Opus 4.8 ≈ | Anthropic | 89,62 88–91 | $5 | $25 | 1.000K | 90,7 | 85,5 | 91,8 | 89,1 |
| 20 | Claude Sonnet 5 ≈ | Anthropic | 89,25 87–92 | $2 | $10 | 1.000K | 90,7 | 84,8 | 93 | 87 |
| 21 | Grok 4.5 ≈ | xAI | 88,91 86–92 | $2 | $6 | 500K | 89,5 | 88,8 | 89,9 | 87,3 |
| 22 | GLM 5.2 ≈ | Zhipu AI / Z.ai | 88,41 86–90 | $0,42 | $1,32 | 1.049K | 89,2 | 86,4 | 88,5 | 88,9 |
| 23 | Qwen3.7 Plus ≈ | Alibaba (Qwen) | 88,17 86–90 | $0,5 | $3 | 1.000K | 90 | 86 | 88,3 | 87,3 |
| 24 | MiMo V2 Pro ≈ | Xiaomi | 87,26 85–89 | $0,44 | $0,87 | 1.049K | 89 | 82 | 90 | 86,3 |
| 25 | Kimi K2.5 Thinking TEE ≈ | Moonshot AI (Kimi) | 87,2 86–88 | $0,3 | $1,9 | 256K | 88,5 | 86,3 | 87,9 | 85,6 |
| 26 | Inkling ≈ | Thinking Machines Lab | 87,07 84–90 | $1,87 | $4,68 | 1.049K | 87,3 | 87,7 | 88,3 | 85,1 |
| 27 | Gemini 3 Flash ≈ | Google DeepMind | 87,02 85–89 | $0,4 | $2,4 | 1.049K | 86,4 | 86,9 | 87,4 | 87,5 |
| 28 | Qwen3.6 Max Preview ≈ | Alibaba (Qwen) | 86,93 83–90 | $1,3 | $7,8 | 262K | 87,3 | 84,7 | 89,2 | 85,9 |
| 29 | GPT-5.6 Luna ≈ | OpenAI | 86,92 84–90 | $0,2 | $1,2 | 1.050K | 88,1 | 82,4 | 90,3 | 85,4 |
| 30 | Claude Sonnet 4.5 ≈ | Anthropic | 86,77 86–88 | $3 | $15 | 1.000K | 90,7 | 77,1 | 89 | 87 |
| 31 | Hy3 ≈ | Tencent (Hunyuan) | 86,42 83–90 | $0,13 | $0,53 | 262K | 87,3 | — | 87,1 | 84,6 |
| 32 | DeepSeek V4 Pro ≈ | DeepSeek | 86,26 85–88 | $0,44 | $0,87 | 1.049K | 87,9 | 81 | 87,6 | 86,8 |
| 33 | MiniMax M3 ≈ | MiniMax | 86,02 84–88 | $0,3 | $1,2 | 1.049K | 88,3 | 80,9 | 88,4 | 84,6 |
| 34 | Qwen3.5 397B-A17B ≈ | Alibaba (Qwen) | 85,78 85–87 | $0,6 | $3,6 | 262K | 87 | 82,2 | 88,1 | 84,7 |
| 35 | MiMo V2.5 ≈ | Xiaomi | 85,49 84–87 | $0,14 | $0,28 | 1.050K | 87,7 | 80,5 | 87,2 | 84,8 |
| 36 | Qwen3.6 Plus ≈ | Alibaba (Qwen) | 85,4 84–87 | $0,5 | $3 | 1.000K | 87 | 82,6 | 86,4 | 84,5 |
| 37 | GLM 5V Turbo ≈ | Zhipu AI / Z.ai | 85,1 82–88 | $0,7 | $3,1 | 203K | 87,3 | 83,2 | 85,1 | 83,7 |
| 38 | Qwen3 Max Preview ≈ | Alibaba (Qwen) | 85,01 83–87 | $1,2 | $6 | 256K | 85,4 | 82,4 | 86,9 | 84,6 |
| 39 | Gemma 4 31B ≈ | Google DeepMind | 84,93 81–88 | $0,14 | $0,4 | 262K | 85 | 85,4 | 85,4 | 84 |
| 40 | Seed 2.0 Pro ≈ | ByteDance (Doubao) | 84,83 84–86 | $0,5 | $3 | 131K | 88 | 80,3 | 83,6 | 85,6 |
| 41 | Gemini 2.5 Pro ≈ | Google DeepMind | 84,8 84–86 | $1,25 | $10 | 1.049K | 84,5 | 82,5 | 86 | 85,7 |
| 42 | GLM 5 ≈ | Zhipu AI / Z.ai | 84,76 83–86 | $0,48 | $1,9 | 205K | 86 | 80,2 | 86,3 | 85,1 |
| 43 | Grok 4.20 (Reasoning) ≈ | xAI | 84,59 83–86 | $2 | $6 | 2.000K | 85,7 | 83,7 | 83,3 | 85,2 |
| 44 | Grok 4.20 Multi Agent Beta 0309 ≈ | xAI | 84,06 83–85 | $2 | $6 | 2.000K | 85,5 | 80,4 | 84,5 | 84,6 |
| 45 | MiMo V2 Omni ≈ | Xiaomi | 83,95 82–86 | $0,14 | $0,28 | 262K | 86,9 | 79 | 84,3 | 83,6 |
| 46 | Gemma 4 26B-A4B ≈ | Google DeepMind | 83,89 80–87 | $0,05 | $0,29 | 262K | 82,9 | 85,5 | 84,9 | 82,9 |
| 47 | Longcat Flash Chat ≈ | Meituan | 83,66 81–87 | — | — | 131K | 87,4 | 80,7 | 83,2 | 81,7 |
| 48 | DeepSeek V4 Flash ≈ | DeepSeek | 83,24 82–85 | $0,14 | $0,28 | 1.049K | 85,2 | 78,2 | 84,1 | 83,7 |
| 49 | Claude 4.1 Opus ≈ | Anthropic | 83,11 82–84 | $15 | $75 | 200K | 88,4 | 77,1 | 80,9 | 83,2 |
| 50 | Mistral Medium 3.5 ≈ | Mistral AI | 82,96 80–86 | $1,5 | $7,5 | 262K | 86 | 79,3 | 82,5 | 82,4 |
| 51 | GPT-5.2 Chat ≈ | OpenAI | 82,77 81–84 | $1,75 | $14 | 128K | 83,4 | 79,4 | 83,3 | 84 |
| 52 | GLM 4.6 ≈ | Zhipu AI / Z.ai | 82,44 81–84 | $0,29 | $1,14 | 205K | 83,9 | 79,1 | 82,5 | 83,1 |
| 53 | Gemini 3.5 Flash Lite ≈ | Google DeepMind | 82,28 79–86 | $0,3 | $2,5 | 1.049K | 85,1 | 75,8 | 82,6 | 83,3 |
| 54 | Qwen3 235B A22B Instruct 2507 ≈ | Alibaba (Qwen) | 82,25 81–83 | $0,1 | $0,1 | 262K | 83,1 | 78,9 | 84,2 | 81,8 |
| 55 | DeepSeek V3.2 ≈ | DeepSeek | 82,25 81–84 | $0,28 | $0,4 | 164K | 83,8 | 79,8 | 82,6 | 81,8 |
| 56 | Kimi K2 Thinking Turbo ≈ | Moonshot AI (Kimi) | 82,12 81–83 | $1,15 | $8 | 262K | 84,7 | 78,5 | 83,1 | 80,7 |
| 57 | GLM 4.7 ≈ | Zhipu AI / Z.ai | 82,04 79–85 | $0,15 | $0,8 | 205K | 85,1 | 77,4 | 80 | 83,7 |
| 58 | Qwen3 VL 235B A22B Instruct ≈ | Alibaba (Qwen) | 81,73 79–85 | $0,4 | $1,6 | 262K | 82,2 | 77,9 | 84,6 | 81,2 |
| 59 | MiniMax M2.7 ≈ | MiniMax | 81,44 80–83 | $0,3 | $1,2 | 205K | 84,3 | 76,8 | 83,1 | 79,7 |
| 60 | Qwen3 Next 80B A3B Instruct ≈ | Alibaba (Qwen) | 80,72 79–83 | $0,15 | $1,2 | 262K | 82,4 | 80,9 | 78,4 | 80,8 |
| 61 | Qwen3.5 122B-A10B ≈ | Alibaba (Qwen) | 80,66 79–82 | $0,4 | $3,2 | 262K | 81,4 | 78,4 | 82,5 | 79,6 |
| 62 | Grok 4.1 ≈ | xAI | 80,57 79–82 | $2 | $10 | 200K | 83 | 76,3 | 79 | 82,3 |
| 63 | GLM 4.5 ≈ | Zhipu AI / Z.ai | 80,51 78–83 | $0,2 | $0,8 | 131K | 80,9 | 78,1 | 81,4 | 80,9 |
| 64 | Claude Haiku 4.5 ≈ | Anthropic | 80,49 79–82 | $1 | $5 | 200K | 84,2 | 71,7 | 84,1 | 78,9 |
| 65 | Mistral Large 3 ≈ | Mistral AI | 80,43 79–82 | $0,5 | $1,5 | 256K | 82,9 | 75,9 | 80 | 81,2 |
| 66 | Qwen3 235B A22B Thinking-2507 ≈ | Alibaba (Qwen) | 80,06 77–83 | $0,1 | $0,1 | 262K | 79,1 | 75,5 | 86,2 | 78,5 |
| 67 | GPT-5.5 Instant ≈ | OpenAI | 79,81 78–82 | $5 | $30 | 400K | 81,1 | 77,4 | 79,2 | 80,6 |
| 68 | Qwen3 Max 2025-09-23 ≈ | Alibaba (Qwen) | 79,78 77–83 | $0,86 | $3,43 | 258K | 82 | 80,3 | 76,2 | 80,2 |
| 69 | Qwen3.5 27B ≈ | Alibaba (Qwen) | 79,41 78–81 | $0,3 | $2,4 | 262K | 79,3 | 79,3 | 80,9 | 78,1 |
| 70 | MiMo V2 Flash ≈ | Xiaomi | 79,41 78–81 | $0,14 | $0,28 | 262K | 82,4 | 72,3 | 81,2 | 79,3 |
| 71 | DeepSeek V3.2 Exp ≈ | DeepSeek | 79,28 77–82 | $0,22 | $0,33 | 164K | 80,9 | 77,6 | 76,7 | 81,1 |
| 72 | Mistral Medium 3.1 ≈ | Mistral AI | 79,14 78–80 | $0,4 | $2 | 262K | 81,2 | 75 | 78,2 | 80,6 |
| 73 | Step 3.5 Flash ≈ | StepFun | 79 78–80 | $0,1 | $0,3 | 262K | 81,6 | 74,3 | 80,6 | 77,8 |
| 74 | Gemini 2.5 Flash ≈ | Google DeepMind | 78,92 78–80 | $0,3 | $2,5 | 1.049K | 79,1 | 75 | 80,9 | 79,8 |
| 75 | Qwen3 VL 235B A22B Thinking ≈ | Alibaba (Qwen) | 78,45 75–82 | $0,4 | $4 | 262K | 79,9 | 75,8 | 80,1 | 77,1 |
| 76 | Grok 4 ≈ | xAI | 77,59 76–79 | $3 | $15 | 256K | 76,3 | 77,6 | 79,6 | 77,2 |
| 77 | DeepSeek V3.1 ≈ | DeepSeek | 77,52 75–80 | $0,2 | $0,7 | 164K | 77,4 | 77 | 77,1 | 78,4 |
| 78 | DeepSeek R1 0528 ≈ | DeepSeek | 77,41 75–80 | $0,25 | $0,25 | 164K | 79,7 | 73,8 | 76,1 | 78,5 |
| 79 | 2025) ≈ | Google DeepMind | 77,24 75–79 | $0,3 | $2,5 | 1.049K | 75 | 76,1 | 80,9 | 77,3 |
| 80 | ChatGPT 4o Latest ≈ | OpenAI | 77,24 76–78 | $5 | $15 | 128K | 77,4 | 74,1 | 76,5 | 80,2 |
| 81 | Qwen3.5 Flash ≈ | Alibaba (Qwen) | 76,86 76–78 | $0,09 | $0,36 | 1.000K | 77,2 | 74,8 | 78,5 | 76,4 |
| 82 | Grok 4 Fast Reasoning ≈ | xAI | 76,75 74–79 | $0,2 | $0,5 | 2.000K | 78,1 | 73,7 | 77,9 | 76,2 |
| 83 | o3 2025-04-16 ≈ | OpenAI | 76,5 75–78 | $2 | $8 | 200K | 76,2 | 77,6 | 76,6 | 76 |
| 84 | Gemini 3.1 Flash Lite Preview ≈ | Google DeepMind | 76,4 75–78 | $0,25 | $1,5 | 1.049K | 74,6 | 78,9 | 76,3 | 76,9 |
| 85 | Grok 4.1 Fast Reasoning ≈ | xAI | 76,38 75–78 | $0,2 | $0,5 | 2.000K | 76,9 | 74 | 76,8 | 77,1 |
| 86 | Qwen3.5 35B A3B ≈ | Alibaba (Qwen) | 76,13 74–78 | $0,25 | $2 | 262K | 76,4 | 74 | 77,8 | 75,7 |
| 87 | GPT 5 Chat ≈ | OpenAI | 75,95 74–78 | $1,25 | $10 | 128K | 74,7 | 74,7 | 77,8 | 76,6 |
| 88 | MiMo V2 Flash (Thinking) ≈ | Xiaomi | 75,7 73–78 | $0,1 | $0,31 | 256K | 77,9 | 69,1 | 77,1 | 76,5 |
| 89 | Qwen3 30B A3B Instruct 2507 ≈ | Alibaba (Qwen) | 75,43 73–77 | $0,05 | $0,19 | 262K | 77,9 | 72,1 | 75,1 | 75,2 |
| 90 | DeepSeek V3.1 Terminus ≈ | DeepSeek | 75,4 71–80 | $0,21 | $0,79 | 164K | 75,9 | 72,8 | — | 76,7 |
| 91 | GPT 4.5 Preview ≈ | OpenAI | 75,22 72–78 | $75 | $150 | 128K | 74,1 | 75,3 | 75,5 | 76,3 |
| 92 | Grok 4.3 ≈ | xAI | 75,12 74–77 | $1,25 | $2,5 | 1.000K | 77,6 | 71,4 | 74,4 | 75,6 |
| 93 | GPT-5.3 Chat (latest) ≈ | OpenAI | 74,63 73–76 | $1,75 | $14 | 128K | 75,8 | 70,2 | 76 | 75,1 |
| 94 | NVIDIA Nemotron 3 Super 120B A12B ≈ | NVIDIA | 74,16 71–77 | $0,15 | $0,65 | 262K | 75,8 | 69,8 | 76,1 | 73,5 |
| 95 | Nemotron 3 Super ≈ | NVIDIA | 74,16 71–77 | $0,2 | $0,8 | 1.000K | 75,8 | 69,8 | 76,1 | 73,5 |
| 96 | Hunyuan T1 ≈ | Tencent (Hunyuan) | 74,09 69–79 | — | — | 131K | 72,3 | 74,9 | 74,5 | 75,4 |
| 97 | Kimi K2 0905 Preview ≈ | Moonshot AI (Kimi) | 72,74 70–76 | $0,6 | $2,5 | 262K | 74,6 | 72,6 | 70,9 | 72,4 |
| 98 | GLM 4.5 Air ≈ | Zhipu AI / Z.ai | 72,46 71–74 | $0,11 | $0,29 | 131K | 74 | 72,6 | 71,3 | 71,6 |
| 99 | Claude 4 Opus ≈ | Anthropic | 71,9 70–74 | $15 | $75 | 200K | 75 | 68,1 | 71,6 | 71,2 |
| 100 | Qwen3 Next 80B A3B Thinking ≈ | Alibaba (Qwen) | 71,72 69–74 | $0,15 | $1,2 | 262K | 73,1 | 72,2 | 71,2 | 70,2 |
A tabela rola na horizontal: nem todas as colunas cabem.
As colunas da direita são as parcelas da pontuação, trazidas para uma escala comum de 0 a 100 pela dispersão real entre os modelos medidos. Somadas com os pesos indicados, dão o número da coluna principal: nelas dá para ver em que exatamente um modelo superou outro. Um travessão significa “não medido”, não zero.
O preço é o mais baixo entre os fornecedores do modelo, tarifa base, sem tarifas em lote nem reduzidas. A entrada e a saída são mostradas separadamente de propósito: na maioria dos modelos a saída custa várias vezes mais que a entrada, e a conta final depende do que predomina na tarefa.
O sinal ≈ marca os modelos cujo intervalo de confiança se sobrepõe ao da linha acima. Aqui há 99 modelos — a ordem entre eles não é determinada pelos dados disponíveis.
O intervalo de confiança de metade dos modelos ultrapassa 3,5 pontos — ou seja, cerca de 13 linhas adjacentes da tabela. Dentro desse grupo a ordem não é dada pelos dados, mas por quem votou desta vez; os dados sustentam a diferença entre o início e o fim da lista, mas não a vizinhança dos lugares.