grok-4-0709| Fornecedor | Entrada, $ por 1M | Saída, $ por 1M | Nos nossos dados desde |
|---|---|---|---|
| Jiekou.AI | $2,7 | $13,5 | 31 jul 2026 |
| Abacus.AI | $3 | $15 | 31 jul 2026 |
| xAI | $3 | $15 | 31 jul 2026 |
É mostrada apenas a tarifa base e apenas preços por token. Tarifas em lote, reduzidas ou em cache, bem como preços por imagem ou por segundo de vídeo, não entram nesta tabela: não podem ficar na mesma coluna que um preço por milhão de tokens.
A data da última coluna é o dia em que este preço entrou pela primeira vez na nossa recolha. O preço pode ser mais antigo: antes desse dia simplesmente não o registávamos. Desde então não mudou — caso contrário, no seu lugar estaria uma linha nova com uma data nova.
| Conjunto de tarefas | Resultado | Condições da execução | Medido por |
|---|---|---|---|
| Arena Score em francês | 1.425,25 1.399–1.452 | — | — |
| Arena Score, matemática | 1.424,24 1.412–1.437 | — | — |
| Arena Score em inglês | 1.418,4 1.413–1.423 | — | — |
| Arena Score, perguntas de especialista | 1.417,67 1.404–1.431 | — | — |
| Arena Score, diálogo de vários turnos | 1.415,59 1.408–1.423 | — | — |
| Arena Score em espanhol | 1.413,5 1.394–1.433 | — | — |
| Arena Score em russo | 1.412,96 1.401–1.425 | — | — |
| Arena Score, pedidos longos | 1.410,19 1.404–1.417 | — | — |
| Arena Score, geral | 1.409,91 1.406–1.414 | — | — |
| Arena Score, programação | 1.408,98 1.402–1.416 | — | — |
| Arena Score, pedidos difíceis | 1.408,55 1.404–1.414 | — | — |
| Arena Score, escrita criativa | 1.398,43 1.390–1.407 | — | — |
| Arena Score, seguimento de instruções | 1.387,31 1.381–1.393 | — | — |
| Arena Score, trabalho com imagens | 1.208,77 1.201–1.216 | — | — |
| Arena Score, compreensão de esquemas | 1.203,03 1.190–1.216 | — | — |
| Arena Score, reconhecimento de texto em imagem | 1.194,52 1.186–1.203 | — | — |
| Fiction.LiveBench — retenção de contexto longo | 94,4 % | — | Fiction.live leaderboard |
| Mock AIME 2024–2025 — problemas de olimpíada | 83,98 % | · com estrutura ajustada | Epoch evaluations |
| GPQA Diamond — perguntas de nível de pós-graduação | 82,67 % | · com estrutura ajustada | Epoch evaluations |
| Aider Polyglot — edições de código em seis linguagens | 79,6 % | · com estrutura ajustada | Aider LLM Leaderboards |
| Escrita criativa (avaliação de Lech Mazur) | 76,9 % | — | lechmazur/writing Github repository |
| ARC-AGI — generalização para padrões novos | 66,67 % | · com estrutura ajustada | — |
| SimpleBench — perguntas capciosas | 52,6 % | — | SimpleBench Leaderboard |
| SimpleQA Verified — exatidão factual | 47,9 % | — | Epoch evaluations |
| DeepResearch Bench — pesquisa aprofundada | 47,9 % | — | DeepResearchBench Leaderboard |
| WeirdML — tarefas incomuns de aprendizagem automática | 45,73 % | — | WeirdML Leaderboard |
| GeoBench — localização de um lugar a partir de uma foto | 45 % | — | GeoBench leaderboard |
| BALROG — ambientes de jogo | 43,6 % | — | Balrog Leaderboard |
| Cybench — tarefas de cibersegurança | 43 % | · com estrutura ajustada | Grok 4 Model Card autorrelatado |
| Terminal-Bench — trabalho na linha de comandos | 27,2 % | · com estrutura ajustada | Terminal-Bench v2 Leaderboard |
| Problemas de xadrez | 24,24 % | — | Epoch evaluations |
| GDPval — tarefas de profissões reais | 21,1 % | esforço: high | — |
| ARC-AGI-2 | 15,98 % | — | — |
| APEX-Agents | 15,2 % | — | — |