xAI

Grok 4

Tipo
modelo de linguagem
Contexto
256K tokens
Saída máxima
16K
Lançado em
9 julho 2025
String para a API
grok-4-0709

Preços por fornecedor

Fornecedor Entrada, $ por 1M Saída, $ por 1M Nos nossos dados desde
Jiekou.AI $2,7 $13,5 31 jul 2026
Abacus.AI $3 $15 31 jul 2026
xAI $3 $15 31 jul 2026

É mostrada apenas a tarifa base e apenas preços por token. Tarifas em lote, reduzidas ou em cache, bem como preços por imagem ou por segundo de vídeo, não entram nesta tabela: não podem ficar na mesma coluna que um preço por milhão de tokens.

A data da última coluna é o dia em que este preço entrou pela primeira vez na nossa recolha. O preço pode ser mais antigo: antes desse dia simplesmente não o registávamos. Desde então não mudou — caso contrário, no seu lugar estaria uma linha nova com uma data nova.

Resultados das medições

Conjunto de tarefas Resultado Condições da execução Medido por
Arena Score em francês 1.425,25 1.399–1.452
Arena Score, matemática 1.424,24 1.412–1.437
Arena Score em inglês 1.418,4 1.413–1.423
Arena Score, perguntas de especialista 1.417,67 1.404–1.431
Arena Score, diálogo de vários turnos 1.415,59 1.408–1.423
Arena Score em espanhol 1.413,5 1.394–1.433
Arena Score em russo 1.412,96 1.401–1.425
Arena Score, pedidos longos 1.410,19 1.404–1.417
Arena Score, geral 1.409,91 1.406–1.414
Arena Score, programação 1.408,98 1.402–1.416
Arena Score, pedidos difíceis 1.408,55 1.404–1.414
Arena Score, escrita criativa 1.398,43 1.390–1.407
Arena Score, seguimento de instruções 1.387,31 1.381–1.393
Arena Score, trabalho com imagens 1.208,77 1.201–1.216
Arena Score, compreensão de esquemas 1.203,03 1.190–1.216
Arena Score, reconhecimento de texto em imagem 1.194,52 1.186–1.203
Fiction.LiveBench — retenção de contexto longo 94,4 % Fiction.live leaderboard
Mock AIME 2024–2025 — problemas de olimpíada 83,98 % · com estrutura ajustada Epoch evaluations
GPQA Diamond — perguntas de nível de pós-graduação 82,67 % · com estrutura ajustada Epoch evaluations
Aider Polyglot — edições de código em seis linguagens 79,6 % · com estrutura ajustada Aider LLM Leaderboards
Escrita criativa (avaliação de Lech Mazur) 76,9 % lechmazur/writing Github repository
ARC-AGI — generalização para padrões novos 66,67 % · com estrutura ajustada
SimpleBench — perguntas capciosas 52,6 % SimpleBench Leaderboard
SimpleQA Verified — exatidão factual 47,9 % Epoch evaluations
DeepResearch Bench — pesquisa aprofundada 47,9 % DeepResearchBench Leaderboard
WeirdML — tarefas incomuns de aprendizagem automática 45,73 % WeirdML Leaderboard
GeoBench — localização de um lugar a partir de uma foto 45 % GeoBench leaderboard
BALROG — ambientes de jogo 43,6 % Balrog Leaderboard
Cybench — tarefas de cibersegurança 43 % · com estrutura ajustada Grok 4 Model Card autorrelatado
Terminal-Bench — trabalho na linha de comandos 27,2 % · com estrutura ajustada Terminal-Bench v2 Leaderboard
Problemas de xadrez 24,24 % Epoch evaluations
GDPval — tarefas de profissões reais 21,1 % esforço: high
ARC-AGI-2 15,98 %
APEX-Agents 15,2 %