Anthropic

Claude 4 Sonnet

Tipo
modelo de linguagem
Contexto
1.000K tokens
Saída máxima
64K
Lançado em
29 setembro 2025
Conhecimento até
março 2025
String para a API
claude-sonnet-4-20250514

Preços por fornecedor

Fornecedor Entrada, $ por 1M Saída, $ por 1M Nos nossos dados desde
Jiekou.AI $2,7 $13,5 31 jul 2026
NanoGPT $2,992 $14,994 31 jul 2026
302.AI $3 $15 31 jul 2026
Abacus.AI $3 $15 31 jul 2026
Amazon Bedrock $3 $15 2 ago 2026
Anthropic $3 $15 1 ago 2026
Merge Gateway $3 $15 31 jul 2026

É mostrada apenas a tarifa base e apenas preços por token. Tarifas em lote, reduzidas ou em cache, bem como preços por imagem ou por segundo de vídeo, não entram nesta tabela: não podem ficar na mesma coluna que um preço por milhão de tokens.

A data da última coluna é o dia em que este preço entrou pela primeira vez na nossa recolha. O preço pode ser mais antigo: antes desse dia simplesmente não o registávamos. Desde então não mudou — caso contrário, no seu lugar estaria uma linha nova com uma data nova.

Resultados das medições

Conjunto de tarefas Resultado Condições da execução Medido por
Arena Score, pedidos longos 1.379,71 1.372–1.387
Arena Score, programação 1.379,68 1.372–1.387
Arena Score em francês 1.363,66 1.337–1.390
Arena Score, diálogo de vários turnos 1.363,52 1.356–1.371
Arena Score, matemática 1.357,74 1.346–1.369
Arena Score, pedidos difíceis 1.354,2 1.349–1.360
Arena Score em espanhol 1.350,72 1.329–1.373
Arena Score, seguimento de instruções 1.350,14 1.343–1.357
Arena Score em inglês 1.345,71 1.340–1.351
Arena Score em russo 1.344,73 1.333–1.356
Arena Score, escrita criativa 1.339,09 1.330–1.348
Arena Score, geral 1.337,9 1.334–1.342
Arena Score, perguntas de especialista 1.333,62 1.320–1.347
Arena Score, compreensão de esquemas 1.178,16 1.150–1.207
Arena Score, trabalho com imagens 1.175,73 1.162–1.190
Arena Score, reconhecimento de texto em imagem 1.173,12 1.156–1.191
MATH, nível de dificuldade cinco 84,37 % · com estrutura ajustada Epoch evaluations
Escrita criativa (avaliação de Lech Mazur) 81,4 % orçamento de raciocínio: 16K lechmazur/writing Github repository
GPQA Diamond — perguntas de nível de pós-graduação 72,25 % orçamento de raciocínio: 59K · com estrutura ajustada Epoch evaluations
Mock AIME 2024–2025 — problemas de olimpíada 71,08 % orçamento de raciocínio: 59K · com estrutura ajustada Epoch evaluations
Aider Polyglot — edições de código em seis linguagens 61,3 % · com estrutura ajustada Aider LLM Leaderboards
DeepResearch Bench — pesquisa aprofundada 47,8 % orçamento de raciocínio: 2K DeepResearchBench Leaderboard
Fiction.LiveBench — retenção de contexto longo 46,9 % Fiction.live leaderboard
WeirdML — tarefas incomuns de aprendizagem automática 46,11 % orçamento de raciocínio: 16K WeirdML Leaderboard
OSWorld — trabalho num sistema operativo, primeira versão 43,9 % · com estrutura ajustada OS World Website
ARC-AGI — generalização para padrões novos 40 % orçamento de raciocínio: 16K · com estrutura ajustada ARC Prize Leaderboard
GeoBench — localização de um lugar a partir de uma foto 37 % GeoBench leaderboard
Cybench — tarefas de cibersegurança 35 % · com estrutura ajustada Cybench leaderboard
SimpleBench — perguntas capciosas 34,6 % orçamento de raciocínio: 12K SimpleBench Leaderboard
The Agent Company — tarefas de trabalho num ambiente de escritório 33,1 % TheAgentCompany leaderboard
APEX-Agents 9,3 %
ARC-AGI-2 5,93 % orçamento de raciocínio: 16K
GSO-Bench — otimização de código 4,9 % GSO Leaderboard
Humanity’s Last Exam — perguntas de nível especialista 3,11 %
CritPt — problemas de física 0,29 %