Anthropic

Claude 4.1 Opus

Tipo
modelo de linguagem
Contexto
200K tokens
Saída máxima
32K
Lançado em
5 agosto 2025
Conhecimento até
março 2025
String para a API
claude-opus-4-1-20250805

Preços por fornecedor

Fornecedor Entrada, $ por 1M Saída, $ por 1M Nos nossos dados desde
Jiekou.AI $13,5 $67,5 31 jul 2026
NanoGPT $14,994 $75,004 31 jul 2026
302.AI $15 $75 31 jul 2026
Abacus.AI $15 $75 31 jul 2026
Amazon Bedrock $15 $75 2 ago 2026
Anthropic $15 $75 31 jul 2026
Helicone $15 $75 31 jul 2026
LLM Gateway $15 $75 31 jul 2026
Merge Gateway $15 $75 31 jul 2026

É mostrada apenas a tarifa base e apenas preços por token. Tarifas em lote, reduzidas ou em cache, bem como preços por imagem ou por segundo de vídeo, não entram nesta tabela: não podem ficar na mesma coluna que um preço por milhão de tokens.

A data da última coluna é o dia em que este preço entrou pela primeira vez na nossa recolha. O preço pode ser mais antigo: antes desse dia simplesmente não o registávamos. Desde então não mudou — caso contrário, no seu lugar estaria uma linha nova com uma data nova.

Resultados das medições

Conjunto de tarefas Resultado Condições da execução Medido por
Arena Score, programação 1.473,09 1.468–1.478
Arena Score, pedidos longos 1.445,19 1.440–1.450
Arena Score em espanhol 1.444,59 1.430–1.459
Arena Score, diálogo de vários turnos 1.441,82 1.436–1.448
Arena Score, pedidos difíceis 1.441,49 1.438–1.445
Arena Score, seguimento de instruções 1.433,82 1.429–1.439
Arena Score em inglês 1.428,72 1.425–1.433
Arena Score em francês 1.427,47 1.410–1.445
Arena Score, perguntas de especialista 1.425,18 1.415–1.435
Arena Score em russo 1.422,37 1.414–1.430
Arena Score, matemática 1.421,84 1.413–1.430
Arena Score, geral 1.417,42 1.414–1.420
Arena Score, escrita criativa 1.410,22 1.404–1.416
Arena Score, desenvolvimento web 1.388,74 1.378–1.400
Escrita criativa (avaliação de Lech Mazur) 84,7 % lechmazur/writing Github repository
SWE-bench Verified — correção de erros em repositórios 73,35 % · com estrutura ajustada Epoch evaluations
GPQA Diamond — perguntas de nível de pós-graduação 69,7 % orçamento de raciocínio: 27K · com estrutura ajustada Epoch evaluations
Mock AIME 2024–2025 — problemas de olimpíada 68,86 % orçamento de raciocínio: 27K · com estrutura ajustada Epoch evaluations
SimpleBench — perguntas capciosas 52 % SimpleBench Leaderboard
DeepResearch Bench — pesquisa aprofundada 49,7 % DeepResearchBench Leaderboard
GDPval — tarefas de profissões reais 43,6 %
WeirdML — tarefas incomuns de aprendizagem automática 42,76 % orçamento de raciocínio: 16K WeirdML Leaderboard
Cybench — tarefas de cibersegurança 42 % · com estrutura ajustada Cybench leaderboard
Terminal-Bench — trabalho na linha de comandos 38 % · com estrutura ajustada Terminal-Bench v2 Leaderboard
SimpleQA Verified — exatidão factual 34,8 % orçamento de raciocínio: 27K Epoch evaluations
FrontierMath, níveis 1–3 12,63 % orçamento de raciocínio: 32K Epoch evaluations
Humanity’s Last Exam — perguntas de nível especialista 7,06 %
FrontierMath, nível 4 — problemas de investigação 2,44 % orçamento de raciocínio: 32K Epoch evaluations
Problemas de xadrez 2,15 % Epoch evaluations