Anthropic

Claude 3.5 Sonnet 2024-10-22

Tipo
modelo de linguagem
Contexto
200K tokens
Saída máxima
8K
String para a API
vercel_ai_gateway/anthropic/claude-3-5-sonnet-20241022

Preços por fornecedor

Fornecedor Entrada, $ por 1M Saída, $ por 1M Nos nossos dados desde
vercel_ai_gateway $3 $15 1 ago 2026
Amazon Bedrock $3 $15 2 ago 2026

É mostrada apenas a tarifa base e apenas preços por token. Tarifas em lote, reduzidas ou em cache, bem como preços por imagem ou por segundo de vídeo, não entram nesta tabela: não podem ficar na mesma coluna que um preço por milhão de tokens.

A data da última coluna é o dia em que este preço entrou pela primeira vez na nossa recolha. O preço pode ser mais antigo: antes desse dia simplesmente não o registávamos. Desde então não mudou — caso contrário, no seu lugar estaria uma linha nova com uma data nova.

Resultados das medições

Conjunto de tarefas Resultado Condições da execução Medido por
Arena Score, programação 1.342,87 1.337–1.348
Arena Score, diálogo de vários turnos 1.325,58 1.320–1.331
Arena Score, pedidos longos 1.311,8 1.306–1.317
Arena Score em inglês 1.307,74 1.304–1.312
Arena Score, matemática 1.306,76 1.300–1.313
Arena Score, pedidos difíceis 1.305,53 1.301–1.310
Arena Score em russo 1.304,29 1.297–1.311
Arena Score em francês 1.301,79 1.280–1.323
Arena Score, geral 1.297,79 1.295–1.301
Arena Score, seguimento de instruções 1.297,5 1.293–1.302
Arena Score, escrita criativa 1.291,87 1.286–1.298
Arena Score em espanhol 1.283,4 1.264–1.303
Arena Score, perguntas de especialista 1.264,39 1.255–1.274
Arena Score, reconhecimento de texto em imagem 1.138,75 1.120–1.158
Arena Score, compreensão de esquemas 1.132,28 1.101–1.164
Arena Score, trabalho com imagens 1.125,48 1.118–1.133
Escrita criativa (avaliação de Lech Mazur) 80,3 % lechmazur/writing Github repository
GeoBench — localização de um lugar a partir de uma foto 62 % GeoBench leaderboard
MATH, nível de dificuldade cinco 56,95 % · com estrutura ajustada Epoch evaluations
Aider Polyglot — edições de código em seis linguagens 51,6 % · com estrutura ajustada Aider LLM Leaderboards
CadEval — construção de modelos CAD por código 48 % CadEval Dashboard
GPQA Diamond — perguntas de nível de pós-graduação 40,4 % · com estrutura ajustada Epoch evaluations
WeirdML — tarefas incomuns de aprendizagem automática 39,97 % WeirdML Leaderboard
BALROG — ambientes de jogo 32,6 % Balrog Leaderboard
SimpleBench — perguntas capciosas 29,68 % SimpleBench Leaderboard
The Agent Company — tarefas de trabalho num ambiente de escritório 24 % TheAgentCompany experiment results github
Mock AIME 2024–2025 — problemas de olimpíada 8,38 % · com estrutura ajustada Epoch evaluations
GSO-Bench — otimização de código 4,6 % GSO Leaderboard
Humanity’s Last Exam — perguntas de nível especialista 0 %