OpenAI

o3 2025-04-16

Tipo
modelo de linguagem
Contexto
200K tokens
Saída máxima
100K
String para a API
azure/o3-2025-04-16

O fornecedor declarou este modelo obsoleto. Ainda responde, mas é melhor não iniciar projetos novos com ele.

Preços por fornecedor

Fornecedor Entrada, $ por 1M Saída, $ por 1M Nos nossos dados desde
Microsoft Foundry azure/o3-2025-04-16 $2 $8 31 jul 2026
OpenAI $2 $8 31 jul 2026
Microsoft Foundry azure/us/o3-2025-04-16 $2,2 $8,8 31 jul 2026

É mostrada apenas a tarifa base e apenas preços por token. Tarifas em lote, reduzidas ou em cache, bem como preços por imagem ou por segundo de vídeo, não entram nesta tabela: não podem ficar na mesma coluna que um preço por milhão de tokens.

Um mesmo fornecedor aparece várias vezes se vende este modelo com identificadores diferentes e a preços diferentes — por exemplo, com precisão de pesos diferente. O identificador é indicado ao lado do nome. As ofertas idênticas vindas de duas fontes com grafias diferentes são reunidas numa única linha.

A data da última coluna é o dia em que este preço entrou pela primeira vez na nossa recolha. O preço pode ser mais antigo: antes desse dia simplesmente não o registávamos. Desde então não mudou — caso contrário, no seu lugar estaria uma linha nova com uma data nova.

Resultados das medições

Conjunto de tarefas Resultado Condições da execução Medido por
Arena Score em francês 1.445,04 1.422–1.468
Arena Score, matemática 1.424,48 1.415–1.434
Arena Score em inglês 1.414,47 1.410–1.419
Arena Score, geral 1.409,5 1.406–1.413
Arena Score em russo 1.408,32 1.399–1.418
Arena Score, programação 1.408,19 1.402–1.414
Arena Score, diálogo de vários turnos 1.404,93 1.398–1.412
Arena Score, pedidos difíceis 1.401,88 1.397–1.407
Arena Score, perguntas de especialista 1.400,18 1.389–1.412
Arena Score em espanhol 1.384,08 1.365–1.403
Arena Score, pedidos longos 1.370,54 1.364–1.377
Arena Score, seguimento de instruções 1.367,67 1.362–1.373
Arena Score, escrita criativa 1.359,4 1.352–1.367
Arena Score, compreensão de esquemas 1.218,28 1.206–1.230
Arena Score, reconhecimento de texto em imagem 1.218,19 1.210–1.226
Arena Score, trabalho com imagens 1.215,41 1.209–1.222
MATH, nível de dificuldade cinco 97,77 % esforço: high · com estrutura ajustada Epoch evaluations
Fiction.LiveBench — retenção de contexto longo 88,9 % esforço: medium Fiction.live leaderboard
Escrita criativa (avaliação de Lech Mazur) 83,9 % esforço: medium lechmazur/writing Github repository
Mock AIME 2024–2025 — problemas de olimpíada 83,87 % esforço: low · com estrutura ajustada Epoch evaluations
Aider Polyglot — edições de código em seis linguagens 81,3 % esforço: medium · com estrutura ajustada Aider LLM Leaderboards
GPQA Diamond — perguntas de nível de pós-graduação 75,76 % esforço: low · com estrutura ajustada Epoch evaluations
CadEval — construção de modelos CAD por código 74 % esforço: medium CadEval Dashboard
GeoBench — localização de um lugar a partir de uma foto 74 % esforço: high GeoBench leaderboard
SWE-bench Verified — correção de erros em repositórios 62,32 % esforço: medium · com estrutura ajustada Epoch evaluations
ARC-AGI — generalização para padrões novos 60,8 % esforço: high · com estrutura ajustada ARC Prize Leaderboard
SimpleQA Verified — exatidão factual 53 % esforço: high Epoch evaluations
WeirdML — tarefas incomuns de aprendizagem automática 52,42 % esforço: high WeirdML Leaderboard
DeepResearch Bench — pesquisa aprofundada 46,6 % esforço: medium DeepResearchBench Leaderboard
SimpleBench — perguntas capciosas 43,72 % esforço: high SimpleBench Leaderboard
GDPval — tarefas de profissões reais 30,8 % esforço: medium
Problemas de xadrez 23,19 % esforço: low Epoch evaluations
OSWorld — trabalho num sistema operativo, primeira versão 23 % esforço: medium · com estrutura ajustada OS World Website
APEX-Agents 17,2 % esforço: high
Humanity’s Last Exam — perguntas de nível especialista 16,3 % esforço: high
GSO-Bench — otimização de código 8,8 % esforço: high GSO Leaderboard
ARC-AGI-2 6,53 % esforço: high
CritPt — problemas de física 1,4 % esforço: high