azure/o3-2025-04-16O fornecedor declarou este modelo obsoleto. Ainda responde, mas é melhor não iniciar projetos novos com ele.
| Fornecedor | Entrada, $ por 1M | Saída, $ por 1M | Nos nossos dados desde |
|---|---|---|---|
Microsoft Foundry
azure/o3-2025-04-16
|
$2 | $8 | 31 jul 2026 |
| OpenAI | $2 | $8 | 31 jul 2026 |
Microsoft Foundry
azure/us/o3-2025-04-16
|
$2,2 | $8,8 | 31 jul 2026 |
É mostrada apenas a tarifa base e apenas preços por token. Tarifas em lote, reduzidas ou em cache, bem como preços por imagem ou por segundo de vídeo, não entram nesta tabela: não podem ficar na mesma coluna que um preço por milhão de tokens.
Um mesmo fornecedor aparece várias vezes se vende este modelo com identificadores diferentes e a preços diferentes — por exemplo, com precisão de pesos diferente. O identificador é indicado ao lado do nome. As ofertas idênticas vindas de duas fontes com grafias diferentes são reunidas numa única linha.
A data da última coluna é o dia em que este preço entrou pela primeira vez na nossa recolha. O preço pode ser mais antigo: antes desse dia simplesmente não o registávamos. Desde então não mudou — caso contrário, no seu lugar estaria uma linha nova com uma data nova.
| Conjunto de tarefas | Resultado | Condições da execução | Medido por |
|---|---|---|---|
| Arena Score em francês | 1.445,04 1.422–1.468 | — | — |
| Arena Score, matemática | 1.424,48 1.415–1.434 | — | — |
| Arena Score em inglês | 1.414,47 1.410–1.419 | — | — |
| Arena Score, geral | 1.409,5 1.406–1.413 | — | — |
| Arena Score em russo | 1.408,32 1.399–1.418 | — | — |
| Arena Score, programação | 1.408,19 1.402–1.414 | — | — |
| Arena Score, diálogo de vários turnos | 1.404,93 1.398–1.412 | — | — |
| Arena Score, pedidos difíceis | 1.401,88 1.397–1.407 | — | — |
| Arena Score, perguntas de especialista | 1.400,18 1.389–1.412 | — | — |
| Arena Score em espanhol | 1.384,08 1.365–1.403 | — | — |
| Arena Score, pedidos longos | 1.370,54 1.364–1.377 | — | — |
| Arena Score, seguimento de instruções | 1.367,67 1.362–1.373 | — | — |
| Arena Score, escrita criativa | 1.359,4 1.352–1.367 | — | — |
| Arena Score, compreensão de esquemas | 1.218,28 1.206–1.230 | — | — |
| Arena Score, reconhecimento de texto em imagem | 1.218,19 1.210–1.226 | — | — |
| Arena Score, trabalho com imagens | 1.215,41 1.209–1.222 | — | — |
| MATH, nível de dificuldade cinco | 97,77 % | esforço: high · com estrutura ajustada | Epoch evaluations |
| Fiction.LiveBench — retenção de contexto longo | 88,9 % | esforço: medium | Fiction.live leaderboard |
| Escrita criativa (avaliação de Lech Mazur) | 83,9 % | esforço: medium | lechmazur/writing Github repository |
| Mock AIME 2024–2025 — problemas de olimpíada | 83,87 % | esforço: low · com estrutura ajustada | Epoch evaluations |
| Aider Polyglot — edições de código em seis linguagens | 81,3 % | esforço: medium · com estrutura ajustada | Aider LLM Leaderboards |
| GPQA Diamond — perguntas de nível de pós-graduação | 75,76 % | esforço: low · com estrutura ajustada | Epoch evaluations |
| CadEval — construção de modelos CAD por código | 74 % | esforço: medium | CadEval Dashboard |
| GeoBench — localização de um lugar a partir de uma foto | 74 % | esforço: high | GeoBench leaderboard |
| SWE-bench Verified — correção de erros em repositórios | 62,32 % | esforço: medium · com estrutura ajustada | Epoch evaluations |
| ARC-AGI — generalização para padrões novos | 60,8 % | esforço: high · com estrutura ajustada | ARC Prize Leaderboard |
| SimpleQA Verified — exatidão factual | 53 % | esforço: high | Epoch evaluations |
| WeirdML — tarefas incomuns de aprendizagem automática | 52,42 % | esforço: high | WeirdML Leaderboard |
| DeepResearch Bench — pesquisa aprofundada | 46,6 % | esforço: medium | DeepResearchBench Leaderboard |
| SimpleBench — perguntas capciosas | 43,72 % | esforço: high | SimpleBench Leaderboard |
| GDPval — tarefas de profissões reais | 30,8 % | esforço: medium | — |
| Problemas de xadrez | 23,19 % | esforço: low | Epoch evaluations |
| OSWorld — trabalho num sistema operativo, primeira versão | 23 % | esforço: medium · com estrutura ajustada | OS World Website |
| APEX-Agents | 17,2 % | esforço: high | — |
| Humanity’s Last Exam — perguntas de nível especialista | 16,3 % | esforço: high | — |
| GSO-Bench — otimização de código | 8,8 % | esforço: high | GSO Leaderboard |
| ARC-AGI-2 | 6,53 % | esforço: high | — |
| CritPt — problemas de física | 1,4 % | esforço: high | — |