azure/eu/gpt-5-2025-08-07| Fornecedor | Entrada, $ por 1M | Saída, $ por 1M | Nos nossos dados desde |
|---|---|---|---|
Microsoft Foundry
azure/gpt-5-2025-08-07
|
$1,25 | $10 | 31 jul 2026 |
| OpenAI | $1,25 | $10 | 31 jul 2026 |
Microsoft Foundry
azure/eu/gpt-5-2025-08-07
|
$1,375 | $11 | 31 jul 2026 |
É mostrada apenas a tarifa base e apenas preços por token. Tarifas em lote, reduzidas ou em cache, bem como preços por imagem ou por segundo de vídeo, não entram nesta tabela: não podem ficar na mesma coluna que um preço por milhão de tokens.
Um mesmo fornecedor aparece várias vezes se vende este modelo com identificadores diferentes e a preços diferentes — por exemplo, com precisão de pesos diferente. O identificador é indicado ao lado do nome. As ofertas idênticas vindas de duas fontes com grafias diferentes são reunidas numa única linha.
A data da última coluna é o dia em que este preço entrou pela primeira vez na nossa recolha. O preço pode ser mais antigo: antes desse dia simplesmente não o registávamos. Desde então não mudou — caso contrário, no seu lugar estaria uma linha nova com uma data nova.
| Conjunto de tarefas | Resultado | Condições da execução | Medido por |
|---|---|---|---|
| MATH, nível de dificuldade cinco | 98,13 % | esforço: high · com estrutura ajustada | Epoch evaluations |
| Fiction.LiveBench — retenção de contexto longo | 97,2 % | esforço: medium | Fiction.live leaderboard |
| Mock AIME 2024–2025 — problemas de olimpíada | 91,38 % | esforço: minimal · com estrutura ajustada | Epoch evaluations |
| Aider Polyglot — edições de código em seis linguagens | 88 % | esforço: low · com estrutura ajustada | Aider LLM Leaderboards |
| Escrita criativa (avaliação de Lech Mazur) | 86 % | esforço: medium | lechmazur/writing Github repository |
| GPQA Diamond — perguntas de nível de pós-graduação | 81,57 % | esforço: minimal · com estrutura ajustada | Epoch evaluations |
| GeoBench — localização de um lugar a partir de uma foto | 81 % | esforço: medium | GeoBench leaderboard |
| SWE-bench Verified — correção de erros em repositórios | 73,55 % | esforço: high · com estrutura ajustada | Epoch evaluations |
| ARC-AGI — generalização para padrões novos | 65,7 % | esforço: high · com estrutura ajustada | ARC Prize Leaderboard |
| WeirdML — tarefas incomuns de aprendizagem automática | 60,7 % | esforço: high | WeirdML Leaderboard |
| FrontierMath, níveis 1–3 | 55,44 % | esforço: high | Epoch evaluations |
| DeepResearch Bench — pesquisa aprofundada | 55,13 % | — | DeepResearchBench Leaderboard |
| SimpleQA Verified — exatidão factual | 50,6 % | esforço: high | Epoch evaluations |
| Terminal-Bench — trabalho na linha de comandos | 49,6 % | · com estrutura ajustada | Terminal-Bench v2 Leaderboard |
| SimpleBench — perguntas capciosas | 48,04 % | esforço: high | SimpleBench Leaderboard |
| GDPval — tarefas de profissões reais | 34,8 % | esforço: medium | — |
| Problemas de xadrez | 33,71 % | esforço: minimal | Epoch evaluations |
| BALROG — ambientes de jogo | 32,8 % | esforço: minimal | Balrog Leaderboard |
| FrontierMath, nível 4 — problemas de investigação | 21,95 % | esforço: high | Epoch evaluations |
| Humanity’s Last Exam — perguntas de nível especialista | 21,56 % | esforço: high | — |
| APEX-Agents | 18,3 % | esforço: high | — |
| CritPt — problemas de física | 12,6 % | esforço: high | — |
| ARC-AGI-2 | 9,86 % | esforço: high | — |
| GSO-Bench — otimização de código | 6,9 % | esforço: high | GSO Leaderboard |
| Remote Labor Index — trabalhos de uma plataforma de freelance | 1,67 % | — | — |