OpenAI

GPT 5 2025-08-07

Tipo
modelo de linguagem
Contexto
272K tokens
Saída máxima
128K
String para a API
azure/eu/gpt-5-2025-08-07

Preços por fornecedor

Fornecedor Entrada, $ por 1M Saída, $ por 1M Nos nossos dados desde
Microsoft Foundry azure/gpt-5-2025-08-07 $1,25 $10 31 jul 2026
OpenAI $1,25 $10 31 jul 2026
Microsoft Foundry azure/eu/gpt-5-2025-08-07 $1,375 $11 31 jul 2026

É mostrada apenas a tarifa base e apenas preços por token. Tarifas em lote, reduzidas ou em cache, bem como preços por imagem ou por segundo de vídeo, não entram nesta tabela: não podem ficar na mesma coluna que um preço por milhão de tokens.

Um mesmo fornecedor aparece várias vezes se vende este modelo com identificadores diferentes e a preços diferentes — por exemplo, com precisão de pesos diferente. O identificador é indicado ao lado do nome. As ofertas idênticas vindas de duas fontes com grafias diferentes são reunidas numa única linha.

A data da última coluna é o dia em que este preço entrou pela primeira vez na nossa recolha. O preço pode ser mais antigo: antes desse dia simplesmente não o registávamos. Desde então não mudou — caso contrário, no seu lugar estaria uma linha nova com uma data nova.

Resultados das medições

Conjunto de tarefas Resultado Condições da execução Medido por
MATH, nível de dificuldade cinco 98,13 % esforço: high · com estrutura ajustada Epoch evaluations
Fiction.LiveBench — retenção de contexto longo 97,2 % esforço: medium Fiction.live leaderboard
Mock AIME 2024–2025 — problemas de olimpíada 91,38 % esforço: minimal · com estrutura ajustada Epoch evaluations
Aider Polyglot — edições de código em seis linguagens 88 % esforço: low · com estrutura ajustada Aider LLM Leaderboards
Escrita criativa (avaliação de Lech Mazur) 86 % esforço: medium lechmazur/writing Github repository
GPQA Diamond — perguntas de nível de pós-graduação 81,57 % esforço: minimal · com estrutura ajustada Epoch evaluations
GeoBench — localização de um lugar a partir de uma foto 81 % esforço: medium GeoBench leaderboard
SWE-bench Verified — correção de erros em repositórios 73,55 % esforço: high · com estrutura ajustada Epoch evaluations
ARC-AGI — generalização para padrões novos 65,7 % esforço: high · com estrutura ajustada ARC Prize Leaderboard
WeirdML — tarefas incomuns de aprendizagem automática 60,7 % esforço: high WeirdML Leaderboard
FrontierMath, níveis 1–3 55,44 % esforço: high Epoch evaluations
DeepResearch Bench — pesquisa aprofundada 55,13 % DeepResearchBench Leaderboard
SimpleQA Verified — exatidão factual 50,6 % esforço: high Epoch evaluations
Terminal-Bench — trabalho na linha de comandos 49,6 % · com estrutura ajustada Terminal-Bench v2 Leaderboard
SimpleBench — perguntas capciosas 48,04 % esforço: high SimpleBench Leaderboard
GDPval — tarefas de profissões reais 34,8 % esforço: medium
Problemas de xadrez 33,71 % esforço: minimal Epoch evaluations
BALROG — ambientes de jogo 32,8 % esforço: minimal Balrog Leaderboard
FrontierMath, nível 4 — problemas de investigação 21,95 % esforço: high Epoch evaluations
Humanity’s Last Exam — perguntas de nível especialista 21,56 % esforço: high
APEX-Agents 18,3 % esforço: high
CritPt — problemas de física 12,6 % esforço: high
ARC-AGI-2 9,86 % esforço: high
GSO-Bench — otimização de código 6,9 % esforço: high GSO Leaderboard
Remote Labor Index — trabalhos de uma plataforma de freelance 1,67 %