azure/gpt-4.5-preview| Fornecedor | Entrada, $ por 1M | Saída, $ por 1M | Nos nossos dados desde |
|---|---|---|---|
| Microsoft Foundry | $75 | $150 | 31 jul 2026 |
É mostrada apenas a tarifa base e apenas preços por token. Tarifas em lote, reduzidas ou em cache, bem como preços por imagem ou por segundo de vídeo, não entram nesta tabela: não podem ficar na mesma coluna que um preço por milhão de tokens.
A data da última coluna é o dia em que este preço entrou pela primeira vez na nossa recolha. O preço pode ser mais antigo: antes desse dia simplesmente não o registávamos. Desde então não mudou — caso contrário, no seu lugar estaria uma linha nova com uma data nova.
| Conjunto de tarefas | Resultado | Condições da execução | Medido por |
|---|---|---|---|
| Arena Score, diálogo de vários turnos | 1.443,92 1.430–1.457 | — | — |
| Arena Score em inglês | 1.419,49 1.412–1.427 | — | — |
| Arena Score em russo | 1.418,24 1.403–1.434 | — | — |
| Arena Score em francês | 1.418,01 1.362–1.474 | — | — |
| Arena Score, geral | 1.417,47 1.412–1.423 | — | — |
| Arena Score, matemática | 1.411,89 1.397–1.427 | — | — |
| Arena Score, pedidos longos | 1.406 1.392–1.420 | — | — |
| Arena Score, seguimento de instruções | 1.404,35 1.396–1.413 | — | — |
| Arena Score, pedidos difíceis | 1.403,65 1.394–1.414 | — | — |
| Arena Score, programação | 1.397,05 1.384–1.410 | — | — |
| Arena Score, escrita criativa | 1.394,29 1.382–1.406 | — | — |
| Arena Score, perguntas de especialista | 1.393,91 1.371–1.417 | — | — |
| Arena Score, trabalho com imagens | 1.195,13 1.183–1.207 | — | — |
| MATH, nível de dificuldade cinco | 78,63 % | · com estrutura ajustada | Epoch evaluations |
| Escrita criativa (avaliação de Lech Mazur) | 75,6 % | — | lechmazur/writing Github repository |
| Fiction.LiveBench — retenção de contexto longo | 63,9 % | — | Fiction.live leaderboard |
| GPQA Diamond — perguntas de nível de pós-graduação | 58,25 % | · com estrutura ajustada | Epoch evaluations |
| Aider Polyglot — edições de código em seis linguagens | 44,9 % | · com estrutura ajustada | Aider LLM Leaderboards |
| WeirdML — tarefas incomuns de aprendizagem automática | 39,37 % | — | WeirdML Leaderboard |
| Mock AIME 2024–2025 — problemas de olimpíada | 37,72 % | · com estrutura ajustada | Epoch evaluations |
| SimpleBench — perguntas capciosas | 21,4 % | — | SimpleBench Leaderboard |
| Cybench — tarefas de cibersegurança | 17,5 % | · com estrutura ajustada | Cybench leaderboard |
| ARC-AGI — generalização para padrões novos | 10,3 % | · com estrutura ajustada | ARC Prize Leaderboard |
| ARC-AGI-2 | 0,8 % | — | — |
| Humanity’s Last Exam — perguntas de nível especialista | 0,67 % | — | — |