OpenAI

o1 2024-12-17

Tipo
modelo de linguagem
Contexto
200K tokens
Saída máxima
100K
String para a API
azure/eu/o1-2024-12-17

Preços por fornecedor

Fornecedor Entrada, $ por 1M Saída, $ por 1M Nos nossos dados desde
Microsoft Foundry azure/o1-2024-12-17 $15 $60 31 jul 2026
OpenAI $15 $60 31 jul 2026
Microsoft Foundry azure/eu/o1-2024-12-17 $16,5 $66 31 jul 2026

É mostrada apenas a tarifa base e apenas preços por token. Tarifas em lote, reduzidas ou em cache, bem como preços por imagem ou por segundo de vídeo, não entram nesta tabela: não podem ficar na mesma coluna que um preço por milhão de tokens.

Um mesmo fornecedor aparece várias vezes se vende este modelo com identificadores diferentes e a preços diferentes — por exemplo, com precisão de pesos diferente. O identificador é indicado ao lado do nome. As ofertas idênticas vindas de duas fontes com grafias diferentes são reunidas numa única linha.

A data da última coluna é o dia em que este preço entrou pela primeira vez na nossa recolha. O preço pode ser mais antigo: antes desse dia simplesmente não o registávamos. Desde então não mudou — caso contrário, no seu lugar estaria uma linha nova com uma data nova.

Resultados das medições

Conjunto de tarefas Resultado Condições da execução Medido por
Arena Score, matemática 1.388,33 1.378–1.399
Arena Score, pedidos longos 1.377,99 1.368–1.388
Arena Score em inglês 1.372,18 1.367–1.378
Arena Score, pedidos difíceis 1.371,69 1.364–1.379
Arena Score, seguimento de instruções 1.367,83 1.361–1.374
Arena Score, programação 1.367,4 1.358–1.377
Arena Score, geral 1.365,96 1.362–1.370
Arena Score, perguntas de especialista 1.361,05 1.344–1.378
Arena Score em russo 1.354,9 1.344–1.365
Arena Score, diálogo de vários turnos 1.354,76 1.346–1.364
Arena Score, escrita criativa 1.347,89 1.339–1.357
Arena Score em francês 1.343,31 1.306–1.380
Arena Score em espanhol 1.341,83 1.294–1.390
Arena Score, trabalho com imagens 1.168,58 1.158–1.179
MATH, nível de dificuldade cinco 94,71 % esforço: high · com estrutura ajustada Epoch evaluations
Fiction.LiveBench — retenção de contexto longo 83,3 % esforço: medium Fiction.live leaderboard
GeoBench — localização de um lugar a partir de uma foto 80 % esforço: medium GeoBench leaderboard
Mock AIME 2024–2025 — problemas de olimpíada 73,31 % esforço: low · com estrutura ajustada Epoch evaluations
Escrita criativa (avaliação de Lech Mazur) 70,2 % esforço: medium lechmazur/writing Github repository
GPQA Diamond — perguntas de nível de pós-graduação 69,02 % esforço: low · com estrutura ajustada Epoch evaluations
Aider Polyglot — edições de código em seis linguagens 61,7 % esforço: high · com estrutura ajustada Aider LLM Leaderboards
CadEval — construção de modelos CAD por código 56 % esforço: medium CadEval Dashboard
WeirdML — tarefas incomuns de aprendizagem automática 43,82 % esforço: high WeirdML Leaderboard
ARC-AGI — generalização para padrões novos 30,7 % esforço: medium · com estrutura ajustada ARC Prize Leaderboard
SimpleBench — perguntas capciosas 28,12 % esforço: high SimpleBench Leaderboard
Humanity’s Last Exam — perguntas de nível especialista 3,32 %
Problemas de xadrez 2,15 % esforço: low Epoch evaluations
APEX-Agents 1,1 % esforço: high