CUSTO/CAPACIDADE

Preços e limites, com data.

O custo publicado só é comparável quando conhecemos a unidade, modalidade e condições.

01

Dados publicados

USD por milhão de tokens quando a fonte usa essa unidade.

OpenAI

GPT‑6 Astra

Entrada padrão
10,00 USD / 1 M tokens
Saída padrão
50,00 USD / 1 M tokens
Entrada em cache
1,00 USD / 1 M tokens
Entrada por lotes
5,00 USD / 1 M tokens
Saída por lotes
25,00 USD / 1 M tokens
Contexto
1.050.000 tokens
saída máxima
128.000 tokens

Os pedidos com mais de 272.000 tokens de entrada aplicam multiplicadores de preço; as ferramentas podem acrescentar encargos por chamada.

Abrir ficha e fontes →
Anthropic

Claude Opus 5

Entrada padrão
5,00 USD / 1 M tokens
Saída padrão
25,00 USD / 1 M tokens
Entrada em cache
0,50 USD / 1 M tokens
Entrada por lotes
2,50 USD / 1 M tokens
Saída por lotes
12,50 USD / 1 M tokens
Contexto
1.000.000 tokens
saída máxima
128.000 tokens

O raciocínio é faturado como saída. O modo Fast custa o dobro da tarifa base.

Abrir ficha e fontes →
Google

Gemini 3.8 Flash

Entrada padrão
0,75 USD/1 milhão de tokens
Saída padrão
3,75 USD/1 milhão de tokens
Entrada em cache
0,075 USD / 1 M tokens
Entrada por lotes
0,375 USD / 1 M tokens
Saída por lotes
1,875 USD / 1 M tokens
Contexto
1.048.576 tokens de entrada
saída máxima
65.536 tokens de saída

Preços introdutórios até 31 de dezembro de 2026; a partir de 2027, as tarifas padrão duplicam.

Abrir ficha e fontes →
Custo por tarefa

Inclui novas tentativas, ferramentas, recuperação, cache e revisão humana.

Limite operacional

Os limites da conta e da região podem diferir da capacidade teórica do modelo.

Dados ausentes

A ausência é retida como informação relevante e não como zero.

02

O que falta no preço por token

Uma tarifa baixa pode acabar por ser cara se o fluxo repetir trabalho ou necessitar de muita supervisão.

01

Raciocínio e comprimento

Os tokens internos ou de raciocínio costumam ser faturados como saída e dependem da dificuldade e do esforço configurado.

02

Ferramentas e grounding

A pesquisa, os mapas, a execução de código e outras ferramentas podem ter preços por chamada, além dos tokens.

03

Cache e lotes

Os prefixos repetidos e o processamento assíncrono reduzem o custo, mas exigem que o fluxo seja concebido para os aproveitar.

04

Custo do erro

Mede as tentativas repetidas, a validação humana, os incidentes e a recuperação: fazem parte do custo total de operação.