Voltar pra todos os posts
Blog · Veltrix

Custo de tokens de IA: quanto realmente custa usar GPT-4, Claude e Gemini

Uma empresa com 10 desenvolvedores usando IA no dia a dia gasta entre US$ 1.500 e US$ 8.000 por mês com tokens — e a maioria não sabe. O custo de tokens de IA depende de três variáveis que quase ninguém acompanha: o modelo escolhido, a proporção entre input e output, e como o tokenizer do provider quebra o texto.

Este guia mostra os preços reais de maio de 2026 e como calcular o custo verdadeiro por tarefa.


O que são tokens e por que eles definem sua fatura

Tokens são a unidade de medida dos modelos de linguagem. Cada palavra, pedaço de palavra ou símbolo é convertido em um ou mais tokens antes de ser processado pelo modelo.

Em português, a proporção média é de 1 token para cada 3-4 caracteres. A frase “Qual o status do meu pedido?” gera aproximadamente 10-12 tokens, dependendo do modelo.

Você paga por token consumido — tanto no que envia (input) quanto no que recebe (output). A fatura final é:

Custo = (tokens de input × preço input) + (tokens de output × preço output)

Parece simples. Não é. Porque:

  1. Cada modelo tem um preço diferente por token. A variação chega a 200x entre o modelo mais caro e o mais barato.
  2. Output custa 3-6x mais que input. A maioria das pessoas olha só o preço de input.
  3. O mesmo texto gera quantidades diferentes de tokens em cada modelo. O tokenizer é invisível — e muda a conta final.

Tabela comparativa: preço por 1M tokens (maio 2026)

Esses são os preços oficiais dos principais modelos disponíveis via API em maio de 2026:

OpenAI

ModeloInput (US$/1M tokens)Output (US$/1M tokens)Ratio output/input
GPT-5$10,00$30,003x
GPT-4.1$2,00$8,004x
GPT-4.1-mini$0,40$1,604x
GPT-4.1-nano$0,10$0,404x
GPT-5-nano$0,05$0,204x
o3$10,00$40,004x
o4-mini$1,10$4,404x

Anthropic

ModeloInput (US$/1M tokens)Output (US$/1M tokens)Ratio output/input
Claude Opus 4.6$5,00$25,005x
Claude Sonnet 4$3,00$15,005x
Claude Haiku 3.5$0,80$4,005x

Google

ModeloInput (US$/1M tokens)Output (US$/1M tokens)Ratio output/input
Gemini 2.5 Pro$1,25$10,008x
Gemini 2.5 Flash$0,15$0,604x
Gemini 2.0 Flash$0,10$0,404x

Observações

  • Preços de context caching e batch não estão incluídos — eles reduzem significativamente o custo efetivo (veja como reduzir custo da API da OpenAI em até 60%).
  • O Gemini 2.5 Pro tem um pulo de preço acima de 200K tokens de contexto (US$ 2,50 input / US$ 15,00 output).
  • Modelos de raciocínio (o3, o4-mini) geram “thinking tokens” internos que são cobrados como output — o custo real pode ser 2-5x maior que o aparente.

A diferença entre o modelo mais barato (GPT-5-nano a US$ 0,05/MTok input) e o mais caro (GPT-5 a US$ 10,00/MTok input) é de 200 vezes. Escolher errado não é ineficiência — é dinheiro queimando.


Input vs. output: onde o custo realmente pesa

A maioria dos devs compara modelos pelo preço de input. É o número que aparece primeiro na pricing page. Mas o output é onde a conta explode.

Vamos fazer a conta com um cenário real: um agente de suporte que recebe perguntas (input médio: 500 tokens) e gera respostas (output médio: 800 tokens).

10.000 chamadas por dia no GPT-5:

ComponenteTokens/diaPreço/MTokCusto/dia
Input5M$10,00$50,00
Output8M$30,00$240,00
Total13M$290,00

O output representa 83% do custo total. Se você otimizar só o input (compressão de prompt, cache), está atacando 17% do problema.

As alavancas de output que realmente funcionam:

  • max_tokens: limitar output a 200 tokens quando a tarefa não precisa de mais.
  • Structured output: forçar JSON schema elimina texto decorativo.
  • Modelo menor pra output longo: se precisa gerar 2.000 tokens de texto, usar GPT-4.1 em vez de GPT-5 reduz o custo de output em 73%.

A proporção output/input varia entre 3x (OpenAI) e 8x (Gemini 2.5 Pro). Ignorar essa diferença é o erro mais caro que uma equipe pode cometer.


O tokenizer invisível: como o mesmo texto gera custos diferentes

Aqui está o detalhe que quase ninguém discute: o mesmo texto gera quantidades diferentes de tokens dependendo do modelo.

Cada provider usa um tokenizer próprio — o algoritmo que converte texto em tokens. O tokenizer do GPT-5 (baseado no tiktoken o200k) é diferente do tokenizer do Claude (baseado em SentencePiece) que é diferente do tokenizer do Gemini.

Exemplo prático: a frase “Implementar autenticação OAuth 2.0 com refresh token” pode gerar:

  • 9 tokens no GPT-5
  • 12 tokens no Claude Opus 4.6
  • 10 tokens no Gemini 2.5 Pro

A diferença parece pequena numa frase. Multiplicada por milhões de tokens por mês, muda a fatura em dezenas de porcento.

O caso Anthropic. Quando a Anthropic lançou o Claude Opus 4.7 (versão hipotética), manteve o preço por token idêntico ao anterior. Mas o novo tokenizer gerava até 35% mais tokens para o mesmo texto. Resultado: aumento médio de 27% na fatura mensal sem nenhuma mudança na pricing page.

Isso significa que comparar preço por token entre providers é enganoso. O que importa é o custo por resultado — quanto custa completar a tarefa, independente de quantos tokens o tokenizer gerou.

Para comparar de verdade, meça:

  1. Quantos tokens cada modelo consome pra mesma tarefa
  2. Multiplique pelo preço do respectivo provider
  3. Compare o custo final, não o preço unitário

Quanto gasta uma empresa média com 10 devs usando IA

Vamos modelar três cenários reais de uma empresa com 10 desenvolvedores, cada um fazendo em média 50 chamadas por dia a modelos de IA (code review, debug, geração de código, documentação, testes).

Total: 500 chamadas/dia × 22 dias úteis = 11.000 chamadas/mês

Cenário 1: Tudo no flagship (sem otimização)

ParâmetroValor
ModeloGPT-5
Input médio2.000 tokens
Output médio1.500 tokens
Chamadas/mês11.000
Custo input22M tokens × $10/MTok = $220
Custo output16,5M tokens × $30/MTok = $495
Total/mêsUS$ 715

Cenário 2: Mix de modelos (com routing básico)

Tipo de tarefa% chamadasModeloCusto estimado
Code review complexo20%GPT-5$143
Geração de código40%GPT-4.1$88
Autocompletion/debug30%GPT-4.1-mini$13
Classificação/triage10%GPT-5-nano$0,5
Total/mêsUS$ 245

Cenário 3: Otimizado (routing + cache + compressão)

OtimizaçãoEconomia adicional
Routing (cenário 2)Base: $245
Cache (40% hit rate)-35%
Compressão de prompt-20%
Output control-15%
Total/mês~US$ 120

A diferença entre o cenário 1 e o cenário 3 é de US$ 595/mês — US$ 7.140 por ano. Para uma startup, isso é runway. Para uma empresa maior, multiplique por número de equipes.

E esse é só um time de 10 devs. Globalmente, estima-se que US$ 4,2 bilhões são desperdiçados por ano em tokens mal gerenciados — chamadas redundantes, modelos superdimensionados, contexto reenviado sem necessidade.


Como calcular custo por feature/task

A métrica que importa não é custo por token — é custo por unidade de trabalho. Quanto custa gerar um relatório? Quanto custa processar um ticket de suporte? Quanto custa gerar os testes de uma feature?

Framework de cálculo:

1. Identifique a tarefa

Exemplo: “Gerar documentação de uma função Python.”

2. Meça tokens consumidos

Execute a tarefa 20-30 vezes e registre:

  • Tokens de input (prompt + contexto)
  • Tokens de output (resposta gerada)
  • Modelo utilizado

3. Calcule o custo unitário

Custo por tarefa = (input_tokens / 1M × preço_input) + (output_tokens / 1M × preço_output)

Exemplo concreto:

Documentar uma função: 800 tokens input, 600 tokens output, usando GPT-4.1.

Custo = (800/1M × $2,00) + (600/1M × $8,00)
Custo = $0,0016 + $0,0048
Custo = $0,0064 por função documentada

A US$ 0,0064 por função, documentar 1.000 funções custa US$ 6,40.

Agora faça a mesma conta com GPT-5:

Custo = (800/1M × $10,00) + (600/1M × $30,00)
Custo = $0,008 + $0,018
Custo = $0,026 por função documentada

Mesma tarefa: US$ 26,00 para 1.000 funções. 4x mais caro. A documentação ficou melhor? Em 90% dos casos, não.

4. Mapeie todas as tarefas do pipeline

Crie uma tabela:

TarefaChamadas/mêsModeloCusto unitárioCusto mensal
Documentação500GPT-4.1$0,006$3,00
Code review300GPT-5$0,04$12,00
Testes400GPT-4.1$0,01$4,00
Classificação de bugs200GPT-5-nano$0,0001$0,02

Essa tabela mostra exatamente onde o dinheiro vai — e onde otimizar primeiro.

5. Compare custo vs. valor

Se gerar documentação custa US$ 3/mês e economiza 10 horas de trabalho de dev, o ROI é absurdo. Se code review no GPT-5 custa US$ 12 mas o GPT-4.1 faz 95% tão bem por US$ 3, troque.

O cálculo por task é o que separa empresas que gastam US$ 8.000/mês com IA sem saber por quê e empresas que gastam US$ 800 com visibilidade total.


Próximo passo

A fatura de tokens não precisa ser uma caixa preta. Com a tabela de preços certa e uma medição básica por tarefa, você consegue cortar custos sem perder qualidade.

Se você quer visibilidade automática — custo por modelo, por tarefa, por dev, por dia — sem montar infraestrutura própria, a Veltrix faz isso. Troca o baseURL, e o painel mostra exatamente onde cada dólar está indo.

Para o panorama completo de FinOps de IA, incluindo governança e estratégia multi-provider, leia o guia completo de FinOps de IA.

Veja também: Como reduzir o custo da API da OpenAI em até 60%


FAQ

Quantos tokens uma conversa típica consome?

Depende do modelo e do contexto. Uma conversa de suporte com 5 turnos consome em média 3.000-5.000 tokens de input (somando system prompt + histórico acumulado) e 1.000-2.000 tokens de output. No GPT-5, isso sai entre US$ 0,06 e US$ 0,11 por conversa. No GPT-4.1-mini, entre US$ 0,003 e US$ 0,005. A diferença é de 20x.

O preço por token é a melhor forma de comparar modelos?

Não. O preço por token ignora duas variáveis críticas: quantos tokens o tokenizer gera pro mesmo texto (varia 15-35% entre providers) e quantos tokens o modelo precisa pra completar a tarefa (modelos melhores podem precisar de menos output). Compare pelo custo total pra completar a mesma tarefa — rode o mesmo benchmark nos modelos que está avaliando e meça o custo final.

A empresa pode limitar quanto cada dev gasta com tokens?

Sim, mas a maioria dos providers não oferece controle granular nativo. O painel da OpenAI mostra consumo por API key, não por pessoa ou por tarefa. Pra ter governança real — budgets por time, alertas de gasto, relatórios por dev — você precisa de uma camada intermediária. É exatamente o problema que um proxy de FinOps de IA resolve: visibilidade e controle sem depender do que o provider oferece.

Pronto pra reduzir sua fatura de IA?

Teste grátis por 7 dias. Sem cartão. Sem refactor. Resultado mensurável no primeiro dia.

Começar agora →