Custo por Token: Como Rastrear e Otimizar Seus Gastos com LLMs
Entenda o que é custo por token, como calcular o custo por milhão de tokens, compare os principais modelos do mercado e descubra como monitorar seus gastos com APIs de LLMs em produção.
O custo por token é a métrica central para qualquer empresa que utiliza APIs de modelos de linguagem em escala. Sem rastreá-la corretamente, é impossível calcular o ROI de iniciativas de IA, planejar orçamento ou identificar onde o dinheiro está sendo desperdiçado. Este guia explica como a métrica funciona, como calcular, como os preços evoluíram e como monitorar seus gastos em produção.
O Que É Custo por Token e Como a Cobrança Funciona
Modelos de linguagem processam texto dividido em tokens — fragmentos que correspondem, em média, a cerca de 0,75 palavras em inglês ou um número ligeiramente menor em português. A cobrança das APIs é feita separadamente para tokens de entrada (input) e tokens de saída (output).
Como cada token custa uma fração ínfima de centavo, a indústria padronizou a unidade de referência em dólares por milhão de tokens ($/M tokens). Todas as principais plataformas — OpenAI, Anthropic e Google — adotam esse padrão, o que facilita a comparação direta entre modelos e o planejamento orçamentário.
- Input tokens: todo o texto enviado ao modelo — prompt, contexto, histórico de conversa.
- Output tokens: o texto gerado pelo modelo em resposta.
- Context window: o limite máximo de tokens que o modelo consegue processar em uma única chamada; quanto maior, maior o potencial de custo por requisição.
Como Calcular o Custo por Milhão de Tokens
A fórmula padrão para estimar o custo de uma chamada ou de um volume de uso é direta:
Custo = (tokens de entrada × tarifa de entrada + tokens de saída × tarifa de saída) ÷ 1.000.000
Exemplo prático: suponha que uma aplicação processe 800.000 tokens de entrada e gere 200.000 tokens de saída usando um modelo com tarifa de $0,20/M (entrada) e $1,20/M (saída):
- Entrada: 800.000 × $0,20 ÷ 1.000.000 = $0,16
- Saída: 200.000 × $1,20 ÷ 1.000.000 = $0,24
- Total: $0,40 para esse lote de requisições
Multiplicando esse cálculo pelo volume diário ou mensal da aplicação, é possível projetar o gasto total e identificar quais fluxos consomem mais recursos.
Comparativo de Preços: Principais Modelos Disponíveis
A tabela abaixo reúne as tarifas de referência dos principais modelos disponíveis comercialmente (valores em $/M tokens):
| Modelo | Input ($/M tokens) | Output ($/M tokens) |
| GPT-5.6 Luna (OpenAI) | $0,20 | $1,20 |
| Gemini 3.5 Flash-Lite (Google) | $0,30 | $2,50 |
| Claude Sonnet 5 (Anthropic) | $2,00 | $10,00 |
A diferença de preço entre modelos reflete capacidade, latência e especialização. Modelos mais baratos atendem bem casos de uso de alto volume e baixa complexidade; modelos premium justificam o custo em tarefas que exigem raciocínio avançado, precisão ou geração de conteúdo crítico.
Por Que os Tokens de Saída Custam Mais?
Em praticamente todos os modelos disponíveis, os tokens de saída custam entre 3x e 10x mais do que os tokens de entrada. A razão é computacional: durante a geração (decoding), o modelo precisa calcular a probabilidade do próximo token a cada passo, de forma sequencial e intensiva em GPU. Já o processamento do input é paralelizável e mais eficiente.
Na prática, isso significa que aplicações que geram respostas longas — relatórios, documentos, código extenso — têm perfil de custo muito diferente de aplicações de classificação ou extração, onde o output é curto. Entender esse assimetria é fundamental para otimizar o custo por token em produção.
A Queda Histórica nos Preços: Contexto e Tendências
O custo por token caiu de forma dramática nos últimos anos, e entender esse movimento ajuda a calibrar decisões de arquitetura e contratos de longo prazo:
- Entre 2021 e 2024, o custo caiu 1.000 vezes: o GPT-3 custava $60/M tokens; modelos equivalentes hoje chegam a $0,06/M tokens (fonte: a16z).
- Entre novembro de 2022 e outubro de 2024, o custo de modelos equivalentes ao GPT-3.5 caiu 280 vezes (Stanford HAI AI Index 2025).
- A mediana histórica de queda é de 50x por ano entre 2020 e 2025; após janeiro de 2024, o ritmo acelerou para 200x por ano (Epoch AI).
- Um chatbot baseado em GPT-4 custava entre $8.000 e $15.000 por mês em 2023; hoje, aplicações equivalentes operam por menos de $200/mês.
Parte dessa queda é explicada pela melhoria de hardware, mas pesquisas do MIT CSAIL (NeurIPS 2025) indicam que a eficiência algorítmica melhora 3x por ano além dos ganhos de hardware — ou seja, os modelos estão ficando mais baratos independentemente da evolução dos chips.
Modelos Proprietários vs. Open Source: Comparativo de Custo
Além de escolher entre modelos proprietários, as empresas têm a opção de hospedar modelos open source. A diferença de custo pode ser expressiva:
- Para 80% dos casos de uso empresariais, modelos open source são 86% mais baratos do que equivalentes proprietários.
- O DeepSeek R1, por exemplo, é 27x mais barato do que o OpenAI o1 para tarefas de raciocínio comparáveis.
- O break-even do self-hosting — ponto em que a infraestrutura própria se torna mais econômica do que pagar pela API — ocorre, em geral, acima de 500 milhões de tokens por dia.
Abaixo desse volume, as APIs comerciais costumam ser mais vantajosas quando se contabilizam custos de operação, manutenção e equipe de MLOps. Acima dele, o self-hosting ou o uso de modelos open source via provedores de infraestrutura de nuvem pode representar economia significativa.
Como Rastrear e Monitorar o Custo por Token em Produção
Ter a fórmula é o começo. O desafio real está em instrumentar a aplicação para capturar e analisar o consumo de tokens de forma contínua. As práticas mais eficazes incluem:
1. Registrar Metadados de Cada Chamada
Toda requisição à API retorna o número de tokens consumidos no campo usage. Esses dados devem ser persistidos em um sistema de logs ou data warehouse com atributos como: modelo utilizado, caso de uso, usuário ou tenant, timestamp e custo calculado.
2. Criar Dashboards de Custo por Caso de Uso
Agregar os logs por fluxo de negócio permite identificar quais funcionalidades consomem mais tokens. É comum descobrir que 20% dos fluxos respondem por 80% do custo — e que muitos deles podem ser otimizados com prompts mais curtos ou modelos menores.
3. Definir Alertas de Anomalia
Picos inesperados de consumo podem indicar loops de chamadas, prompts mal configurados ou abuso de usuários. Alertas automáticos baseados em desvio padrão do consumo diário evitam surpresas na fatura.
4. Implementar Estratégias de Otimização Contínua
- Prompt compression: reduzir o tamanho dos prompts sem perda de qualidade.
- Caching semântico: reutilizar respostas para consultas similares.
- Roteamento de modelos: direcionar tarefas simples para modelos mais baratos e tarefas complexas para modelos premium.
- Truncamento de contexto: limitar o histórico de conversas enviado em cada chamada.
5. Revisitar a Escolha de Modelo Periodicamente
Dado o ritmo de queda de preços e lançamento de novos modelos, uma decisão de arquitetura tomada há seis meses pode já não ser a mais econômica. Benchmarks regulares de custo-benefício são parte do ciclo de governança de IA.
Custo por Token e a Estratégia de IA da Sua Empresa
O rastreamento de custo por token não é apenas uma questão financeira — é um indicador de maturidade operacional em IA. Empresas que monitoram esse dado de forma sistemática conseguem tomar decisões mais rápidas sobre quais modelos adotar, quando migrar para self-hosting e como precificar produtos baseados em IA. Aquelas que ignoram a métrica frequentemente descobrem custos fora de controle apenas quando a fatura chega.
A MJV apoia organizações em toda a jornada de implementação de IA — desde a definição de arquitetura e seleção de modelos até a instrumentação de monitoramento e otimização de custos em produção. Fale com um especialista MJV e descubra como estruturar uma operação de IA eficiente e financeiramente sustentável.
Perguntas Frequentes sobre Custo por Token
O que é um token em modelos de linguagem?
Um token é a unidade mínima de texto processada por um LLM. Em inglês, corresponde a cerca de 0,75 palavras; em português, o número é ligeiramente menor. A cobrança das APIs é feita com base na quantidade de tokens consumidos na entrada e na saída de cada chamada.
Por que usar $/M tokens em vez de $/token?
Porque o valor de um único token é uma fração ínfima de centavo. Normalizar por milhão facilita a leitura, a comparação entre modelos e o planejamento orçamentário — e é o padrão adotado por todas as grandes plataformas.
Qual modelo é mais barato atualmente?
Entre os modelos proprietários de referência, o GPT-5.6 Luna apresenta a menor tarifa de entrada ($0,20/M tokens). Para casos de uso que tolerem modelos open source, soluções como Llama 3.2 3B podem chegar a $0,06/M tokens ou menos, dependendo do provedor de infraestrutura.
Vale a pena hospedar um modelo open source em vez de usar a API?
Depende do volume. O break-even do self-hosting costuma ocorrer acima de 500 milhões de tokens por dia. Abaixo desse patamar, as APIs comerciais geralmente são mais econômicas quando se consideram os custos totais de operação.
Como reduzir o custo por token sem trocar de modelo?
As principais estratégias são: compressão de prompts, caching semântico de respostas, truncamento do histórico de contexto e roteamento inteligente de chamadas para modelos menores em tarefas simples.
Voltar