Calculadora de Custo de IA: Estime seus Gastos com API de LLM
Projete seus gastos mensais com LLMs em diferentes modelos antes de ir para produção.
Cheapest / month
$90
Most expensive / month
$756
| Model | Per request | Per day | Per month |
|---|---|---|---|
| OpenAI GPT-5 mini | $0.001500 | $3 | $90 |
| Google Gemini 2.5 Flash | $0.001860 | $3.72 | $111.6 |
| Anthropic Claude Haiku | $0.003360 | $6.72 | $201.6 |
| OpenAI GPT-5 | $0.007500 | $15 | $450 |
| Google Gemini 2.5 Pro | $0.007500 | $15 | $450 |
| Anthropic Claude Sonnet | $0.0126 | $25.2 | $756 |
Prices are per million tokens from published list pricing and are a planning estimate.
Cutting LLM Cost and Latency
Seven levers ranked by payoff, model-routing patterns, and a realistic 100% → 11% cost walkthrough.
One email, no spam, unsubscribe any time.
Sobre esta ferramenta
O preço por token é cotado por milhão de tokens, o que dificulta prever a fatura mensal real. Insira o volume de requisições e a média de tokens de input e output para ver os custos por requisição, diários e mensais comparados lado a lado nas principais famílias de modelos.
Como funciona o preço das LLMs
Você paga separadamente por tokens de input (seu prompt, system message e qualquer contexto recuperado) e tokens de output (a resposta). O output costuma ser de três a cinco vezes mais caro, portanto respostas extensas dominam a fatura.
Como reduzir custos de API de IA
Reduza system prompts, limite o número máximo de tokens de output, faça cache de contextos repetidos e roteie requisições simples para modelos menores. Reservar o modelo principal apenas para requisições que realmente precisam dele costuma reduzir os gastos pela metade.
Como usar Calculadora de Custo de IA
- 1
Estime os tokens
Aproximadamente 1 token ≈ 4 caracteres em inglês. Cole um prompt representativo em um contador de tokens se quiser um valor mais exato.
- 2
Insira o volume
Adicione as requisições por dia ou por mês, incluindo retentativas e background jobs.
- 3
Compare modelos
A tabela exibe a projeção de custo mensal lado a lado para você avaliar se a troca de modelo realmente vale a pena.
- 4
Defina o orçamento com margem
Adicione de 20% a 30% de margem para retentativas, execuções de teste e picos de tráfego.
Exemplo de entrada
1,200 input + 400 output tokens · 50,000 requests/month
Saída esperada
≈ $X/month per model, compared across GPT, Claude and Gemini tiers
Boas práticas
- Calcule o custo por requisição e multiplique pelo volume mensal real — as médias escondem os picos onde o custo realmente está.
- Separe os tokens de input e output: o output costuma ser 3 a 5 vezes mais caro, portanto resumir respostas extensas reduz mais custos do que encurtar prompts.
- Faça cache de system prompts e contextos recuperados quando o provedor oferecer suporte; prefixos repetidos são o maior gasto evitável.
- Roteie por complexidade — use um modelo menor como padrão e acione modelos maiores apenas quando a confiança for baixa.
- Revise os preços trimestralmente e defina um limite rígido de gasto mensal no provedor antes de dimensionar o tráfego.
Calculadora de Custo de IA — Por que isso importa
O gasto com LLM escala com o uso, não com a equipe; um lançamento bem-sucedido pode multiplicar sua fatura da noite para o dia se ninguém tiver feito a projeção prévia.
Saber o custo por requisição permite precificar seu próprio produto com uma margem bruta real em vez de um palpite.
Ferramentas relacionadas, grátis e pagas
| Ferramenta | Tipo | Principais recursos | Link |
|---|---|---|---|
| OpenAI pricing | Free | Tarifas atuais por token para cada modelo | Acessar |
| HeliconeOferta | Freemium | Observabilidade de custo e latência de LLM por requisição | Acessar |
| LangfuseOferta | Freemium | Tracing open-source com atribuição de custos | Acessar |
| OpenRouterOferta | Freemium | Uma única API entre provedores com comparação de preços em tempo real | Acessar |
Alguns links marcados como Oferta são links de parceiros. Não custam nada a mais para você e ajudam a manter estas ferramentas gratuitas.