IA & Prompts

Calculadora de Custo de IA: Estime seus Gastos com API de LLM

Projete seus gastos mensais com LLMs em diferentes modelos antes de ir para produção.

Cheapest / month

$90

Most expensive / month

$756

ModelPer requestPer dayPer month
OpenAI GPT-5 mini$0.001500$3$90
Google Gemini 2.5 Flash$0.001860$3.72$111.6
Anthropic Claude Haiku$0.003360$6.72$201.6
OpenAI GPT-5$0.007500$15$450
Google Gemini 2.5 Pro$0.007500$15$450
Anthropic Claude Sonnet$0.0126$25.2$756

Prices are per million tokens from published list pricing and are a planning estimate.

Cutting LLM Cost and Latency

Seven levers ranked by payoff, model-routing patterns, and a realistic 100% → 11% cost walkthrough.

One email, no spam, unsubscribe any time.

Sobre esta ferramenta

O preço por token é cotado por milhão de tokens, o que dificulta prever a fatura mensal real. Insira o volume de requisições e a média de tokens de input e output para ver os custos por requisição, diários e mensais comparados lado a lado nas principais famílias de modelos.

Como funciona o preço das LLMs

Você paga separadamente por tokens de input (seu prompt, system message e qualquer contexto recuperado) e tokens de output (a resposta). O output costuma ser de três a cinco vezes mais caro, portanto respostas extensas dominam a fatura.

Como reduzir custos de API de IA

Reduza system prompts, limite o número máximo de tokens de output, faça cache de contextos repetidos e roteie requisições simples para modelos menores. Reservar o modelo principal apenas para requisições que realmente precisam dele costuma reduzir os gastos pela metade.

Como usar Calculadora de Custo de IA

  1. 1

    Estime os tokens

    Aproximadamente 1 token ≈ 4 caracteres em inglês. Cole um prompt representativo em um contador de tokens se quiser um valor mais exato.

  2. 2

    Insira o volume

    Adicione as requisições por dia ou por mês, incluindo retentativas e background jobs.

  3. 3

    Compare modelos

    A tabela exibe a projeção de custo mensal lado a lado para você avaliar se a troca de modelo realmente vale a pena.

  4. 4

    Defina o orçamento com margem

    Adicione de 20% a 30% de margem para retentativas, execuções de teste e picos de tráfego.

Exemplo de entrada

1,200 input + 400 output tokens · 50,000 requests/month

Saída esperada

≈ $X/month per model, compared across GPT, Claude and Gemini tiers

Boas práticas

  • Calcule o custo por requisição e multiplique pelo volume mensal real — as médias escondem os picos onde o custo realmente está.
  • Separe os tokens de input e output: o output costuma ser 3 a 5 vezes mais caro, portanto resumir respostas extensas reduz mais custos do que encurtar prompts.
  • Faça cache de system prompts e contextos recuperados quando o provedor oferecer suporte; prefixos repetidos são o maior gasto evitável.
  • Roteie por complexidade — use um modelo menor como padrão e acione modelos maiores apenas quando a confiança for baixa.
  • Revise os preços trimestralmente e defina um limite rígido de gasto mensal no provedor antes de dimensionar o tráfego.

Calculadora de Custo de IA — Por que isso importa

O gasto com LLM escala com o uso, não com a equipe; um lançamento bem-sucedido pode multiplicar sua fatura da noite para o dia se ninguém tiver feito a projeção prévia.

Saber o custo por requisição permite precificar seu próprio produto com uma margem bruta real em vez de um palpite.

Ferramentas relacionadas, grátis e pagas

FerramentaTipoPrincipais recursosLink
OpenAI pricingFreeTarifas atuais por token para cada modeloAcessar
HeliconeOfertaFreemiumObservabilidade de custo e latência de LLM por requisiçãoAcessar
LangfuseOfertaFreemiumTracing open-source com atribuição de custosAcessar
OpenRouterOfertaFreemiumUma única API entre provedores com comparação de preços em tempo realAcessar

Alguns links marcados como Oferta são links de parceiros. Não custam nada a mais para você e ajudam a manter estas ferramentas gratuitas.

Ferramentas relacionadas

Perguntas frequentes