Calculadora de tokens e custo de IA
Descubra quantos tokens seu prompt consome e quanto isso custa por mês em cada modelo. Roda inteiro no seu navegador — nada do que você colar aqui sai da sua máquina.
1. Cole o texto que vai no prompt
2. Estime a resposta e o volume
Tokens de saída são cobrados bem mais caro que os de entrada. Se não souber quanto o modelo responde, 500 tokens equivalem a uns 3 parágrafos.
3. Custo estimado por modelo
Os preços abaixo são editáveis. Ajuste para o valor do seu contrato ou para o preço atual da tabela oficial.
US$ 0,0001 por chamada
US$ 0,0021 por chamada
US$ 0,01 por chamada
- Muse Spark 1.2: Preço reportado pela imprensa, sem confirmação na página oficial
- Muse Spark 1.2 (contributor): Exige autorizar o uso dos seus prompts e código para treino
Como a cobrança por token funciona
Toda API de modelo de linguagem cobra por token, e separa dois preços: um para o que entra e outro para o que sai. Entrada é tudo que você manda — a instrução, o histórico da conversa, os documentos anexados, as definições de ferramentas. Saída é o que o modelo escreve de volta.
A diferença entre os dois é grande. Não é incomum a saída custar seis vezes mais que a entrada. Isso muda a estratégia de otimização: cortar metade do prompt costuma economizar menos do que limitar o tamanho da resposta.
Vale lembrar de um custo silencioso: em conversas com memória, todo o histórico volta como entrada a cada nova mensagem. Uma conversa longa fica progressivamente mais cara, mesmo que a última pergunta seja curta.
Onde dá para economizar de verdade
- Limite os tokens de saída. A maioria das APIs aceita um teto por chamada. É a alavanca de maior efeito e a mais fácil de aplicar.
- Use o modelo certo para cada tarefa. Classificação, extração e reformatação raramente precisam do modelo topo de linha. Reserve-o para o que exige raciocínio em várias etapas.
- Corte o histórico. Em vez de reenviar a conversa inteira, mantenha só as últimas trocas mais um resumo do que veio antes.
- Aproveite o cache de prompt quando o fornecedor oferecer. Instruções de sistema que se repetem entre chamadas podem sair bem mais baratas.
Para se aprofundar
- GPT-5.6: o que muda de verdade no seu dia a dia — as três variantes do modelo e como o preço da API mudou.
- Python ou TypeScript: qual usar em projetos de IA — escolha de stack para quem consome modelo via API.
- Prompts prontos — para testar aqui e medir o consumo antes de levar para produção.
Perguntas frequentes
O que é um token?
Token é a unidade em que os modelos de linguagem quebram o texto — normalmente um pedaço de palavra, não a palavra inteira. Em português, uma palavra comum costuma virar 1 a 2 tokens, e palavras longas ou acentuadas podem virar 3 ou mais. A cobrança das APIs é sempre por token, separando entrada (o que você envia) de saída (o que o modelo responde).
A contagem desta calculadora é exata?
Não, é uma estimativa com margem de aproximadamente 15%. A contagem exata depende do tokenizador específico de cada modelo, que exigiria carregar vários megabytes de vocabulário no navegador e tornaria a página lenta. Para dimensionar custo antes de escrever código, a estimativa resolve; para conferir fatura, use o contador oficial da API.
Por que o texto em português gasta mais tokens que em inglês?
Os tokenizadores dos principais modelos foram treinados majoritariamente em inglês, então palavras em inglês costumam caber em menos pedaços. Acentuação e a morfologia mais rica do português fazem o mesmo conteúdo consumir de 10% a 20% mais tokens — o que se traduz direto em custo maior por requisição.
Por que os tokens de saída custam mais caro?
Gerar texto é computacionalmente mais caro do que ler texto: o modelo produz um token por vez, cada um dependendo dos anteriores. Por isso a diferença de preço costuma ser de 4 a 6 vezes. Na prática, limitar o tamanho da resposta costuma reduzir mais a conta do que encurtar o prompt.
Meu texto é enviado para algum servidor?
Não. Todo o cálculo acontece no seu navegador, em JavaScript. Nada do que você cola aqui sai da sua máquina, não é armazenado e não passa por nenhuma API. Você pode conferir desligando a conexão: a calculadora continua funcionando.
Como reduzir o custo de uma aplicação com LLM?
Três alavancas costumam dar mais retorno: limitar o número máximo de tokens da resposta, usar um modelo mais leve nas tarefas simples e reservar o modelo topo de linha para o que realmente exige raciocínio, e aproveitar cache de prompt quando o fornecedor oferecer, já que trechos repetidos entre chamadas podem sair bem mais baratos.