Neste artigo
Custo de token no produto é FinOps de modelo: teto por fluxo, alerta e o que acontece quando estoura — antes da feature ir a todos. PM e engenharia deveriam ver o envelope, não só o demo. Sem teto, o agente em loop e o contexto gordo comem o orçamento no silêncio.
Agentes no desenvolvimento aceleram código; no produto o token é linha de P&L. Limite de autonomia corta ação irreversível; o teto de token corta ação cara. RAG infla contexto — cada trecho recuperado paga.
Teto operacional
- orçamento por feature ou por tenant, não só “a conta da OpenAI”;
- máximo de tokens por request e de retries;
- cache onde a pergunta se repete;
- degradar (fila, modelo menor, recusa) quando o teto pede;
- log de custo no mesmo id de request da observabilidade.
Não publicamos preço de token. O preço é o do contrato de vocês. O trabalho é não descobrir na fatura de julho.
Feature sem teto é o primo da GPU ociosa: inovação sem dono de envelope.
Produto versus playground
Playground interno pode ter teto folgado. Produto com usuário externo não. Misturar as chaves mistura o P&L. Chave de produção no notebook do intern é o mesmo anti-padrão de credencial no prompt, com efeito na fatura.
PM aceita o recorte: a feature X custa até Y por semana; acima disso, não escala o rollout. Engenharia implementa o corte. Sem os dois, o teto é slide.
Relação com qualidade
Contexto enorme não é qualidade. É conta. Retrieval seletivo e prompt curto são produto e FinOps juntos. “Manda o PDF inteiro” é a hipótese cara. Discovery deveria ter matado isso — se a feature já saiu, o teto é o freio.
No sprint, o teto vira aceite: a feature não sobe para mais usuários sem envelope e sem degradê escrito. Quem só mede token depois da fatura está fazendo FinOps de luto. Quem mede no request id consegue cortar o fluxo, não o produto inteiro. Isso vale para chat interno e para API cobrada por uso. A linha aparece no mesmo quadro que a história — senão a história ganha sempre.
Como a Tech Coders trata teto de token na fábrica
Na fábrica de software, feature de modelo entra no sprint de 15 dias com teto, log e degradê. Não prometemos custo menor universal de IA. Prometemos envelope visível no quadro. Sustentação 24×7 inclui o alerta de estouro — o on-call de produto, não só o de infra.
Perguntas frequentes
Teto não degrada a experiência?
Degrada o abuso e o loop. Experiência honesta é recusar com mensagem, não falhar a fatura. Rollout gradual mede os dois.
Modelo menor resolve?
Resolve parte do unitário. Não resolve retry infinito nem contexto gordo. Teto continua.
Quem paga: produto ou TI?
Quem dono da feature. TI compartilhado esconde. Tag na chave e no projeto de cloud/API.
Agente interno de dev usa o mesmo teto?
Usa um teto, outro envelope. Misturar com o produto distorce os dois P&Ls. Separe chaves.
Guia do tema: Agentes de IA autônomos: delegando trabalho real à IA