Custo de token no produto é FinOps de modelo: teto por fluxo, alerta e o que acontece quando estoura — antes da feature ir a todos. PM e engenharia deveriam ver o envelope, não só o demo. Sem teto, o agente em loop e o contexto gordo comem o orçamento no silêncio.

Agentes no desenvolvimento aceleram código; no produto o token é linha de P&L. Limite de autonomia corta ação irreversível; o teto de token corta ação cara. RAG infla contexto — cada trecho recuperado paga.

Teto operacional

  • orçamento por feature ou por tenant, não só “a conta da OpenAI”;
  • máximo de tokens por request e de retries;
  • cache onde a pergunta se repete;
  • degradar (fila, modelo menor, recusa) quando o teto pede;
  • log de custo no mesmo id de request da observabilidade.

Não publicamos preço de token. O preço é o do contrato de vocês. O trabalho é não descobrir na fatura de julho.

Feature sem teto é o primo da GPU ociosa: inovação sem dono de envelope.

Produto versus playground

Playground interno pode ter teto folgado. Produto com usuário externo não. Misturar as chaves mistura o P&L. Chave de produção no notebook do intern é o mesmo anti-padrão de credencial no prompt, com efeito na fatura.

PM aceita o recorte: a feature X custa até Y por semana; acima disso, não escala o rollout. Engenharia implementa o corte. Sem os dois, o teto é slide.

Relação com qualidade

Contexto enorme não é qualidade. É conta. Retrieval seletivo e prompt curto são produto e FinOps juntos. “Manda o PDF inteiro” é a hipótese cara. Discovery deveria ter matado isso — se a feature já saiu, o teto é o freio.

No sprint, o teto vira aceite: a feature não sobe para mais usuários sem envelope e sem degradê escrito. Quem só mede token depois da fatura está fazendo FinOps de luto. Quem mede no request id consegue cortar o fluxo, não o produto inteiro. Isso vale para chat interno e para API cobrada por uso. A linha aparece no mesmo quadro que a história — senão a história ganha sempre.

Como a Tech Coders trata teto de token na fábrica

Na fábrica de software, feature de modelo entra no sprint de 15 dias com teto, log e degradê. Não prometemos custo menor universal de IA. Prometemos envelope visível no quadro. Sustentação 24×7 inclui o alerta de estouro — o on-call de produto, não só o de infra.

Perguntas frequentes

Teto não degrada a experiência?

Degrada o abuso e o loop. Experiência honesta é recusar com mensagem, não falhar a fatura. Rollout gradual mede os dois.

Modelo menor resolve?

Resolve parte do unitário. Não resolve retry infinito nem contexto gordo. Teto continua.

Quem paga: produto ou TI?

Quem dono da feature. TI compartilhado esconde. Tag na chave e no projeto de cloud/API.

Agente interno de dev usa o mesmo teto?

Usa um teto, outro envelope. Misturar com o produto distorce os dois P&Ls. Separe chaves.