Todos saíram da documentação da Anthropic. Nenhum percentual inventado — onde não há número medido, você recebe o mecanismo. E no fim, três mitos que circulam por aí e não se sustentam.
A documentação lista os fatores. Guarde essa lista — ela é o filtro para avaliar qualquer dica que você encontrar por aí:
Se uma dica não age sobre um desses sete itens, ela não economiza nada.
Tamanho de mensagem conta nos dois sentidos: o que você escreve e o que ele devolve. Resposta com introdução, recapitulação do pedido e sugestão de próximos passos custa tokens que não entregam nada.
Responda direto. Sem introdução, sem resumo do que eu pedi, sem oferecer próximos passos. Só o resultado. Se precisar explicar, explique depois da resposta, em no máximo duas linhas.
Funciona melhor como instrução de projeto do que colado a cada conversa — assim vale para tudo sem você repetir.
Cada ida e volta reprocessa a conversa inteira. A documentação recomenda explicitamente agrupar tarefas relacionadas em vez de mandar uma por vez.
"Revisa esse texto."
"Agora encurta."
"Agora muda o título."
"Agora traduz."
"Revisa esse texto, encurta pra 200 palavras, sugere 3 títulos e traduz pro inglês."
A diferença não é só o número de mensagens. Na versão à esquerda, a quarta chamada carrega as três anteriores inteiras.
Modelo e nível de esforço estão na lista oficial de fatores. Rodar tarefa simples no modelo mais caro é desperdício sem contrapartida.
| Modelo | Quando |
|---|---|
| Haiku | Resposta rápida, tarefa repetitiva, volume, classificação, extração |
| Sonnet | O dia a dia: redação, resumo, código comum, primeira versão |
| Opus | Decisão difícil, diagnóstico, análise densa, peça que não pode errar |
E baixe o nível de esforço na tarefa de rotina. Esforço alto faz o modelo pensar mais — o que é ótimo num problema difícil e caro numa tarefa boba.
Conteúdo dentro de um projeto fica em cache e não conta contra o seu limite quando é reutilizado. É a única forma de consultar o mesmo documento cem vezes sem pagar cem vezes.
O projeto também usa RAG: em vez de arrastar o arquivo inteiro para dentro da janela, ele busca e carrega só o trecho relevante para a pergunta.
Reenviar o mesmo PDF a cada conversa é pagar de novo pela mesma coisa.
Conversa longa fica cara porque tudo que veio antes continua ocupando a janela. Mas abrir outra do zero perde o fio. A saída é levar só o essencial.
Resume nossa conversa em 5 bullets contendo: as decisões tomadas, o contexto crítico pra continuar, o que ficou pendente e qualquer trecho de código ou texto essencial. Formato pronto pra colar em um chat novo.
Se o assunto é recorrente, o lugar desse resumo é a instrução do projeto — aí ele passa a viajar sozinho, sem você colar nada.
Você não precisa adivinhar quanto sobrou. Em Configurações › Uso existe um painel com barras de progresso.
Saber onde você está muda a decisão: com 20% de sessão restante e uma tarefa densa pela frente, vale mais esperar o reset do que começar e ser interrompido no meio.
Circula que usar de madrugada gasta menos token. Não gasta. O consumo é determinístico: a mesma mensagem custa o mesmo às 6h e às 15h. Horário do dia não está na lista de fatores da Anthropic.
Conselho comum e ruim. Além do trabalho extra, o resultado é pior: o resumo de outra ferramenta perde detalhe que você talvez precise. A solução oficial é o projeto, com cache e RAG — ver Hack #4.
Qualquer percentual sem metodologia publicada é chute. A Anthropic não divulga número de economia por técnica, e ninguém consegue medir isso de fora com rigor. Desconfie de quem promete porcentagem exata.
| O quê | Onde |
|---|---|
| Boas práticas | Usage limit best practices |
| Como funcionam | Usage e length limits |
| Relacionado | Dossiê #006 — Limite de contexto |