Infracost reduz o uso de tokens do Claude em 79% ao redesenhar a CLI para agentes de IA

Infracost, uma ferramenta de CLI que estima custos de infraestrutura na nuvem a partir de Terraform, CloudFormation e CDK, redesenhou sua saída para agentes de codificação de IA como Claude Code e Cursor. O resultado: até 79% menos tokens de saída e 67% menos custos de API em comparação com uma linha de base apenas com Claude. O redesenho gira em torno de duas técnicas: pushdown de predicados na CLI e um formato de saída eficiente em tokens.
Detalhes do benchmark
- 16 perguntas sobre um fixture Terraform de 3 projetos com 1.171 recursos
- Modelo: Claude Opus, 5 repetições por pergunta
- Linha de base: Claude puro com ferramentas Bash e Read, sem skill carregado
- Comparado com o skill Infracost com a flag de saída
--llm
Resultados principais
| Métrica | Claude puro | Com skill Infracost (--llm) | Mudança |
|---|---|---|---|
| Respostas corretas | 5 / 11 (45%) | 11 / 11 (100%) | +6 |
| Custo total (USD) | $16.41 | $9.63 | -41% |
| Tokens de saída | 207.017 | 81.697 | -61% |
| Tempo real | 50 min | 50 min | empate |
Um exemplo: a pergunta "contar recursos distintos que falham na política de tagging, desduplicados entre projetos" custou $3.51 com Claude puro e atingiu o limite de 25 turnos, sem retornar resposta. Com a CLI redesenhada, a mesma pergunta custou $0.25 e retornou a resposta correta.
Abordagem técnica
- Pushdown de predicados: Em vez de fazer o agente canalizar JSON através de
jqou escrever parsers Python, a CLI aceita flags de filtragem (por exemplo,--tag-policy), transferindo a computação para a própria ferramenta. Isso reduz o número de turnos e o consumo de tokens. - Formato de saída eficiente em tokens: A flag
--llmretorna um formato compacto e amigável para agentes, em vez de tabelas verbosas legíveis por humanos ou JSON completo. Isso sozinho é responsável por uma parcela significativa da redução.
Armadilhas do harness de benchmark
Infracost abriu o código do seu harness para ajudar outros a evitar armadilhas:
- Sandbox
HOMEpara execuções de linha de base, evitando carregamento acidental de skills - Definir
TMPDIRpara um diretório local do projeto para contornar problemas de ACL do macOS - Adicionar o binário de teste ao
PATHem vez de confiar na instalação do sistema - Usar 5+ repetições por célula devido à variação de 20-30% nos tokens
- Reexecutar células que atingiram o limite de turnos (
--rerun-failed) e reavaliar se o verificador mudar (--rescore)
Se você mantém uma CLI que agentes de IA chamam como subprocesso, as mesmas duas ações — pushdown de predicados e um formato de saída dedicado para agentes — provavelmente se aplicam. O redesenho também melhorou a CLI voltada para humanos, embora o artigo foque no caminho dos agentes.
📖 Leia a fonte completa: HN AI Agents
👀 See Also

Crítica: CLI de binário único e foco local para revisar planos e diffs de agentes
Crit é um CLI de binário único que abre arquivos ou diffs no navegador com uma interface inspirada no GitHub, permitindo ciclos de feedback com agentes de IA — não precisa de conta.

Plugin Pair Programmer Adiciona Tela ao Vivo, Voz e Contexto de Áudio ao Claude Code
Um desenvolvedor criou um plugin chamado Pair Programmer que dá ao Claude Code percepção em tempo real da área de trabalho, capturando fluxos de tela, microfone e áudio do sistema. A arquitetura usa agentes especializados executados em paralelo para diferentes tipos de entrada, com indexação atualmente tratada por modelos em nuvem, mas projetada para ser independente de modelo.

O Repositório de Habilidades Awesome OpenClaw Oferece Mais de 5.400 Habilidades Filtradas
Um repositório GitHub chamado awesome-openclaw-skills oferece mais de 1.715 habilidades prontas para produção que agentes de IA podem instalar com um único comando CLI, filtradas do Registro Oficial de Habilidades do OpenClaw.

Bugs no analisador do LM Studio quebram a chamada de ferramentas e o raciocínio do Qwen3.5
O analisador do servidor do LM Studio tem três bugs interagentes que quebram silenciosamente a chamada de ferramentas, corrompem a saída de raciocínio e fazem os modelos parecerem piores do que realmente são. Os problemas afetam modelos de raciocínio como Qwen3.5 e DeepSeek-R1, com um bug relatado há mais de um ano ainda não resolvido.