Reduza os custos de sessão de codificação de IA em 90% com indexação de código baseada em gráficos

Um usuário do Reddit relata gastar $2-6 por consulta no Claude Code devido ao modelo reler dezenas de arquivos a cada sessão. Mesmo com cache (70% dos tokens do cache com 90% de desconto), o cache é reiniciado por sessão. A solução: um servidor local que indexa a base de código em um banco de dados gráfico, consultado via Model Context Protocol (MCP) em vez de leituras brutas de arquivos.
Como Funciona
- Em vez de análise AST ou embeddings vetoriais, a ferramenta usa um LLM para gerar um propósito, resumo e contexto de negócio para cada arquivo, além de links para suas funções, classes e importações.
- O grafo é exposto por meio de um servidor MCP; Claude consulta o grafo para buscas direcionadas (2-4 nós por pergunta) em vez de despejar todo o repositório no contexto.
- Os custos das sessões caíram de dólares para centavos. A abordagem funciona igualmente bem com modelos de código aberto como DeepSeek-V4 e Kimi-2.6 porque a recuperação (não o tamanho do modelo) faz o trabalho pesado.
Detalhes da Configuração
Tudo roda localmente, single-tenant, sem dependência de nuvem. O projeto é open-source no GitHub: github.com/ByteBell/bytebell-oss. O usuário observa que não está usando análise AST ou vetores — o grafo são análises de arquivo geradas por LLM.
Para Quem É
Desenvolvedores que usam Claude Code (ou qualquer agente de IA com custo por token) em bases de código grandes e que desejam reduzir drasticamente os custos armazenando em cache o contexto estrutural entre sessões.
📖 Leia a fonte original: r/ClaudeAI
👀 See Also

Construindo um Agente de Pesquisa Autônomo com C# e LLMs Locais
Um agente de pesquisa em C# automatiza o processamento de URLs com LLMs locais usando Ollama e llama3.1:8b, gerando relatórios estruturados em markdown a partir de buscas na web.

FixAI: Jogo de Navegador Ensina Direito do Consumidor ao Combater Robôs Corporativos de IA
FixAI é um jogo de navegador com 36 níveis onde os jogadores argumentam contra sistemas de IA corporativos ou governamentais usando leis reais de consumo. Construído com Vanilla JS, Node/Express e Claude Haiku, ele apresenta um sistema de pontuação de resistência e explicações educacionais sobre argumentos legais.

Guarda de Raciocínio: Detecção de Loop em Nível de Proxy para Inferência Local de LLM
Uma camada de proteção no proxy que detecta e recupera de loops de raciocínio de LLMs usando verificações determinísticas no stream — limites de tokens, repetição de n-gramas e impressão digital de frases — sem modificações no modelo.

Ferramenta Local RAG Construída com Nemotron Nano 9B v2 e Chamada de Ferramentas vLLM
Um desenvolvedor criou uma ferramenta de pesquisa RAG local-first que roda inteiramente em uma única GPU usando Nemotron Nano 9B v2 Japanese no vLLM com plugins de parser personalizados para chamadas de ferramentas. O sistema apresenta um fluxo de extração-execução em duas etapas com extração de palavras-chave bilíngue e busca paralela FTS5/DuckDuckGo.