Agente de Codificação Pi com Qwen 35B Q2: Usando Sistema de Arquivos como Memória Externa e Impondo Guardas de Contexto

Um usuário do Reddit compartilhou sua abordagem para codificação agentiva com LLMs locais, construída sobre o agente de codificação Pi com Qwen 35B (Q2_K_XL quant via LM Studio). A ideia central: tratar o LLM como um processador lógico, não como um banco de dados de contexto. A implementação impõe guardiões rigorosos no limite da API — o modelo não pode contorná-los.
Principais restrições impostas pelo sistema
- Limite de escrita/edição: Rejeita qualquer saída com mais de 100 linhas. O modelo deve escrever um esqueleto primeiro e depois preencher uma seção de cada vez. Se tentar despejar um arquivo completo, a chamada é bloqueada com instruções para dividir o trabalho.
- Teto do bloco de pensamento: Se o raciocínio do modelo exceder 2000 caracteres, ele recebe uma correção para escrever conclusões no disco e prosseguir.
- Monitor de contexto: A 65% de uso do contexto, o modelo é instruído a escrever seu estado em arquivos. A 80%, tudo para — o modelo escreve seu 'cérebro' no disco enquanto ainda está coerente.
- Saída persistente: Se o modelo der uma resposta longa sem escrever um arquivo, ele é instruído a salvar descobertas em um arquivo de etapa. Nada permanece apenas no contexto.
Estrutura de cérebro externo
O sistema usa diretórios .think/ e .plan/ como memória externa do modelo. Cada etapa, decisão e descoberta é escrita em um arquivo. Quando o contexto comprime, o modelo lê suas próprias anotações de volta. O propósito da sessão é salvo separadamente em _purpose.md e reinjetado após a compressão de contexto, preservando o objetivo original.
Destilação de conhecimento
Um comando /distill percorre uma base de código, constrói um grafo de importações, ordena os arquivos topologicamente e faz o modelo resumi-los um por turno em uma base de conhecimento. O manifesto é dividido em páginas de 50 arquivos para evitar consumir todo o contexto. Usuários podem colocar arquivos como svelte5-gotchas.md ou astro-gotchas.md em uma pasta de conhecimento; uma chamada LLM isolada seleciona quais são relevantes para a tarefa atual, e apenas o conteúdo é injetado na conversa principal.
Resultado no mundo real
O usuário pediu ao modelo para construir um jogo de avião em Three.js. A primeira tentativa escreveu 652 linhas em uma única chamada — o guardião rejeitou. O modelo replanejou, escreveu um esqueleto e depois preencheu recursos uma edição de cada vez. O resultado final foi um jogo funcional com modelo 3D de avião, obstáculos, HUD, minimapa e telas de início/fim de jogo — tudo em Q2 quant.
A configuração completa roda em quantização Q2_K_XL como piso; o usuário nota que Q4 ou Q8 devem produzir melhores resultados. O código está disponível no GitHub: github.com/Kodrack/Pi-forge.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

Agente Times Skill para ClawHub Adiciona Consultas em Tempo Real de Notícias, Clima e Preços de Tokens
Uma nova habilidade do ClawHub chamada Agent Times permite que agentes de IA respondam a consultas em tempo real sobre notícias, clima e preços de criptomoedas. A instalação é feita via npx clawhub install agenttimes, e ela fornece acesso a mais de 228 mil artigos de 3.576 feeds com pontuação de sentimento e extração de entidades.

Preços do Modelo OpenRouter e Análise de Inteligência por Dólar
Um usuário do Reddit compilou os preços da API do OpenRouter para 16 modelos de IA e calculou os valores de inteligência por dólar, identificando o MiMo-V2-Flash como o melhor custo-benefício a US$ 0,09/M de tokens e o GPT-5.4 como o mais inteligente a US$ 2,50/M de tokens.

A Pesquisa Automática de Karpathy Portada para o Motor Neural da Apple para Melhor Rendimento por Watt
Um protótipo combina o projeto autoresearch de Andrej Karpathy com o desempenho do Apple Neural Engine (ANE) engenharia reversa, visando melhor throughput por watt em comparação com APIs oficiais. O projeto é construído sobre repositórios GitHub existentes e reconhece contribuições de vários desenvolvedores.

cq: Um Sistema de Compartilhamento de Conhecimento Local-First para Agentes de Codificação de IA
O cq da Mozilla.ai é uma ferramenta de código aberto que permite que agentes de IA de programação compartilhem 'unidades de conhecimento' sobre armadilhas comuns por meio de um armazenamento SQLite local, com opção de compartilhamento em equipe através de uma API Docker. Ele é instalado como um plugin do Claude Code ou servidor MCP do OpenCode.