Agente de Codificación Pi con Qwen 35B Q2: Uso del Sistema de Archivos como Memoria Externa y Establecimiento de Guardas de Contexto

Un usuario de Reddit compartió su enfoque para la codificación agentiva con LLMs locales, basado en el agente de codificación Pi con Qwen 35B (cuantificación Q2_K_XL mediante LM Studio). La idea central: tratar al LLM como un procesador lógico, no como una base de datos de contexto. La implementación impone restricciones estrictas en el límite de la API: el modelo no puede evitarlas.
Restricciones clave impuestas por el sistema
- Límite de escritura/edición: Rechaza cualquier salida de más de 100 líneas. El modelo debe escribir primero un esqueleto y luego completar una sección a la vez. Si intenta volcar un archivo completo, la llamada se bloquea con instrucciones para dividir el trabajo.
- Límite de bloque de pensamiento: Si el razonamiento del modelo supera los 2000 caracteres, recibe una corrección para escribir conclusiones en disco y continuar.
- Monitor de contexto: Al 65% de uso del contexto, se le dice al modelo que escriba su estado en archivos. Al 80%, todo se detiene: el modelo escribe su 'cerebro' en el disco mientras aún está coherente.
- Salida persistente: Si el modelo da una respuesta larga sin escribir un archivo, se le instruye para guardar los hallazgos en un archivo de paso. Nada se queda solo en el contexto.
Estructura del cerebro externo
El sistema utiliza los directorios .think/ y .plan/ como memoria externa del modelo. Cada paso, decisión y hallazgo se escribe en un archivo. Cuando el contexto se comprime, el modelo lee sus propias notas. El propósito de la sesión se guarda por separado en _purpose.md y se reinyecta después de la compresión del contexto, preservando el objetivo original.
Destilación de conocimiento
Un comando /distill recorre una base de código, construye un gráfico de importaciones, ordena los archivos topológicamente y hace que el modelo los resuma uno por turno en una base de conocimiento. El manifiesto se divide en páginas de 50 archivos para no consumir todo el contexto. Los usuarios pueden colocar archivos como svelte5-gotchas.md o astro-gotchas.md en una carpeta de conocimiento; una llamada LLM aislada selecciona cuáles son relevantes para la tarea actual, y solo el contenido se inyecta en la conversación principal.
Resultado real
El usuario le pidió al modelo que construyera un juego de vuelo en Three.js. El primer intento trató de escribir 652 líneas en una sola llamada: la restricción lo rechazó. El modelo replaneó, escribió un esqueleto y luego completó las características una edición a la vez. El resultado final fue un juego funcional con modelo de avión 3D, obstáculos, HUD, minimapa y pantallas de inicio y fin del juego, todo con cuantificación Q2.
La configuración completa funciona con cuantificación Q2_K_XL como mínimo; el usuario señala que Q4 o Q8 deberían dar mejores resultados. El código está disponible en GitHub: github.com/Kodrack/Pi-forge.
📖 Leer la fuente completa: r/LocalLLaMA
👀 Ver también

Codiff v0.1.0: Un visor local de diferencias para revisiones de código generadas por LLM
Codiff v0.1.0 es una aplicación de escritorio rápida y minimalista para revisar diferencias locales de Git, con modo de recorrido LLM y comentarios en línea que se pueden copiar como Markdown.

Servidor MCP conecta a Claude con el inventario de vinos de CellarTracker
Un desarrollador construyó un servidor MCP que conecta a Claude directamente con cuentas de CellarTracker, permitiendo consultas conversacionales sobre inventario de vinos, notas de cata, historial de compras y ventanas de consumo sin necesidad de exportaciones manuales de CSV.

n8n-mcp-lite: El servidor MCP reduce el uso de tokens en un 80% para Claude con flujos de trabajo de n8n
Un nuevo servidor de Protocolo de Contexto de Modelo de código abierto llamado n8n-mcp-lite ayuda a Claude a razonar sobre flujos de trabajo de automatización de n8n mientras reduce el uso de tokens aproximadamente en un 80%. La herramienta aborda la naturaleza intensiva en tokens de las automatizaciones de nodos visuales al proporcionar escaneos de flujos de trabajo específicos y actualizaciones quirúrgicas.

mindpm: Un Servidor MCP Gratuito para Memoria de Proyecto Persistente con Claude
mindpm es un servidor MCP gratuito y de código abierto que proporciona a Claude una base de datos SQLite local para realizar un seguimiento de tareas, decisiones, notas y resúmenes de sesión entre conversaciones. La configuración toma 30 segundos con el comando: claude mcp add mindpm -e MINDPM_DB_PATH=~/.mindpm/memory.db -- npx -y mindpm.