Reflect MCP Server Implementa el Documento de Reflexión para la Memoria Persistente del Agente de Codificación

Un desarrollador ha implementado el artículo Reflexion (Shinn et al., NeurIPS 2023) como un servidor MCP para abordar un problema común con los agentes de codificación local: la falta de memoria persistente entre sesiones. La herramienta, llamada reflect-mcp, permite a los agentes recordar y evitar repetir errores.
Cómo Funciona
El sistema opera a través de un flujo de trabajo estructurado:
- Después de cada fallo en las pruebas, el agente critica su propio trabajo y extrae patrones del error
- Estas lecciones se almacenan para referencia futura
- Antes de comenzar nuevas tareas, el agente recuerda lecciones pasadas utilizando búsqueda de texto completo
- La coincidencia de patrones está completamente basada en expresiones regulares - no se necesitan llamadas a LLM para la clasificación
El desarrollador señala que los mensajes de error son lo suficientemente predecibles para que la coincidencia determinista funcione de manera efectiva. El agente escribe la crítica ya que tiene el contexto, mientras que el servidor maneja la estructuración y deduplicación de las lecciones.
Implementación Técnica
- Construido como un servidor MCP (Protocolo de Contexto del Modelo)
- Utiliza SQLite con FTS5 para almacenamiento y búsqueda
- Funciona con cualquier cliente compatible con MCP
- Instalar mediante:
cargo install reflect-mcp
Resultados Después de Una Semana
El desarrollador reportó varias mejoras en el comportamiento de su agente de codificación:
- Dejó de hacer el mismo
unwrap()en la entrada del usuario - Dejó de olvidar el manejo de zonas horarias
- Comenzó a evitar automáticamente patrones de fallo previamente vistos
- El seguimiento de patrones hizo visibles los errores recurrentes en todo el proyecto
El proyecto está disponible en GitHub en https://github.com/rohansx/reflect. El desarrollador está buscando comentarios de otros que hayan experimentado con configuraciones de memoria persistente para agentes de codificación local.
📖 Read the full source: r/LocalLLaMA
👀 Ver también

Backend personalizado de llama.cpp descarga la multiplicación de matrices de LLM a la NPU AMD XDNA2 en Ryzen AI MAX 385
Un desarrollador creó un backend personalizado de llama.cpp que envía operaciones GEMM directamente al NPU AMD XDNA2 en Ryzen AI MAX 385 (Strix Halo), logrando 43.7 t/s de decodificación a 0.947 J/tok con Meta-Llama-3.1-8B-Instruct Q4_K_M. La ruta de decodificación del NPU ahorra ~10W en comparación con solo Vulkan, manteniendo el rendimiento de decodificación.

Aplicando la Arquitectura de Claude Code a Modelos Locales de 9B: Hallazgos Clave y Optimizaciones
Un desarrollador extrajo patrones arquitectónicos del código fuente filtrado de Claude Code y aplicó 10 optimizaciones a qwen3.5:9b ejecutándose localmente en una RTX 5070 Ti. El descubrimiento clave fue que qwen3.5:9b tiene llamadas a herramientas estructuradas nativas, y la mayor limitación para los modelos de 9B es la autodisciplina para saber cuándo dejar de explorar y comenzar a producir resultados.

Flue: Un Framework TypeScript para Construir Agentes de Codificación Autónomos
Flue es un framework de TypeScript que proporciona un arnés programable para construir agentes autónomos, con habilidades, sesiones, ejecución de shell en entorno aislado y un sandbox virtual integrado. Puede reemplazar herramientas como Dosu, Greptile, CodeRabbit, Devin y Claude Code con lógica de agente personalizada.

Desarrollo Guiado por Manual: Un Método para Prevenir la Divergencia Confiada del Código de Claude
El Desarrollo Guiado Manual (MDD) es un método que aborda la divergencia confiada en Claude Code, donde la IA produce código incorrecto que pasa sus propias pruebas. En una auditoría de producción, MDD encontró 190 problemas, escribió 876 pruebas nuevas en menos de 8 horas y eliminó violaciones de reglas.