Grafo de Habilidades Recorrible para Memoria Persistente de Agentes de IA en Bases de Código

Una Solución Práctica para Asistentes de IA sin Estado
Los asistentes de programación con IA carecen de memoria persistente entre sesiones, obligando a los desarrolladores a comenzar desde cero cada vez. El enfoque común de volcar todo en archivos de reglas grandes como .cursorrules falla debido a los límites de tokens y la dilución de las instrucciones.
La solución presentada es la divulgación progresiva a través de un gráfico de habilidades transitable que reside dentro de la base de código. La IA navega este gráfico de forma autónoma a través de las sesiones.
Arquitectura de Tres Capas
El sistema tiene tres capas distintas:
- Capa 1 (Siempre Cargada): Menos de 150 líneas (300 tokens). Contiene identidad de pila, convenciones de carpetas y elementos no negociables. Incluye un puntero saliente a
HANDOVER.md. - Capa 2 (Cargada por Sesión):
HANDOVER.mdsirve como un enrutador de atención, no como un documento. Le dice a la IA qué archivo de dominio cargar según la tarea actual (pagos, autenticación, base de datos, rutas-api). Cada archivo de dominio termina con instrucciones que apuntan al siguiente archivo relevante, creando un sistema autodirigido. - Capa 3 (Cargada por Tarea): Biblioteca de prompts con 12 categorías. Cada entrada incluye secciones de contexto, construcción, verificación y depuración. La IA consulta el índice, carga la categoría y sigue el patrón.
Perspectiva Central: Instrucciones Autodirigidas
La innovación clave es que las instrucciones llevan significado, no solo referencias. Por ejemplo: "cargar security/threat-modeling.md antes de modificar manejadores de webhooks" le dice a la IA cuándo y por qué, no solo qué.
El desarrollador ha integrado esto en una plantilla SaaS que se entrega con la base de código, disponible en launchx.page para aquellos que deseen examinar la estructura completa del gráfico.
📖 Read the full source: r/LocalLLaMA
👀 Ver también

Flujo de Trabajo de Agente de IA Local Usando OpenCode, FastMCP y DeepSeek-r1
Un desarrollador comparte su configuración de agente de IA local utilizando OpenCode con archivos AGENTS.md para prompts de sistema deterministas, FastMCP para exponer funciones locales, y DeepSeek-r1 vía Ollama para subagentes específicos como pruebas.

Hypura: Programador de inferencia de LLM consciente del nivel de almacenamiento para Apple Silicon
Hypura es un planificador de inferencia basado en Rust que distribuye los tensores del modelo entre las capas de GPU, RAM y NVMe para ejecutar modelos que superan la memoria física en Macs con Apple Silicon. Permite ejecutar un Mixtral 8x7B de 31 GB en un Mac Mini de 32 GB a 2.2 tok/s y un Llama 70B de 40 GB a 0.3 tok/s, mientras que llama.cpp estándar falla.

Modelo Qwen3.5-9B-Claude-4.6-Opus-Uncensored-v2 Lanzado con Configuración de LM Studio
Ya está disponible un modelo combinado sin censura que integra la arquitectura Qwen3.5-9B con datos de entrenamiento de Claude 4.6 Opus, con configuraciones específicas de LM Studio 0.4.7 para un rendimiento óptimo, incluyendo temperatura 0.7 y muestreo Top K 20.

Corrección de Fuga de Memoria de Claude Code para Homelabs Linux
Un desarrollador descubrió que Claude Code tiene una grave fuga de memoria en glibc malloc que consumió 400GB de RAM y colapsó su homelab Proxmox, luego creó una solución de protección de dos niveles con un shim LD_PRELOAD y un watchdog.