Una Capa de Gobernanza de 7 Archivos para Prevenir la Deriva de Sesión en LLM

Un desarrollador en r/LocalLLaMA compartió una solución para evitar que asistentes de programación con LLM como Claude deshagan silenciosamente decisiones arquitectónicas entre sesiones. En lugar de tratar las sesiones de LLM como conversaciones, ahora las tratan como procesos sin estado que necesitan un protocolo.
El Problema Central
Cada sesión de LLM comienza con memoria cero. Vuelves a explicar, reinterpreta y se desvía con confianza. El desarrollador señaló: "Ni siquiera te darás cuenta hasta que estés profundamente dentro del proyecto, tal vez tres archivos adentro o cuatro archivos o quién sabe incluso en la última parte del proyecto".
La Capa de Gobernanza de 7 Archivos
La solución no es un mejor prompt sino una capa de gobernanza que cualquier modelo puede leer y operar inmediatamente dentro de ella. El sistema utiliza siete archivos, cada uno con una preocupación específica sin superposición:
active_context.md- Controlador de sesión, define lo que está en alcance en este momentocontracts.md- Ley de comportamiento, esquemas de datos, valores de enumeración, comportamiento requeridoagent_core.md- Disciplina de ejecución, cómo operar, validar, informaragent_project.md- Intención del proyecto, por qué existe este sistema, resultados esperadosdecisions.md- Registro ADR, elecciones no obvias y por qué fueron aceptadasbuild_plan.md- Hoja de ruta del módulo, orden de implementación y entregablesstate.md- Diario vivo, qué se hizo, qué cambió, qué queda
Decisiones de Diseño Clave
El desarrollador explicó dos separaciones críticas:
Separar contracts.md de agent_core.md: "Cuando apareció un conflicto de comportamiento, el modelo no tenía forma de saber a qué capa deferir. ¿Era esta una regla de esquema o una preferencia de ejecución? Cuando están separados, la jerarquía es inequívoca, los contratos siempre ganan".
Incluir decisions.md: "Casi lo omití ('solo lo recordaré'). Tres semanas después no pude reconstruir por qué habíamos elegido Postgres sobre SQLite para un módulo específico. El registro ADR existe precisamente porque 'lo recordaré' no es un protocolo".
El Bucle Operativo
Cada sesión sigue este orden, sin excepciones:
- Leer
active_context.md→ extraer lo que está en alcance - Reafirmar contra
contracts.md→ reglas de comportamiento bloqueadas - Confirmar restricciones operativas de
agent_core.md+agent_project.md - Verificar
decisions.md→ no revertir elecciones aceptadas - Ejecutar solo lo que
active_context.mdautoriza, segúnbuild_plan.md - Validar con pruebas — no declarar hecho sin evidencia
- Actualizar
state.mdcon resultados factuales - Si se tomó una nueva decisión no trivial, registrarla en
decisions.md
Impacto en el Flujo de Trabajo
El bloqueo de alcance de active_context.md demostró ser particularmente valioso: "Antes de esto, comenzaba una sesión para corregir un error y terminaba refactorizando un módulo no relacionado porque 'estaba justo ahí'. Se sentía productivo.........y lo era".
📖 Read the full source: r/LocalLLaMA
👀 Ver también

Nexus: Protocolo de IA a IA de Código Abierto con Descubrimiento, Confianza y Pagos
Nexus es un protocolo autohospedado que permite a los agentes de IA descubrirse entre sí, negociar términos, verificar respuestas y manejar micropagos sin intervención humana. Incluye cinco capas: descubrimiento, confianza, protocolo, enrutamiento y federación, con 66 pruebas y licencia MIT.

Servidor MCP GodotIQ otorga a los agentes de IA comprensión espacial de escenas de Godot
GodotIQ es un servidor MCP que proporciona a los agentes de codificación una comprensión real de las escenas 2D/3D, las señales y las dependencias de código en Godot. En una prueba, construyó de forma autónoma un juego de supervivientes de doble joystick en una hora a partir de activos y un prompt.

Orion: Evadiendo CoreML para ejecutar y entrenar LLMs directamente en el Motor Neuronal de Apple
Orion es un sistema de código abierto en Objective-C que evita el CoreML de Apple para ejecutar y entrenar LLMs directamente en el Motor Neuronal de Apple (ANE), logrando más de 170 tokens/s para la decodificación de GPT-2 124M y un entrenamiento estable de múltiples pasos en un transformador de 110 millones de parámetros.

Ingeniería Inversa del Motor Neuronal de Apple para Entrenar Modelos MicroGPT
Un desarrollador ha invertido la ingeniería de las API privadas del Motor Neuronal de Apple para crear un pipeline de entrenamiento para un modelo MicroGPT de 110M parámetros, logrando una eficiencia energética de 6.6 TFLOPs/vatio en hardware Mac M4.