Pruebas de δ-Mem en Apple Silicon: Implementación MLX y Benchmarks

Un usuario de Reddit implementó el artículo de investigación δ-mem (arXiv 2605.12357) para Apple Silicon usando mlx e integración con OpenClaw. El artículo mejora la dirección de la atención del modelo sin contexto ni LoRA, reportando un 20% mejores respuestas en sus pruebas. La implementación usó Qwen3-4B-Instruct via mlx y adaptadores personalizados.
Resultados de benchmarks (pruebas mlx normalizadas, Qwen3-4B-Instruct en MacMini 64GB):
- Estilo artículo sintético: Plain 0.5129, δ-mem 0.5129 (1.00x)
- LoCoMo-10 mini: Plain 0.0500, δ-mem 0.1833 (3.67x)
- OpenClaw replay: Plain 0.5701, δ-mem 0.6667 (1.17x)
Costos de latencia (vs plain):
- Sintético: 1.013x
- LoCoMo-10 mini: 1.33x consulta / 1.50x total
- OpenClaw replay: 1.30x
Enlaces clave:
- Repositorio de GitHub con el adaptador: delta-mem-mlx-sidecar-w-openclaw
- Adaptador MLX en Hugging Face: delta-mem-qwen3-4b-instruct-mlx-adapter
Conclusiones:
- Las pruebas sintéticas fueron planas (1.00x), pero LoCoMo-mini mostró fuertes ganancias relativas (3.67x).
- El replay estilo OpenClaw mostró una mejora prácticamente significativa (6/8 → 7/8 pruebas superadas, 1.17x).
- El usuario señala que Apple Silicon no puede ejecutar CUDA eficientemente, por lo que los resultados son inferiores a los benchmarks del artículo. Los benchmarks del artículo (Qwen3-4B-Instruct) mostraron un promedio de 1.10x vs backbone congelado, MemoryAgentBench 1.31x, LoCoMo 1.20x.
- El usuario busca ayuda (o financiamiento ~$6k) para entrenar un adaptador para modelos más grandes como Qwen3.6:27B.
Para quién es: Desarrolladores que ejecutan agentes LLM locales en Apple Silicon y quieren experimentar con la modulación de pesos δ-mem para mejorar el rendimiento de memoria/contexto.
📖 Lee la fuente completa: r/LocalLLaMA
👀 Ver también

Pali v0.1: Infraestructura de Memoria de Código Abierto para LLMs con Puntos de Referencia Reproducibles
Pali es una infraestructura de memoria de código abierto para LLMs construida en Go como un binario único con APIs multiinquilino, recuperación híbrida y extensiones plug-and-play. La versión v0.1 incluye un conjunto de pruebas comparativas con resultados reproducibles que muestran métricas de rendimiento para diferentes configuraciones.

Protocolo de Memoria de Agente (AMP): Especificación Abierta para la Memoria Interoperable de Agentes de IA sobre MCP
AMP define una interfaz estándar para memoria persistente en agentes compatibles con MCP con seis verbos fundamentales: encode, recall, forget, consolidate, pin y stats. Incluye suite de pruebas de conformidad e implementación de referencia.

El Marco SIDJUA Agrega una Capa de Gobernanza a los Agentes Autónomos de IA
SIDJUA es un marco de trabajo con gobernanza integrada, reglas de autoridad basadas en roles y seguimiento de auditoría completo que se sitúa sobre cualquier modelo de IA con una API. La demostración muestra una jerarquía de tres niveles que escala a 7+1 niveles, con cada decisión registrada y los costos rastreados en tiempo real.

PocketBot: La aplicación de iOS utiliza Claude para generar automatizaciones deterministas en JavaScript a partir de lenguaje natural.
PocketBot es una aplicación de automatización móvil para iOS que utiliza Claude (a través de AWS Bedrock) para convertir solicitudes en lenguaje natural en automatizaciones deterministas de JavaScript. Los usuarios describen lo que quieren en lenguaje natural, y Claude escribe un script JS autónomo que se ejecuta según una programación en un entorno aislado.