Тестирование δ-Mem на Apple Silicon: реализация MLX и бенчмарки

Пользователь Reddit реализовал исследовательскую статью δ-mem (arXiv 2605.12357) для Apple Silicon с использованием mlx и интеграции OpenClaw. Статья улучшает направление внимания модели без контекста или LoRA, сообщая о 20% улучшении ответов в их тестах. Реализация использовала Qwen3-4B-Instruct через mlx и пользовательские адаптеры.
Результаты бенчмарков (нормализованные тесты mlx, Qwen3-4B-Instruct на MacMini 64GB):
- Синтетические в стиле статьи: Plain 0.5129, δ-mem 0.5129 (1.00x)
- LoCoMo-10 mini: Plain 0.0500, δ-mem 0.1833 (3.67x)
- Воспроизведение OpenClaw: Plain 0.5701, δ-mem 0.6667 (1.17x)
Затраты по задержке (по сравнению с plain):
- Синтетические: 1.013x
- LoCoMo-10 mini: 1.33x запрос / 1.50x всего
- Воспроизведение OpenClaw: 1.30x
Ключевые ссылки:
- Репозиторий GitHub с адаптером: delta-mem-mlx-sidecar-w-openclaw
- Адаптер MLX на Hugging Face: delta-mem-qwen3-4b-instruct-mlx-adapter
Выводы:
- Синтетические тесты были плоскими (1.00x), но LoCoMo-mini показал сильные относительные улучшения (3.67x).
- Воспроизведение в стиле OpenClaw показало практически значимое улучшение (6/8 → 7/8 тестов пройдено, 1.17x).
- Пользователь отмечает, что Apple Silicon не может эффективно запускать CUDA, поэтому результаты ниже, чем в бенчмарках статьи. Бенчмарки статьи (Qwen3-4B-Instruct) показали в среднем 1.10x против замороженной основы, MemoryAgentBench 1.31x, LoCoMo 1.20x.
- Пользователь ищет помощь (или финансирование ~$6k) для обучения адаптера для более крупных моделей, таких как Qwen3.6:27B.
Для кого это: Разработчики, запускающие локальных LLM-агентов на Apple Silicon, которые хотят экспериментировать с модуляцией весов δ-mem для улучшения производительности памяти/контекста.
📖 Читать полный источник: r/LocalLLaMA
👀 Смотрите также

Prism MCP v2.1 добавляет постоянную память к сессиям Claude.
Prism MCP v2.1.0 'Дворец разума' обеспечивает постоянную память сессий для Claude, устраняя необходимость повторного объяснения контекста проекта. Он включает локальное хранилище SQLite, визуальный браузер памяти, откат состояния и синхронизацию контекста между клиентами.

OpenLobster: Самостоятельно размещаемый ИИ-агент на Go с потреблением памяти в 30 МБ
OpenLobster — это самодостаточный ИИ-ассистент, написанный на Go, который работает как единый бинарный файл с потреблением 30 МБ оперативной памяти и временем холодного запуска 200 мс. Он поддерживает несколько провайдеров LLM, включая Ollama, OpenRouter и любые конечные точки, совместимые с OpenAI, а память хранится в графовой базе данных.

Сандра: MCP с открытым исходным кодом для постоянной памяти графов в Клод
Sandra — это бэкенд графовой + векторной памяти с нативным MCP-сервером, который дает Клоду постоянную структурированную память между сессиями, поддерживая точный, нечеткий и семантический поиск.

blend-ai: Новый сервис MCP для Blender в Claude Code
blend-ai — это новый сервис MCP для Blender, который позволяет Claude Code генерировать 3D-сцены. Пользователь сообщил, что он работает быстрее и лучше, чем blender-mcp, создав сцену запуска шаттла по референсным изображениям за 5 минут.