Testen von δ-Mem auf Apple Silicon: MLX-Implementierung und Benchmarks

Ein Reddit-Nutzer hat das δ-mem-Forschungspapier (arXiv 2605.12357) für Apple Silicon mit mlx und OpenClaw-Integration implementiert. Das Papier verbessert die Aufmerksamkeitsrichtung des Modells ohne Kontext oder LoRA und berichtet von 20% besseren Antworten in ihren Tests. Die Implementierung verwendete Qwen3-4B-Instruct über mlx und benutzerdefinierte Adapter.
Benchmark-Ergebnisse (normalisierte mlx-Tests, Qwen3-4B-Instruct auf MacMini 64GB):
- Synthetisch (Paper-Stil): Ohne 0,5129, δ-mem 0,5129 (1,00x)
- LoCoMo-10 mini: Ohne 0,0500, δ-mem 0,1833 (3,67x)
- OpenClaw-Replay: Ohne 0,5701, δ-mem 0,6667 (1,17x)
Latenzkosten (vs. ohne):
- Synthetisch: 1,013x
- LoCoMo-10 mini: 1,33x Abfrage / 1,50x gesamt
- OpenClaw-Replay: 1,30x
Wichtige Links:
- GitHub-Repo mit Adapter: delta-mem-mlx-sidecar-w-openclaw
- MLX-Adapter auf Hugging Face: delta-mem-qwen3-4b-instruct-mlx-adapter
Erkenntnisse:
- Synthetische Sonden waren flach (1,00x), aber LoCoMo-mini zeigte starke relative Verbesserungen (3,67x).
- OpenClaw-ähnliches Replay zeigte eine praktisch bedeutsame Verbesserung (6/8 → 7/8 Sonden bestanden, 1,17x).
- Der Nutzer merkt an, dass Apple Silicon CUDA nicht effizient ausführen kann, daher sind die Ergebnisse niedriger als die Paper-Benchmarks. Die Paper-Benchmarks (Qwen3-4B-Instruct) zeigten durchschnittlich 1,10x vs. eingefrorenem Backbone, MemoryAgentBench 1,31x, LoCoMo 1,20x.
- Der Nutzer sucht Hilfe (oder Finanzierung ~6.000 $), um einen Adapter für größere Modelle wie Qwen3.6:27B zu trainieren.
Für wen es ist: Entwickler, die lokale LLM-Agenten auf Apple Silicon ausführen und mit δ-mem-Gewichtsmodulation experimentieren möchten, um die Gedächtnis-/Kontextleistung zu verbessern.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

OpenClaw Optimizer v1.18.0 veröffentlicht, abgestimmt auf OpenClaw v2026.3.7
Die OpenClaw Optimizer Skill Version 1.18.0 ist nun mit OpenClaw v2026.3.7 abgestimmt und fügt Unterstützung für neue KI-Anbieter wie Google Gemini 3.1 Flash-Lite und OpenAI gpt-5.4 hinzu, sowie neue CLI-Befehle wie /session idle und /usage cost.

Lemonade von AMD: Open-Source-Lokaler-LLM-Server für GPU und NPU
Lemonade ist ein Open-Source-Local-AI-Server, der Text-, Bild- und Sprachmodelle auf GPUs und NPUs ausführt. Er ist mit der OpenAI-API kompatibel, unterstützt mehrere Modelle gleichzeitig und verfügt über ein 2 MB großes natives C++-Backend.

ClamBot: KI-Agent führt LLM-generierten Code in WASM-Sandbox für Sicherheit aus
ClamBot ist ein KI-Agenten-Framework, das allen von LLM generierten Code in einer WebAssembly-Sandbox mit QuickJS in Wasmtime ausführt, wodurch exec()- oder Subprozess-Aufrufe überflüssig werden. Es umfasst eine Genehmigungsschleuse für Tool-Aufrufe, persistentes Script-Caching als 'Clams' und unterstützt mehrere LLM-Anbieter.

re_gent: Git für KI-Codierungsagenten – Versionskontrolle für Agentenaktivitäten
re_gent ist ein Open-Source-Tool, das Versionskontrolle für KI-Agenten-Sitzungen bietet, jeden Tool-Aufruf verfolgt, Eingabeaufforderungen und Datei-Diffs speichert und Befehle wie `rgt log`, `rgt blame` und `rgt rewind` (demnächst verfügbar) ermöglicht.