Apple Silicon上でδ-Memをテスト:MLX実装とベンチマーク

Redditユーザーがδ-mem研究論文(arXiv 2605.12357)をApple Silicon向けにmlxとOpenClaw統合を用いて実装しました。この論文は、コンテキストやLoRAなしでモデルの注意の方向性を改善し、テストで20%の回答精度向上を報告しています。実装にはQwen3-4B-Instructをmlxとカスタムアダプターで使用しました。
ベンチマーク結果(mlx正規化テスト、Qwen3-4B-Instruct on MacMini 64GB):
- 合成紙スタイル:Plain 0.5129、δ-mem 0.5129(1.00倍)
- LoCoMo-10 mini:Plain 0.0500、δ-mem 0.1833(3.67倍)
- OpenClawリプレイ:Plain 0.5701、δ-mem 0.6667(1.17倍)
レイテンシコスト(通常比):
- 合成:1.013倍
- LoCoMo-10 mini:クエリ1.33倍 / 合計1.50倍
- OpenClawリプレイ:1.30倍
主要リンク:
- アダプター付きGitHubリポジトリ:delta-mem-mlx-sidecar-w-openclaw
- Hugging Face上のMLXアダプター:delta-mem-qwen3-4b-instruct-mlx-adapter
所見:
- 合成プローブは横ばい(1.00倍)だったが、LoCoMo-miniでは大きな相対的改善(3.67倍)が見られた。
- OpenClawスタイルのリプレイでは実用的な改善(通過プローブ数6/8→7/8、1.17倍)が見られた。
- ユーザーはApple SiliconではCUDAを効率的に実行できないため、結果は論文ベンチマークより低いと指摘。論文ベンチマーク(Qwen3-4B-Instruct)では、凍結バックボーン比平均1.10倍、MemoryAgentBench 1.31倍、LoCoMo 1.20倍だった。
- ユーザーはQwen3.6:27Bのような大規模モデル用アダプターを訓練するための支援(または約$6kの資金)を求めている。
対象読者: Apple Silicon上でローカルLLMエージェントを実行し、δ-mem重み変調によるメモリ/コンテキスト性能向上を試したい開発者。
📖 全文を読む: r/LocalLLaMA
👀 See Also

ホラボスは、ポータブルなローカルエージェントのデプロイメント解決を目指しています。
Holabossは、AIワーカーをポータブルな成果物として扱うオープンソースプロジェクトです。ワーカーごとのワークスペース、ローカルスキル/アプリ、永続的なメモリ、デスクトップアプリとは別にパッケージ化可能なランタイムを備えています。Ollamaなどのローカルモデルスタックをサポートし、ターゲットマシンにはNode.js 22以上が必要です。

TradingAgents-GUI:多エージェント株式分析のためのローカルWebインターフェース、Ollama対応に
TradingAgentsのマルチエージェントLLM株式分析フレームワーク用のフォークされたGUI。Ollama、OpenAI、Anthropicなどでローカル実行可能。ライブパイプライン可視化、レポートリーダー、トークン節約の簡潔モードを搭載。

人工生命:計算生命研究の300行Python再現
『Computational Life』論文の再現をPythonで実装。240×135のグリッド上でBrainfuckに似たプログラムがランダムにペアリングされ、命令テープを連結することで相互作用し、自己複製コードが進化する様子をシミュレート。

Claude Codeにおけるプロアクティブなコンテキストローテーション検出:r/ClaudeAIからの機能提案
Redditの機能提案によると、Claude Codeがコンテキストの劣化を積極的に検出し、構造化されたタスクスコープの引き継ぎを提案し、引き継ぎファイルを生成して自動的に新しいセッションを開始するというものです。