Apple Silicon上でδ-Memをテスト:MLX実装とベンチマーク

Redditユーザーがδ-mem研究論文(arXiv 2605.12357)をApple Silicon向けにmlxとOpenClaw統合を用いて実装しました。この論文は、コンテキストやLoRAなしでモデルの注意の方向性を改善し、テストで20%の回答精度向上を報告しています。実装にはQwen3-4B-Instructをmlxとカスタムアダプターで使用しました。
ベンチマーク結果(mlx正規化テスト、Qwen3-4B-Instruct on MacMini 64GB):
- 合成紙スタイル:Plain 0.5129、δ-mem 0.5129(1.00倍)
- LoCoMo-10 mini:Plain 0.0500、δ-mem 0.1833(3.67倍)
- OpenClawリプレイ:Plain 0.5701、δ-mem 0.6667(1.17倍)
レイテンシコスト(通常比):
- 合成:1.013倍
- LoCoMo-10 mini:クエリ1.33倍 / 合計1.50倍
- OpenClawリプレイ:1.30倍
主要リンク:
- アダプター付きGitHubリポジトリ:delta-mem-mlx-sidecar-w-openclaw
- Hugging Face上のMLXアダプター:delta-mem-qwen3-4b-instruct-mlx-adapter
所見:
- 合成プローブは横ばい(1.00倍)だったが、LoCoMo-miniでは大きな相対的改善(3.67倍)が見られた。
- OpenClawスタイルのリプレイでは実用的な改善(通過プローブ数6/8→7/8、1.17倍)が見られた。
- ユーザーはApple SiliconではCUDAを効率的に実行できないため、結果は論文ベンチマークより低いと指摘。論文ベンチマーク(Qwen3-4B-Instruct)では、凍結バックボーン比平均1.10倍、MemoryAgentBench 1.31倍、LoCoMo 1.20倍だった。
- ユーザーはQwen3.6:27Bのような大規模モデル用アダプターを訓練するための支援(または約$6kの資金)を求めている。
対象読者: Apple Silicon上でローカルLLMエージェントを実行し、δ-mem重み変調によるメモリ/コンテキスト性能向上を試したい開発者。
📖 全文を読む: r/LocalLLaMA
👀 See Also

新しいLinuxタスクバーウィジェットでClaude AIの使用状況を監視
新しいLinuxタスクバーウィジェットは、ユーザーがClaude AIのサブスクリプション使用状況をリアルタイムで追跡できるようにし、カラーコードによるフィードバックと簡単なインストールを提供します。

スキルズゲート:AIコーディングエージェントスキルのためのオープンソースマーケットプレイス
SkillsGateは、Claude Code、Cursor、WindsurfなどのAIコーディングエージェント向けに45,000以上のスキルをインデックス化するオープンソースのマーケットプレイスです。ベクトル埋め込みによるセマンティック検索と、npxを使用したワンコマンドインストールを提供します。

SwarmClawダッシュボードがOpenClawにオーケストレーション層を追加
SwarmClawは、OpenClawをラップするセルフホスト型ダッシュボードで、複数のインスタンスのデプロイと管理をゲートウェイ制御、設定修復、リモート履歴同期、ライブ実行承認機能と共に提供します。OpenClawプラグインとSKILL.mdファイルをサポートし、さらに14の他のAIプロバイダーにも接続します。

InsForge:Claudeコードエージェントのためのバックエンドセマンティックレイヤー
InsForgeは、Claude CodeエージェントがAPI統合を推測する代わりに、MCPを通じて検査・設定できる構造化コンポーネントとして、認証、PostgreSQLデータベース、S3互換ストレージ、エッジ/サーバーレス関数、モデルゲートウェイ、サイトデプロイの6つのバックエンドプリミティブを公開しています。