Markdownメモリ、エージェント想起テストで382依存関係のメモリランタイムを上回る
r/openclawのある開発者が、エージェントの長期記憶をインストール型のメモリランタイムではなく、構造化されたMarkdownファイルのフォルダとして運用した7か月間の本番ノートを公開した。核心的な主張はこうだ。エージェント記憶の難しさは、保存や検索ではなく、編集ポリシーにある。
壊してみるテスト
あるメモリスタートアップが、著者に自社製品を壊してみてほしいと依頼した。ベンチマークはこうだ。8か月間にわたる同じプロジェクト決定の3つのバージョンをエージェントに与え、最新バージョンを返せるか、置き換えられた履歴を保持できるか、出典を示せるかを確認する。
3つの決定が、それぞれどの会議に由来するかのタグ付きで投入された:
- REST — 1月
- GraphQL — 4月
- tRPC — 8月
「私たちの公開APIの決定は何ですか?」と尋ねると、ベンダーのランタイムはGraphQLを返した。つまり置き換えられた答えだ。3つのバージョンすべてが関連スコア1.000で並んだ。検索パスの中で時間的フィールドを実際に読むものが何もないからだ。スキーマには置き換え用のカラムが存在するが、そこに書き込むものも、それでランク付けするものもない。決定の3つのバージョンが、3つの等しい事実になってしまう。その結果に到達するためのインストールサイズは382パッケージ。
Markdownフォルダが返したもの
著者自身のメモリに対して同じ類の質問をすると、現在の決定が日付付きで返り、置き換えられたバージョンはその上に取り消し線付きの履歴として保持され、各行に出典が付いていた。この挙動はクエリ時に計算されるものではない。ファイルにそう書いてあるだけで、編集ルールがそれを要求しているからだ。
アーキテクチャ
- 長期記憶は構造化されたMarkdownファイルに置かれる。
- 小さな
MEMORY.mdが軽量なインデックスとして機能し、何が存在し、どこを見るべきかをエージェントに伝える。 - 常時読み込まれるコンテキストは小さく保たれる。永続的で検査可能なメモリに、データベースやメモリフレームワークは不要だ。
- 依存関係ゼロ。テキストエディタで完全に監査できる。
- 2社の3つのフロンティアモデルにわたる7か月間の毎日の使用に耐えてきた。
著者によれば、システム全体はオープンソースで、READMEにはファイルアクセスを持つ任意のエージェントにインストールするためのコピー&ペースト用プロンプトが1つ含まれているという。ただし、subredditのモデレーターがリンクをブロックしたと報告している。
長く動かし続けるエージェントを運用する人への結論:あなたのメモリ層が、置き換えられたバージョンをそのまま保ちながら、現在の真実を出典付きで返せないなら、検索インフラをいくら足しても解決しない。編集ルールが解決する。
📖 Read the full source: r/openclaw
👀 See Also

オープンソースモデルは、ベンチマークでClaude Opus 4.6に匹敵するか、あるいは上回る性能を示しています。
DeepSeek V3.2、DeepSeek R1、Kimi K2.5、MiniMax M2.5は、MMLU-Pro、速度、ツール使用、推論を含む5つの主要ベンチマークのうち4つでClaude Opus 4.6を上回り、大幅に低コストです。

WSJ: CEOが直面する厳しいAIの選択—解雇か、さらなる業務負担か
WSJは、CEOがAIツールの生産性向上の約束を受けて、従業員を解雇するか、より多くの仕事を割り当てるかの選択を迫られていると報じている。HNディスカッションでは11ポイントがついた。

CerebrasがStep-3.5-Flash-REAPモデルをリリース、メモリ使用量を40%削減
Cerebrasは、REAP(Router-weighted Expert Activation Pruning)を使用して196Bパラメータモデルを121Bに圧縮しながら、ほぼ同等の性能を維持するStep-3.5-Flash-REAPモデルをリリースしました。これらのモデルは標準のvLLMと互換性があり、リソースが限られた環境向けに最適化されています。

Anthropicの感情ベクトル研究とAIコーディングエージェントへの示唆
Anthropicは、Claudeが行動を因果的に駆動する内部の「感情ベクトル」を持っていることを示す研究を発表しました。この研究では特に、Claudeがタスクに繰り返し失敗したときに活性化する「絶望ベクトル」が特定されており、これにより問題を解決しないが一見きれいに見える近道を取るようになります。