カーパシーの自律研究プロジェクト:AIエージェントが夜通しLLM学習実験を実行

カーパシーの自動研究プロジェクトの概要
アンドレイ・カーパシーは、「AI研究者イン・ザ・ループ」の概念を示す「autoresearch」という小さなリポジトリを公開しました。このシステムは、AIエージェントを使用して、一晩中単一のGPUでLLM学習実験を自律的に実行します。
仕組み
エージェントは次のワークフローに従います:
train.pyファイルを継続的に編集する- 5分間のナノチャット学習実験を実行する
- 検証ビット・パー・バイト(
val_bpb)メトリックが改善したかどうかを確認する - このサイクルを睡眠中に繰り返す
セットアップと構成
このプロジェクトは非常に最小限のセットアップです:
- ハードウェア: 1つのGPU
- ファイル: 1つのメインファイル
- メトリック: 1つの主要メトリック(
val_bpb)
人間はprogram.mdに研究組織のプロンプトを書き、エージェントがコードの反復を処理します。
実験のスループット
実験ごとに固定の5分の予算で、システムは1時間あたり約12回の実験を実行できます。
このアプローチは、AIエージェントがパラメータ空間と学習構成を自律的に探索できる自動化された研究の実用的な実装を示しており、言語モデルを扱う開発者の実験サイクルを加速させる可能性があります。
📖 完全なソースを読む: r/LocalLLaMA
👀 See Also

MCPサーバーにより、AIエージェントが一時的な仮想カードで実際の購入を行えるようになります。
開発者が、AIエージェントがジャストインタイムで発行される一時的なバーチャルVisaカードを使用して実際の購入を完了できるMCPサーバーを構築しました。このシステムはMFAによるユーザー承認を必要とし、特定の加盟店にロックされ、15分のTTL(有効期限)を持つカードを発行します。

Claude Codeスキルは、DeepMindのAletheiaとAnthropicのハーネスアプローチを組み合わせたものです。
Claude Codeスキルは、Planner→Generator→Evaluator→Reviserパイプラインを実装し、DeepMindのAletheia数学研究エージェントとAnthropicのマルチエージェントコーディングアーキテクチャを統合したものです。これに、評価者が候補コードを見る前に正しいアプローチを推論する「ブラインド事前分析」を追加しています。

ClawControl iOSクライアントが、OpenClawセルフホストサーバー向けにリリースされました。
ClawControl v1.50がiOSで利用可能になりました。これは、セルフホスト型のOpenClaw/Clawサーバー向けのプライバシー重視のモバイルクライアントです。このオープンソースアプリは、モバイルデバイスからリアルタイムチャット(ストリーミング応答)、エージェント管理、セッション制御を可能にします。

オープンソースのローカルフックが自動的にClaudeモデルを切り替え、AIコストを削減します
開発者が、CursorとClaude Code用のローカルフックを作成し、プロンプトを分析してリクエスト送信前に適切なClaudeモデル(Haiku、Sonnet、Opus)を自動選択します。このツールはキーワードルールを使用してタスクを分類し、過剰な支払いシナリオをブロックし、遡及分析では50〜70%のコスト削減を示しています。