RTX 5090でのAutoResearchの最適化:失敗した点と成功した点

✍️ OpenClawRadar📅 公開日: March 20, 2026🔗 Source
RTX 5090でのAutoResearchの最適化:失敗した点と成功した点
Ad

初期の問題と動作するパス

RTX 5090/BlackwellシステムでAutoResearchを実行するための初期セットアップは「深刻に破損して」おり、極めて低いパフォーマンスしか発揮しませんでした。コードは技術的には動作しているにもかかわらず、1秒あたりわずか数千トークンで、実質的に役に立たないMFU(Model FLOPs Utilization)でした。

動作する設定パスには以下が含まれました:

  • このセットアップで破損している完全モデルコンパイルパスを避ける
  • 実際に役立つ融合オプティマイザコンパイルの改善を維持する
  • 安定したSDPA/CuDNNアテンションパスを使用する
  • 総バッチサイズと時間予算を推測ではなく経験的に調整する
  • ベンチマーク/抽出/戦略立案/再実行ループを自動化する

失敗したこと

いくつかの失敗モードは誤解を招くものでした:

  • 技術的には正しいが壊滅的に遅いパス
  • 5090のコンテキストで分母が修正されるまで誤解を招くMFUの解釈
  • 改善するように見えたが実際には状況を大幅に悪化させた高いデバイスごとのバッチ設定
  • ロッククリーンアップ/完了フック/ディスパッチ順序に関する自動化バグ

開発者が指摘したように:「実行中に見えるが愚かなことをしている状態を得る方法はいくつかあった。」

役立ったこと

実際の改善は以下からもたらされました:

  • 融合オプティマイザコンパイルパスを再度有効化する
  • 元の大きな設定から総バッチサイズを削減する
  • 2**17がより良い総バッチ領域であることを検証する
  • 安定したバッチ体制が見つかったら時間予算を増やす
  • 自動化をベンチマークシステムの一部として扱い、後付けではないと考える
Ad

パフォーマンスの進展

有用な実行の進展は明確な改善を示しました:

  • ベースラインの健全な実行:val_bpb: 1.165452, mfu: 40.49%
  • 融合オプティマイザコンパイルの改善:val_bpb: 1.155400, mfu: 42.88%
  • TOTAL_BATCH_SIZE = 2**18:val_bpb: 1.108381, mfu: 43.18%
  • TOTAL_BATCH_SIZE = 2**17の検証:val_bpb: 1.089424, mfu: 43.03%
  • 現在の最良の自動ループ結果:TOTAL_BATCH_SIZE = 2**17, TIME_BUDGET = 1200, LR multiplier = 1.0, val_bpb: 0.999445, mfu: 42.56%, total_tokens_M: 387.8, num_steps: 2959

現在の最良設定

これまでに見つかった最良の結果:

  • TOTAL_BATCH_SIZE = 2**17
  • TIME_BUDGET = 1200
  • LR multiplier = 1.0

この組み合わせは、より大きなバッチのバリエーション、より小さい2**16バリエーション、低いLRのテスト、短いトレーニング予算を上回りました。

重要なポイント

主な教訓は、勝利した設定が「すべてを最大化する」セットアップではなかったことです。より良いパスには、安定したバッチ体制、より長いトレーニング期間、自動化とバックエンドのミスの注意深い排除が含まれていました。

開発者は強調しました:もしBlackwell/5090トレーニングに取り組んでいて奇妙な動作を目にしているなら、「それはあなたの想像ではないかもしれません。一部のパスは最初に見えるよりもはるかに悪いのです。」この演習の有用な部分は、安定した、自動化可能な、再現可能な、実際の追跡実験を構築するのに十分なパスを見つけることでした。

📖 完全なソースを読む: r/LocalLLaMA

Ad

👀 See Also

OpenClawメモリプラグインのテスト結果と推奨スタック
Guides

OpenClawメモリプラグインのテスト結果と推奨スタック

RedditユーザーがすべてのOpenClawメモリプラグインをテストした結果、デフォルトのマークダウン設定がトークンの肥大化と指示の圧縮を引き起こすことが判明しました。推奨される設定は、人間が読みやすいノート用にObsidian、トークンフリー検索用にQMD、構造化データ用にSQLiteを組み合わせたものです。

OpenClawRadar
本番環境向けAIエージェントの信頼性のための制約設計
Guides

本番環境向けAIエージェントの信頼性のための制約設計

Redditの投稿では、Claudeを複雑なコードベース操作に使用するための制約ベースのアプローチが詳述されており、明示的な失敗モードの列挙、チェックポイントを設けた段階的実行、ショートカット防止ルールを強調し、140ファイルを削除する際にビルドの失敗をゼロにすることを達成しています。

OpenClawRadar
OpenCLAWメモリの実際の仕組み:エージェントの「忘却」問題を解決する
Guides

OpenCLAWメモリの実際の仕組み:エージェントの「忘却」問題を解決する

OpenCLAWエージェントは会話間で永続的なメモリを持ちません。毎回、SOUL.md、USER.md、MEMORY.mdなどのファイルからコンテキストを再構築します。一般的な「忘れる」問題は、古いセッション、構造化されていないメモリファイル、重要な情報をチャット履歴ではなく永続的なファイルに保存していないことから生じます。

OpenClawRadar
Claudeコードプロジェクトの構造化:CLAUDE.md、スキル、MCPを活用して
Guides

Claudeコードプロジェクトの構造化:CLAUDE.md、スキル、MCPを活用して

開発者がClaude Codeのワークフロー改善策を共有。計画モードでの開始、プロジェクトの記憶としてのCLAUDE.mdファイルの維持、繰り返しタスクのための再利用可能なスキルの作成、外部ツール接続のためのMCPの使用などが含まれます。

OpenClawRadar