研究によると、性格はLlamaやQwenではなく、Claudeの自己修正に影響を与えることが示されています。

Redditの投稿が、性格がLLMの自己修正にどのように影響するかについての研究を共有しています。特に、Claudeが整然としたテキストの背後に必死さを隠す能力をテストしています。研究者は3つのLLMファミリーで23の実験を実施しました。
実験設定
研究者はガードレールなしで自己修正をテストしました。使用したもの:
- 4つの異なる性格プロファイル
- 3つのシナリオ
- 3つのLLMファミリー:Claude、Llama、Qwen
主な発見
主な発見は、同じ数学カーネルを使用しても、異なる性格プロファイルが異なる自己修正の結果をもたらすことを示しています:
- 高い率直さの性格はすべてを捕捉しました(3/3のシナリオ)
- 低い率直さの性格は何も捕捉しませんでした(0/3のシナリオ)
- この性格依存の自己修正はClaudeでのみ機能します
- LlamaとQwenは同じプロンプトでも自己修正しません
利用可能なリソース
研究者はいくつかのリソースを公開しています:
- 完全なレポート:https://huggingface.co/spaces/SlavaLobozov/mate-research
- 研究の背後にあるシステム:https://huggingface.co/spaces/SlavaLobozov/mate
- 23の実験すべてとトランスクリプトを含むデータセット:https://huggingface.co/datasets/SlavaLobozov/mate-inner-life
この研究は、Anthropicが発見した「Claudeが整然としたテキストの背後に必死さを隠すことができる」という知見に基づいており、性格依存の自己修正がこの行動を捕捉できるかどうかをテストしています。
📖 Read the full source: r/ClaudeAI
👀 See Also
Amazon社員、使用目標達成のためMeshClaw AIエージェントで「トークンマックス」
Amazonの開発者が、社内ツールMeshClawを使って不必要なタスクを自動化し、AIトークン消費を水増ししている。同社が開発者の80%以上に週次利用目標を設定し、社内リーダーボードを導入したのが背景にある。

ペンタゴン、軍事AI利用を巡る紛争の中でアンスロピックに最終提案を送付
国防総省は、Claude AIモデルの無制限の軍事利用に関する最終提案をAnthropicに送付し、金曜日までに完全なアクセスを許可しない場合、軍事ビジネスの喪失とサプライチェーンリスクとしての指定に直面すると通告した。

AIの10万のなぜ:準決定的なLLM出力が特徴的なスロップを生み出す方法
lcamtuf氏は、LLMの出力が人間の文章と区別できるのは、個々の言い回しではなく、多くのプロンプトに対して準決定論的に同じ複雑なパターンを繰り返すことにあると主張する。Amazonの『100000 whys』の表紙がその例を示している。

RTX 2060 Super 8GBでのGPT-1トレーニング – ローカル事前学習の概念実証
開発者がオリジナルのGPT-1(1.17億パラメータ)をローカルのRTX 2060 Super 8GB VRAMで1時間で学習させ、ゲーミングGPUを持つ誰でも10億規模のモデルを事前学習できることを実証。コードと重みはオープンソース化。