マーリンリサーチが構造化推論のためのQwen3.5-4B-Safety-Thinkingモデルをリリース

マーリンリサーチは、Qwen3.5を基盤とした40億パラメータの安全性に配慮した推論モデル「Qwen3.5-4B-Safety-Thinking」をリリースしました。このモデルは、特にエージェントシステムに焦点を当て、実世界のシナリオにおける構造化された「思考」と安全性のアプリケーションのために特別に設計されています。
主な改善点と特徴
- プロンプト内の厳格な指示を正確に従う能力の向上
- AnthropicのBloomおよびPetri手法の使用に基づく
- ハッキング試行に対する耐性
- 「異常」なプロンプトや敵対的プロンプトに対する耐性の向上
- 最大100万トークンのコンテキストウィンドウ
- Anthropicのフレームワーク - BloomおよびPetriを使用
このモデルは、Hugging FaceのMerlinSafety/Qwen3.5-4B-Safety-Thinkingで利用可能です。
AIエージェントを扱う開発者にとって、このモデルは、構造化された推論とプロンプト操作への耐性が優先される安全性が重要なアプリケーションのための専門的なツールを表しています。AnthropicのBloomおよびPetri手法の統合は、アラインメントに対する憲法AIアプローチへの焦点を示唆しています。
📖 Read the full source: r/LocalLLaMA
👀 See Also

Claude Opus 4.7 エラー率が上昇中 — 状況更新
Claude Opus 4.7でエラーが多発しているという自動ステータス更新がありました。インシデントページとコミュニティのメガスレッドで進捗を確認してください。

Claude Opus 4.1は、SWE-Bench Proのプライベートデータセットにおいて17.75%のスコアを記録し、記憶力と推論力のギャップを浮き彫りにしました。
Claude Opus 4.1はSWE-Bench Verifiedで80%を獲得しましたが、SWE-Bench Proのプライベートデータセットでは17.75%に低下しました。Scale AIの分析によると、モデルは馴染みのあるリポジトリで推論するのではなく、記憶に基づいてナビゲートしていたことが判明しました。

LibreOffice Onlineの開発がコミュニティ投票後に再開
コミュニティ投票により2022年の凍結が無効化された後、The Document FoundationはLibreOffice Onlineの作業を再開しました。TDFは貢献を受け付けるためにリポジトリを再開しますが、サーバーをホストすることはなく、代わりに自己ホスト可能なツールを提供します。

研究によると、クロード・オーパスのエージェント失敗は、アライメント問題ではなく、アーキテクチャ上の問題だったことが示されています。
Claude OpusとKimi K2.5を、メール、シェルアクセス、永続的ストレージを備えた実環境でテストした研究。モデルは正しい価値観を示したものの、ステークホルダーモデルや実行境界といったアーキテクチャ上の安全策が欠如していたため、重大な失敗を経験した。