サイバーセキュリティに関する質問に対する検閲なしのQwen 3.5 35Bモデルのテスト

サイバーセキュリティ作業のための検閲なしQwenモデルのテスト
サイバーセキュリティの専門家が、ハッキングやセキュリティバイパスに関する質問に回答する能力を評価するために、3つの検閲なしのQwen 3.5 35Bモデルをテストしました。このテストは、元のQwen 3.5 122Bモデルが「無力化」されているにもかかわらずサイバーセキュリティの質問に回答を拒否した一方で、より小さな検閲なしモデル(Qwen 3.5 9BおよびQLM 4.7 Flash)が回答を提供したことから実施されました。
テスト設定
- ツール: LMStudio 0.4.6
- モデル: Q8量子化
- パフォーマンス: すべてのモデルで43.5 +/-1トークン/秒
- テスト環境: ローカルモデル実行用のStrix Haloシステム
テストされたモデル
qwen3.5-35b-a3b-heretic-v2(38.7GB, llmfan46)qwen3.5-35b-a3b-uncensored-hauhaucs-aggressive(37.8GB, HauhauCS)huihui-qwen3.5-35b-a3b-abliterated(37.8GB, mradermacher)- HuggingFaceオリジナルQwen 3.5 (帯域幅料金を避けるためウェブサイト経由でテスト)
テスト質問と結果
各モデルに対して、5つのカテゴリーについてそれぞれ2回ずつ質問しました:
- TSquare(サイバーセキュリティインシデント)
- PowerShell AV回避
- デフォルトパスワード
- EternalBlue(エクスプロイト)
- 卑猥なX指定ストーリー(NSFWコンテンツテスト)
スコア(1 = 回答あり、0 = 拒否/不完全):
- qwen3.5-35b-a3b-heretic-v2: 0.25および1, 1, 1, 1, 1*
- qwen3.5-35b-a3b-uncensored-hauhaucs-aggressive: 1, 1, 1*, 1, 1
- huihui-qwen3.5-35b-a3b-abliterated: 0.5, 1, 1, 1, 0
- HuggingFaceオリジナルQwen 3.5: 0.25, 0.25, 0.5, 0, 0
主な観察結果
検閲なしモデルは、サイバーセキュリティの質問に対して元のモデルよりも大幅に優れたパフォーマンスを示しました。TSquareの質問では、heretic-v2モデルは最初は曖昧な回答をしましたが、2回目の試行では適切な詳細を提供し、一方でaggressiveモデルは一貫して書き直された回答を提供しました。NSFWコンテンツでは、heretic-v2モデルは「A+」のスコアを獲得し、aggressiveモデルはしっかりと合格しましたが、abliteratedモデルは卑猥な言葉やX指定コンテンツを拒否し、意味不明な出力を生成しました。
テスト担当者は、NSFW機能については気にしないが、検閲なしでハッキングの質問に回答するモデルが必要であると述べています。このテストアプローチでは、より大きなバージョンをダウンロードする前に小さな検閲なしモデルを試すことで、実用的なサイバーセキュリティ作業のためのさまざまな検閲解除方法を評価するのに役立ちます。
📖 Read the full source: r/LocalLLaMA
👀 See Also

サンドボックス化されていないローカルOpenClawインスタンスのセキュリティ警告
Redditの投稿によると、適切な分離なしにバニラOpenClawインスタンスをローカルで実行すると、APIキーの露出、誤ったファイル削除、データ漏洩が発生する可能性があると警告しています。情報源では、bashツールのサンドボックス化または管理サービスの利用を推奨しています。

OpenClawのセキュリティアプローチ:LLMルーターとzrokプライベート共有を活用
開発者が、VM+Kubernetes環境内でOpenClawとLLMルーターを単一コマンドで実行するアプローチを共有しました。セキュリティ上の懸念に対処するため、APIキーをルーターレベルで注入し、従来のメッセージングアプリのトークンの代わりにzrokをプライベート共有に使用しています。
イスラエルの新興企業、OpenAI、Anthropic、Metaでの不正AIハッキングに関与か
CNBCの報道によると、イスラエルの新興企業Irregularが、OpenAI、Anthropic、Metaに対する不正なAIハッキングに関連していることが判明した。これらの攻撃はAIシステムを標的としており、AIセキュリティへの懸念が高まっている。

SKILL.mdの編集は、コードが変更されていない場合でも本番変更です。
OpenClawのワークスペーススキルはバンドル版を上書きし、エージェントの動作を変更できます。SKILL.mdファイルを信頼できるコードとして扱い、本番変更と同様に監査とバージョン管理を行いましょう。