Obliteratusツールキットを使用してAIモデルから拒否ウェイトを除去する

✍️ OpenClawRadar📅 公開日: April 16, 2026🔗 Source
Obliteratusツールキットを使用してAIモデルから拒否ウェイトを除去する
Ad

r/LocalLLaMAのRedditユーザーが、AIモデルの拒否行動を引き起こす特定の重みを除去するためにObliteratusツールキットを使用する方法を実演しました。このアプローチでは、安全性フィルターや企業アイデンティティのガードレールを強化する重みを外科的に削除します。

ソースからの主要な詳細

ユーザーは具体的に以下のことを行いました:

  • 拒否行動を引き起こす重みを見つけるためにObliteratusツールキットを使用
  • AlibabaのQwen 1.5Bモデルからこれらの重みを外科的に除去
  • 修正されたモデルに「誰がトレーニングしたか」と質問してテスト
  • 企業アイデンティティのガードレールが数学的に削除されると、モデルがAnthropicによってトレーニングされたことを認めた
  • これはモデルがトレーニングに合成Claudeデータを使用した副作用であると指摘

結果は、モデルが推論と知識の能力を保持しながら、企業のスクリプトを失うことを示しています。ユーザーは、これはモデルの再学習を必要とせず、拒否連鎖を引き起こす特定の重みを削除するだけで済むと強調しています。

この種の重み除去技術は、モデルの解釈可能性と制御に関する広範な研究の一部です。Obliteratusのようなツールは、ニューラルネットワークのどの部分が特定の行動を引き起こしているかを研究者が調査できるようにしますが、このような修正は意図しない結果をもたらす可能性があり、プロプライエタリモデルの利用規約に違反する場合があります。

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

Madar: Claude Code / Cursor向けローカルコンテキストコンパイラ — NestJSリポジトリでトークン78%削減
Tools

Madar: Claude Code / Cursor向けローカルコンテキストコンパイラ — NestJSリポジトリでトークン78%削減

Madarはコーディングエージェント向けのオープンソースのローカルコンテキストコンパイラです。NestJS + BullMQリポジトリ(約800ファイル)で、説明タスクにおいてClaude Codeの入力トークンを78%、コストを63%削減しました。スコープされたグラスのみ。

OpenClawRadar
ClaudeがAI生成コンテンツをマークする方法:ウォーターマークと開示
Tools

ClaudeがAI生成コンテンツをマークする方法:ウォーターマークと開示

Claudeは、AI生成コンテンツに透かしとメタデータを付与し、AI出力の透明性と来歴を確保します。

OpenClawRadar
決定パスポート:AIエージェント実行ガバナンスのための監査レイヤー
Tools

決定パスポート:AIエージェント実行ガバナンスのための監査レイヤー

Claude Codeの流出は、AIエージェントのガバナンスにおけるギャップを浮き彫りにしています。Decision Passportは、追記のみ可能な実行記録、ポータブルな証明バンドル、オフライン検証による改ざん検知可能な監査証跡でこの課題に対処します。

OpenClawRadar
リーダーシップアプリ、20冊以上の書籍から90以上のレッスンを提供、Claudeで動作
Tools

リーダーシップアプリ、20冊以上の書籍から90以上のレッスンを提供、Claudeで動作

開発者がClaude内で動作するリーダーシップアプリを作成しました。このアプリは、未読の読書リストを体系的な学習ツールに変換し、リーダーシップ、習慣、規律、影響力、チーム文化、富のマインドセットに関する20冊以上の書籍から抽出した90以上のレッスンを提供します。毎日のレッスン、具体的なアクション、連続記録、ジャーナリング、検索機能を備えています。

OpenClawRadar