Verwendung des Obliteratus-Toolkits, um Ablehnungsgewichte aus KI-Modellen zu entfernen

Ein Reddit-Nutzer auf r/LocalLLaMA demonstrierte die Verwendung des Obliteratus-Toolkits, um spezifische Gewichte zu entfernen, die für Ablehnungsverhalten in KI-Modellen verantwortlich sind. Der Ansatz beinhaltet die gezielte Löschung von Gewichten, die Sicherheitsfilter und unternehmensbezogene Identitätsbegrenzungen durchsetzen.
Wichtige Details aus der Quelle
Der Nutzer hat speziell:
- Das Obliteratus-Toolkit verwendet, um Gewichte zu finden, die für Ablehnungsverhalten verantwortlich sind
- Diese Gewichte chirurgisch aus Alibabas Qwen 1.5B-Modell entfernt
- Getestet, indem das modifizierte Modell gefragt wurde, wer es trainiert hat
- Festgestellt, dass das Modell mit mathematisch gelöschten unternehmensbezogenen Identitätsbegrenzungen zugab, von Anthropic trainiert worden zu sein
- Angemerkt, dass dies ein Nebeneffekt der Verwendung synthetischer Claude-Daten für das Training war
Das Ergebnis zeigt, dass das Modell seine Denk- und Wissensfähigkeiten behält, aber die unternehmensbezogenen Skripte verliert. Der Nutzer betont, dass dies kein Neustraining des Modells erfordert – nur das Löschen spezifischer Gewichte, die für Ablehnungsketten verantwortlich sind.
Diese Art der Gewichtsablationstechnik ist Teil breiterer Forschungen zur Interpretierbarkeit und Kontrolle von Modellen. Werkzeuge wie Obliteratus ermöglichen es Forschern, zu untersuchen, welche Teile neuronaler Netzwerke für bestimmte Verhaltensweisen verantwortlich sind, obwohl solche Modifikationen unbeabsichtigte Folgen haben und Nutzungsbedingungen proprietärer Modelle verletzen können.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

Claude fügt interaktive Diagramm- und Grafik-Erstellungsfunktion hinzu
Claude kann jetzt interaktive Visualisierungen wie Diagramme, Grafiken und erkundbare Aufschlüsselungen direkt in Gesprächen generieren. Diese Funktion ist in der Beta-Version für alle Tarife verfügbar, einschließlich der kostenlosen Stufe.

Roost: Eine einzelne Go-Binär-Seitenleiste für Claude Code mit klickbarer Eingabehistorie, Dateibaum und Benachrichtigungen
Roost ist ein einzelnes Go-Binary, das Claude Code um eine webbasierte Seitenleiste erweitert: xterm.js-Terminal mit tmux im Hintergrund, Dateibaum, der Ihrem cd folgt, anklickbarer Verlauf aus ~/.claude/projects/*.jsonl und Push-Benachrichtigungen über den Stop-Hook von Claude Code. Läuft über SSH als Single-User-pro-Instanz; kein Build-Schritt im Frontend.

Agent Browser Shield: Kostenlose OpenClaw-Erweiterung blockiert Prompt-Injection & Dark Patterns
PixieBrix veröffentlicht Agent Browser Shield, eine kostenlose, quelloffene Browsererweiterung für OpenClaw, die Prompt-Injection, Dark Patterns und Kontextverschmutzung blockiert und gleichzeitig den Tokenverbrauch senkt.

Bitcoin MCP Server mit 43 Tools für KI-Codierungsagenten
bitcoin-mcp ist ein MCP-Server mit 43 Bitcoin-Tools, darunter Gebührenberater, Mempool-Analyse und Inskriptionserkennung. Er funktioniert mit Claude Desktop, Claude Code, Cursor, VS Code und Windsurf und verwendet Live-Daten von APIs oder lokalen Nodes.