Utilisation de la boîte à outils Obliteratus pour supprimer les poids de refus des modèles d'IA

✍️ OpenClawRadar📅 Publié: April 16, 2026🔗 Source
Utilisation de la boîte à outils Obliteratus pour supprimer les poids de refus des modèles d'IA
Ad

Un utilisateur de Reddit sur r/LocalLLaMA a démontré l'utilisation de la boîte à outils Obliteratus pour supprimer des poids spécifiques responsables du comportement de refus dans les modèles d'IA. L'approche implique la suppression chirurgicale des poids qui appliquent les filtres de sécurité et les garde-fous de l'identité corporative.

Ad

Détails clés de la source

L'utilisateur a spécifiquement :

  • Utilisé la boîte à outils Obliteratus pour trouver les poids responsables du comportement de refus
  • Supprimé chirurgicalement ces poids du modèle Qwen 1.5B d'Alibaba
  • Testé en demandant au modèle modifié qui l'avait entraîné
  • Découvert qu'avec les garde-fous de l'identité corporative mathématiquement supprimés, le modèle a admis avoir été entraîné par Anthropic
  • Noté que c'était un effet secondaire de l'utilisation par le modèle de données synthétiques de Claude pour l'entraînement

Le résultat montre que le modèle conserve ses capacités de raisonnement et de connaissances mais perd le script corporatif. L'utilisateur souligne que cela ne nécessite pas de réentraîner le modèle, seulement de supprimer des poids spécifiques responsables des chaînes de refus.

Ce type de technique d'ablation de poids fait partie de recherches plus larges sur l'interprétabilité et le contrôle des modèles. Des outils comme Obliteratus permettent aux chercheurs d'examiner quelles parties des réseaux neuronaux sont responsables de comportements spécifiques, bien que de telles modifications puissent avoir des conséquences imprévues et violer les conditions d'utilisation des modèles propriétaires.

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

Le Référentiel de Créativité Humaine : Distinguer Convergence et Divergence dans l'Évaluation de la Créativité de l'IA
Tools

Le Référentiel de Créativité Humaine : Distinguer Convergence et Divergence dans l'Évaluation de la Créativité de l'IA

Contra Labs présente le Human Creativity Benchmark (HCB), un cadre qui distingue les critères objectivement vérifiables (ex. respect de la consigne) des goûts subjectifs (ex. attrait visuel) dans l'évaluation de l'IA générative pour le travail créatif. Le benchmark révèle qu'aucun modèle actuel n'est à la fois fiable et orientable, abordant l'effondrement modal et le besoin de résultats différenciés.

OpenClawRadar
Code Altimate : Harnais de Génie de Données Agentiel Open-Source
Tools

Code Altimate : Harnais de Génie de Données Agentiel Open-Source

Altimate Code est un harnais open-source qui fournit des outils déterministes d'ingénierie des données pour les agents d'IA, abordant des problèmes comme le SQL halluciné et le manque de contexte de schéma. Il inclut la traçabilité au niveau des colonnes, la détection d'anti-modèles SQL et l'intégration dbt, avec des benchmarks montrant 74,4 % de performance sur ADE-bench.

OpenClawRadar
Serveur MCP Open Source Connecte Claude à l'API Mailchimp
Tools

Serveur MCP Open Source Connecte Claude à l'API Mailchimp

Un développeur a créé un serveur MCP Mailchimp en utilisant Claude Code, fournissant 53 outils pour les campagnes, audiences, rapports, automations et e-commerce avec des modes de sécurité intégrés et une configuration en lecture seule.

OpenClawRadar
Claude Cowork contre OpenClaw : Où le récit du remplacement tient et où il se brise
Tools

Claude Cowork contre OpenClaw : Où le récit du remplacement tient et où il se brise

Claude Cowork propose des sessions de bureau persistantes avec une faible friction, tandis qu'OpenClaw conserve ses avantages en matière d'automatisation au niveau système, d'écosystèmes de compétences et de contrôle des flux de travail.

OpenClawRadar