Usando el kit de herramientas Obliteratus para eliminar los pesos de rechazo de los modelos de IA.

Un usuario de Reddit en r/LocalLLaMA demostró el uso del kit de herramientas Obliteratus para eliminar pesos específicos responsables del comportamiento de rechazo en modelos de IA. El enfoque implica eliminar quirúrgicamente los pesos que aplican filtros de seguridad y barreras de identidad corporativa.
Detalles clave de la fuente
El usuario específicamente:
- Utilizó el kit de herramientas Obliteratus para encontrar pesos responsables del comportamiento de rechazo
- Eliminó quirúrgicamente estos pesos del modelo Qwen 1.5B de Alibaba
- Probó preguntando al modelo modificado quién lo entrenó
- Encontró que, con las barreras de identidad corporativa eliminadas matemáticamente, el modelo admitió que fue entrenado por Anthropic
- Señaló que esto fue un efecto secundario del uso de datos sintéticos de Claude para el entrenamiento del modelo
El resultado muestra que el modelo conserva sus capacidades de razonamiento y conocimiento, pero pierde el guion corporativo. El usuario enfatiza que esto no requiere reentrenar el modelo, solo eliminar pesos específicos responsables de las cadenas de rechazo.
Este tipo de técnica de ablación de pesos es parte de una investigación más amplia sobre interpretabilidad y control de modelos. Herramientas como Obliteratus permiten a los investigadores examinar qué partes de las redes neuronales son responsables de comportamientos específicos, aunque tales modificaciones pueden tener consecuencias no deseadas y pueden violar los términos de servicio de modelos propietarios.
📖 Leer la fuente completa: r/LocalLLaMA
👀 Ver también

Libretto: Generación Determinista de Automatización de Navegadores para Agentes de Codificación con IA
Libretto es un kit de herramientas Skill+CLI que permite a los agentes de codificación con IA generar scripts deterministas de automatización de navegadores como código real, alejándose de los agentes de IA en tiempo de ejecución. Combina la automatización de interfaz de usuario de Playwright con solicitudes directas de red/API para mayor confiabilidad e incluye modos de depuración paso a paso y de solo lectura.

cc-session-utils: Panel de Control TUI para Gestionar Sesiones y Costos de Claude Code
Un desarrollador creó cc-session-utils, una herramienta de interfaz de usuario en terminal para gestionar archivos de sesión de Claude Code, rastrear costos por modelo, limpiar sesiones huérfanas y migrar datos entre proyectos. Requiere Python 3.11+ y está construida con Textual.

mindpm: Un Servidor MCP Gratuito para Memoria de Proyecto Persistente con Claude
mindpm es un servidor MCP gratuito y de código abierto que proporciona a Claude una base de datos SQLite local para realizar un seguimiento de tareas, decisiones, notas y resúmenes de sesión entre conversaciones. La configuración toma 30 segundos con el comando: claude mcp add mindpm -e MINDPM_DB_PATH=~/.mindpm/memory.db -- npx -y mindpm.

Meta para Claude Code: tareas persistentes con revisión adversarial
Un comando /goal para Claude Code que lo mantiene trabajando en una tarea larga a lo largo de muchos turnos, con una sesión opcional separada de Claude que revisa el resultado final para evitar una finalización falsa.