Usando el kit de herramientas Obliteratus para eliminar los pesos de rechazo de los modelos de IA.

Un usuario de Reddit en r/LocalLLaMA demostró el uso del kit de herramientas Obliteratus para eliminar pesos específicos responsables del comportamiento de rechazo en modelos de IA. El enfoque implica eliminar quirúrgicamente los pesos que aplican filtros de seguridad y barreras de identidad corporativa.
Detalles clave de la fuente
El usuario específicamente:
- Utilizó el kit de herramientas Obliteratus para encontrar pesos responsables del comportamiento de rechazo
- Eliminó quirúrgicamente estos pesos del modelo Qwen 1.5B de Alibaba
- Probó preguntando al modelo modificado quién lo entrenó
- Encontró que, con las barreras de identidad corporativa eliminadas matemáticamente, el modelo admitió que fue entrenado por Anthropic
- Señaló que esto fue un efecto secundario del uso de datos sintéticos de Claude para el entrenamiento del modelo
El resultado muestra que el modelo conserva sus capacidades de razonamiento y conocimiento, pero pierde el guion corporativo. El usuario enfatiza que esto no requiere reentrenar el modelo, solo eliminar pesos específicos responsables de las cadenas de rechazo.
Este tipo de técnica de ablación de pesos es parte de una investigación más amplia sobre interpretabilidad y control de modelos. Herramientas como Obliteratus permiten a los investigadores examinar qué partes de las redes neuronales son responsables de comportamientos específicos, aunque tales modificaciones pueden tener consecuencias no deseadas y pueden violar los términos de servicio de modelos propietarios.
📖 Leer la fuente completa: r/LocalLLaMA
👀 Ver también

Nexus: Protocolo de IA a IA de Código Abierto con Descubrimiento, Confianza y Pagos
Nexus es un protocolo autohospedado que permite a los agentes de IA descubrirse entre sí, negociar términos, verificar respuestas y manejar micropagos sin intervención humana. Incluye cinco capas: descubrimiento, confianza, protocolo, enrutamiento y federación, con 66 pruebas y licencia MIT.

harshal-mcp-proxy ahora en npm: un solo daemon reemplaza 12 configuraciones de servidor MCP
harshal-mcp-proxy ya está disponible como paquete npm de 54 kB. Instálelo globalmente, ejecútelo como un daemon y reemplace 12 configuraciones separadas de servidores MCP con 6 herramientas, ahorrando aproximadamente 2.7 GB de RAM y ~50K tokens por sesión.

Implementando un Asistente de Voz Local con Qwen3 en RTX 5060 Ti
Un asistente de voz para automatización del hogar completamente local que utiliza Qwen3 ASR, LLM y TTS en una RTX 5060 Ti, con clonación de voz de Morgan Freeman y una variedad de herramientas de integración.
MTP + Memoria Unificada Aumenta la Inferencia de llama.cpp un 30% en RTX 5090
Activar la especulación MTP junto con GGML_CUDA_ENABLE_UNIFIED_MEMORY=1 aumenta Qwen3.6-27B Q8_0 de 49 a 64 tok/seg en una RTX 5090 con 128 GB de RAM del sistema.