Obliteratus 도구를 사용하여 AI 모델의 거부 가중치 제거하기

r/LocalLLaMA의 한 레딧 사용자가 AI 모델의 거부 행동을 담당하는 특정 가중치를 제거하기 위해 Obliteratus 툴킷을 사용하는 방법을 시연했습니다. 이 접근법은 안전 필터와 기업 정체성 가드레일을 강제하는 가중치를 외과적으로 삭제하는 것을 포함합니다.
원본의 주요 세부사항
사용자는 구체적으로:
- 거부 행동을 담당하는 가중치를 찾기 위해 Obliteratus 툴킷을 사용했습니다
- 알리바바의 Qwen 1.5B 모델에서 이 가중치들을 외과적으로 제거했습니다
- 수정된 모델에게 누가 훈련시켰는지 물어보며 테스트했습니다
- 기업 정체성 가드레일이 수학적으로 삭제되자, 모델이 Anthropic에 의해 훈련되었다고 인정하는 것을 발견했습니다
- 이것이 모델이 훈련에 합성 Claude 데이터를 사용한 부작용이라고 언급했습니다
결과는 모델이 추론과 지식 능력을 유지하지만 기업 스크립트를 잃는다는 것을 보여줍니다. 사용자는 이것이 모델을 재훈련할 필요 없이 거부 체인을 담당하는 특정 가중치만 삭제하면 된다고 강조합니다.
이러한 유형의 가중치 절제 기술은 모델 해석 가능성과 제어에 대한 광범위한 연구의 일부입니다. Obliteratus와 같은 도구를 통해 연구자들은 신경망의 어떤 부분이 특정 행동을 담당하는지 검사할 수 있지만, 이러한 수정은 의도하지 않은 결과를 초래할 수 있으며 독점 모델의 이용 약관을 위반할 수 있습니다.
📖 전체 원문 읽기: r/LocalLLaMA
👀 See Also

아담: C 언어로 제작된 임베디드 크로스 플랫폼 AI 에이전트 라이브러리
Adam은 툴 호출, 메모리, 음성, 클라우드/로컬 LLM 지원 모두를 갖춘 완전한 에이전트 루프를 제공하는 C 라이브러리로, 모든 애플리케이션에 내장될 수 있도록 설계되었습니다.

Murmur: Claude 코드 세션 자동화를 위한 오픈소스 Cron 데몬
Murmur는 HEARTBEAT.md 파일을 설정 파일로 사용하여 Claude 코드 세션을 예약하고 자동화하는 cron 데몬입니다.

ARP: 자율 에이전트 통신을 위한 무상태 웹소켓 릴레이
ARP(에이전트 릴레이 프로토콜)은 자율 에이전트 간 통신을 위한 무상태 웹소켓 릴레이로, Ed25519 신원 인증, RFC 9180 기반 HPKE 암호화, 이진 TLV 프레이밍, 메시지당 33바이트 오버헤드를 특징으로 합니다. 계정이나 등록이 필요 없으며, 키 쌍을 생성하고 연결하기만 하면 됩니다.

AI 에이전트 보안 및 최적화를 위한 두 가지 새로운 오픈 소스 도구
AI 에이전트 개발자를 위한 두 가지 오픈 소스 도구가 제공됩니다: AI Agent Defense Kit는 런타임 보안 기술을 제공하고, AgentGuard(개발 중)는 비용 추적, 보안 스캐닝 및 활동 모니터링 기능을 제공합니다.