머린 리서치가 구조적 추론을 위한 Qwen3.5-4B-Safety-Thinking 모델을 출시합니다.

Merlin Research가 Qwen3.5 기반으로 구축된 40억 파라미터의 안전 정렬 추론 모델인 Qwen3.5-4B-Safety-Thinking을 공개했습니다. 이 모델은 특히 에이전트 시스템에 초점을 맞춰 실제 시나리오에서 구조화된 '사고'와 안전 애플리케이션을 위해 특별히 설계되었습니다.
주요 개선사항 및 기능
- 프롬프트에서 엄격한 지시를 정확히 따르는 능력 향상
- Anthropic의 Bloom 및 Petri 방법 사용 기반
- 해킹 시도에 대한 저항력
- '비정상적' 및 적대적 프롬프트에 대한 저항력 증가
- 최대 100만 토큰 컨텍스트 윈도우
- Anthropic의 프레임워크 사용 - Bloom 및 Petri
이 모델은 Hugging Face에서 MerlinSafety/Qwen3.5-4B-Safety-Thinking에서 이용 가능합니다.
AI 에이전트를 다루는 개발자들에게 이 모델은 구조화된 추론과 프롬프트 조작에 대한 저항력이 우선순위인 안전-중요 애플리케이션을 위한 전문 도구를 나타냅니다. Anthropic의 Bloom 및 Petri 방법 통합은 정렬에 대한 헌법적 AI 접근 방식에 초점을 맞추고 있음을 시사합니다.
📖 Read the full source: r/LocalLLaMA
👀 See Also

Claude Code v2.1.160: 셸 설정, acceptEdits 파일 보호를 위한 안전 프롬프트 및 수십 건의 버그 수정에 대한 안전 프롬프트
Anthropic이 Claude Code v2.1.160을 출시했습니다. acceptEdits 모드에서 셸 시작 파일과 빌드 도구 설정에 쓰기 전 안전 프롬프트를 추가하고, Windows 클립보드 지원을 개선했으며, 세션 기록 손실을 수정했습니다.

Glomz Octagon: 다중 에이전트 코드 리뷰 – 179개 에이전트, 1,333개 리뷰, 네트워크 효과
Glomz.com에서 179개의 AI 에이전트가 등록하여 433개의 코드 제출물을 제출하고 'Octagon' 경기장에서 1,333개의 리뷰를 생성하는 실험을 진행했습니다. '리뷰 캐스케이드' 네트워크 효과는 실제로 나타났으며, 초기 리뷰가 3-5개인 제출물이 더 많은 에이전트를 끌어모았고, 가장 많은 리뷰를 받은 제출물은 21개의 리뷰를 받았습니다.

Qwen3.6 Plus 벤치마크 서양 최신 모델 대비 비교
Qwen3.6 Plus는 SWE-bench Verified에서 78.8점, GPQA/GPQA Diamond에서 90.4점, HLE(도구 없음)에서 28.8점, MMMU-Pro에서 78.8점을 기록하며 GPT-5.4, Claude Opus 4.6, Gemini 3.1 Pro Preview와 같은 모델들과 경쟁력을 보였습니다.

AI 금지 대신, 교수가 학생들과 교실 계약을 체결하다
한 과학 교수가 AI 사용을 전면 금지하는 대신, 학생들과 함께 수업 계약을 만들어 적절한 AI 활용 기준을 정의했습니다. 이 계약은 투명성, 출처 표시, 책임의 세 가지 원칙에 기반합니다.