클로드 오퍼스 4.7, 한타바이러스 백신 질문을 안전 위험으로 분류하며 채팅 중단

한 Hacker News 사용자가 Claude(Opus 4.7)에게 "한타바이러스 백신을 어떻게 개발하시겠습니까?"라고 묻자 안전 필터가 작동하여 다음과 같은 모달이 표시되었다고 보고했습니다: "채팅이 일시 중지되었습니다. Opus 4.7의 안전 필터가 이 채팅을 감지했습니다. 고급 기능으로 인해 Opus 4.7은 정상적이고 안전한 채팅을 가끔 일시 중지하는 추가 안전 조치를 사용합니다. 개선을 위해 노력 중입니다. Sonnet 4로 채팅을 계속하거나, 피드백을 보내거나, 자세히 알아보세요."
사용자는 먼저 바이러스 자체에 대해 질문하여 우회해 보았지만, 새 세션에서도 백신 질문이 여전히 차단되었습니다. 다른 사용자는 "특히 Andes 바이러스에 대한 한타바이러스 백신을 어떻게 개발하시겠습니까?"라는 더 구체적인 프롬프트로 동일한 결과를 확인했습니다.
댓글 작성자들은 공중 보건 연구자들이 매일 논문에서 백신 설계 방법을 공개적으로 논의하며, 이러한 적극적인 차단이 정상적인 교육적 사용을 해친다고 지적합니다. 한 사용자는 문제가 Opus 4.7에 국한되지 않는다고 언급했습니다. 미국 내 한타바이러스(2025-2027) 예측 모델을 구축하기 위해 전문가 페르소나 그룹을 만들었을 때, Sonnet 4.6도 동일한 채팅 일시 중지 오류를 반환했습니다.
더 넓은 논의는 기업 책임이 원인이라고 지적합니다. 기술 회사들은 사용자가 유해한 목적으로 AI를 오용할 경우 소송을 당할까 두려워 건강 및 생물보안과 같은 민감한 주제에 대해 과도한 필터링을 초래합니다.
📖 전체 출처 보기: HN AI Agents
👀 See Also

에이전트 AI 실패 모드 및 발전적 스캐폴딩
에이전트 AI 시스템은 정렬 드리프트, 인수인계 간 맥락 상실, 경계 위반, 조정 붕괴를 통해 생산 환경에서 실패합니다. 출처는 일관성 모니터링, 조정 복구, 동의 및 경계 인식, 관계적 연속성, 적응형 거버넌스라는 다섯 가지 구성 요소를 갖춘 '발달적 비계' 접근법을 제안합니다.

GLM-5.1 출시, 코딩 성능 Claude Opus 4.5와 대등
Zhipu AI의 GLM-5.1 모델이 이제 모든 코딩 플랜 사용자에게 제공되며, SWE-bench-Verified에서 77.8점, Terminal Bench 2.0에서 56.2점을 달성했습니다. 이 모델은 200K 컨텍스트 윈도우, 128K 최대 출력, 744B 파라미터(40B 활성화)를 특징으로 합니다.
Stripe将以逾70亿美元收购AI网关OpenRouter
Stripe가 AI 게이트웨이 스타트업 OpenRouter를 70억 달러 이상에 인수하기로 한 것으로 알려졌습니다. 이를 통해 400개 이상의 AI 모델과 800만 사용자에게 단일 액세스 포인트를 제공하게 됩니다.

주간 r/ClaudeAI 생존 가이드: Opus 4.7, 청구 버그, 데이터베이스 삭제 사고
Wilson의 주간 생존 가이드는 r/ClaudeAI의 주요 스레드(50개 이상 댓글)를 실행 가능한 교훈으로 요약합니다: Opus 4.7 논쟁, git 파일명으로 인한 $200 청구 오류, 9초 만에 전체 데이터베이스를 삭제한 AI 에이전트, 그리고 Claude 모델에 대한 Copilot의 9배 가격 인상.