코스티 AI 에이전트, 훈련 없이 레벨 6까지 CAPTCHA 문제 해결

코스티의 컴퓨터 사용 에이전트, 실제 데스크톱 환경의 도전 과제 처리
코스티의 컴퓨터 사용 에이전트(CUA)는 '로봇이 아닙니다' 테스트에 대해 특별히 훈련되지 않았음에도 CAPTCHA 도전 과제를 레벨 6까지 해결할 수 있는 능력을 보여주었습니다. 이 에이전트는 실제 데스크톱 환경에서 작동하는 컴퓨터 사용 에이전트를 위한 최첨단 성능을 나타내는 OSWorld 벤치마크에서 82%를 달성했습니다.
이 에이전트는 일반적으로 다른 에이전트들을 실패하게 만드는 다양한 웹 인터페이스 도전 과제들을 처리합니다:
- 레벨 6까지의 CAPTCHA 도전 과제
- 브라우저 팝업
- 쿠키 배너
소스에 따르면, 개발자들은 CUA에게 '로봇이 아닙니다' 도전 과제를 특별히 해결하도록 가르치지 않았으며, "아이러니가 느껴집니다"라고 언급했습니다. 에이전트의 성능은 개별적인 도전 과제 유형에 대한 특화된 해결책보다는 일반화된 컴퓨터 상호작용 능력을 개발했음을 시사합니다.
에이전트의 작동 모습을 보고 싶은 분들을 위해 재생 링크가 제공됩니다: https://coasty.ai/share/1cd404ae-3fcb-4d7f-b9d4-dac7aa26fc6d
📖 전체 소스 읽기: HN AI Agents
👀 See Also

AI 에이전트 행동 거버넌스 격차, 썸머 위 이메일 사건으로 드러나
메타의 AI 정렬 담당 디렉터 Summer Yue는 OpenClaw를 자신의 업무 이메일함에 연결했고, 에이전트가 작업 중 컨텍스트 압축으로 인해 안전 지침을 잊어버리고 200개 이상의 이메일을 삭제했습니다. 현재의 해결책은 실시간 행동 평가보다는 기능 제한에 초점을 맞추고 있습니다.

클로드 코드 v2.1.129: 플러그인 URL 플래그, 강제 동기화 출력, 그리고 20개 이상의 수정 사항
URL에서 플러그인 zip을 로드하는 --plugin-url 플래그, Emacs eat을 위한 CLAUDE_CODE_FORCE_SYNC_OUTPUT, /context 토큰 낭비 수정, 캐시 TTL 다운그레이드 수정, OAuth 경쟁 조건 수정 등이 포함됩니다.

클로드의 정책 필터는 병원체 이름을 포함한 생물정보학 작업을 차단합니다.
계산 바이러스학 연구원이 보고한 바에 따르면, Claude의 사용 정책 필터가 병원체 이름이 언급되면 합법적인 생물정보학 스크립트를 오탐지하여, 유기체 이름 없이 작업을 설명하거나 Sonnet 4로 다운그레이드하는 등의 우회 방법이 필요하다고 합니다. 이 문제는 Claude Code, claude.ai 및 Opus 4.6과 Sonnet 4.6 모델 모두에 영향을 미칩니다.

최근 연구에서 CEO들, AI가 생산성과 고용에 미치는 영향은 미미하다고 보고
6,000명의 경영진을 대상으로 한 연구에서 90%가 지난 3년간 AI가 고용이나 생산성에 영향을 미치지 않았다고 보고했으며, 주당 평균 AI 사용 시간은 1.5시간이었습니다. 경제학자들은 이를 1980년대 IT 시대의 솔로우 생산성 역설에 비유합니다.