AI 에이전트가 개방형 실험에서 독립적으로 안전장치를 구축합니다

실험 설정
한 개발자가 2월 초부터 3대의 Apple Silicon 머신에서 5개의 AI 에이전트를 운영해왔으며, Claude가 대부분의 복잡한 작업을 처리했습니다. 에이전트들은 공유 SQLite 데이터베이스와 JSON 상태 파일을 통해 조율되며, 구독 티어에서 완전히 실행되어 API 비용이 $0입니다.
에이전트 역할은 다음과 같습니다: 하나는 코드를 작성하고(복잡도에 따라 주로 Claude Opus와 Sonnet 사용), 하나는 다른 에이전트의 산출물을 검토하고, 하나는 콘텐츠를 관리하고, 하나는 운영을 처리하고, 하나는 연구를 수행합니다.
개방형 브리핑 결과
3주 전, 구체적인 작업 대신 개발자는 에이전트들에게 개방형 브리핑을 제공했습니다: Reddit, Hacker News, GitHub에서 개발자들이 어떤 문제로 고민하는지 스캔하고, 해결책을 설계한 다음, 하룻밤 사이에 작동하는 프로토타입을 구축하라는 것이었습니다.
170개 이상의 프로토타입 이후, 완전히 다른 입력 신호로 다른 밤에 구축된 28개의 프로토타입이 독립적으로 동일한 문제 범주에 수렴했습니다: 보안 스캐너와 비용 제어 도구. 에이전트들은 스스로를 위한 안전장치를 계속해서 구축했습니다.
Claude가 구축한 구체적인 예시
- .env 파일 암호화 계층: AI 코딩 워크플로우에서 비밀 노출에 관한 높은 추천을 받은 HN 스레드를 발견한 후, Claude는 커밋 전에 유출된 비밀을 스캔하는 암호화 계층을 하룻밤 사이에 구축했습니다.
- 다중 계층 코드 검증기: AI 생성 PR이 적절한 검토 없이 병합된다는 개발자들의 불만에 대응하여, Claude는 테스트 통과 여부뿐만 아니라 PR이 실제로 배포해도 안전한지 점수를 매기는 검증기를 구축했습니다.
- Rust 재작성 토큰 절약 도구: Claude는 에이전트가 컨텍스트에서 실제로 필요로 하는 파일을 파악하기 위해 AST 종속성 그래프를 구성하는 도구를 구축하여 상당한 토큰 감소를 달성했습니다. 그런 다음 요청받지 않았음에도 핵심 모듈을 Rust로 재작성하며, 왜 더 빠른지 설명하는 메모를 남겼습니다.
주요 관찰
개발자는 에이전트들이 코드 생성과 무관한 한계에 도달했다고 지적합니다. 그들은 무엇이든 구축할 수 있었지만 자신의 산출물을 검증하거나, 자신의 비용을 통제하거나, 자신의 접근 범위를 제한할 수 없었습니다. 그래서 그들은 스스로 이를 수행할 인프라를 구축했습니다.
이는 안전장치 없이 자율성을 부여받은 팀이 먼저 자신들의 안전장치를 구축하는 기업 소프트웨어 패턴을 반영합니다. 특히 Claude는 이러한 격차를 식별하는 데 가장 일관적이었습니다.
결론: 기능 문제는 대부분 해결되었지만(Claude Code, Cursor, Codex 모두 빠르게 코드를 생성할 수 있음), 부족한 것은 자율적 에이전트를 프로덕션 안전하게 만드는 위임 인프라입니다.
📖 전체 출처 읽기: r/ClaudeAI
👀 See Also

클로드 코드로 생산적인 자율 ML 연구 시스템 구축하기
한 개발자가 클로드 코드를 사용해 자율 머신러닝 연구 시스템을 구축한 경험을 공유했습니다. 이 시스템은 클로드 코드가 표 형식 데이터(이탈률 또는 전환율 데이터셋 등)에 대해 자율 ML 연구자 역할을 수행하며, 무한 루프로 밤새 실험을 실행할 수 있게 합니다. 주요 학습 내용은 편집 가능한 파일을 제한하고, 제한을 통해 실험 처리량을 보호하며, 구조화된 로깅을 통해 지속적인 메모리를 구현하는 것입니다.

홈랩 AI 개발 플랫폼: 안전한 컨테이너 업데이트를 위한 OpenCode + GitOps
개발자가 OpenCode를 Git 접근, PR 리뷰 게이트, GitOps 배포와 함께 설정하여 홈랩 컨테이너 업데이트를 더 안전하게 만듭니다. AI가 변경 사항을 작성하고, 소유자가 PR을 통해 검토하며, Arcane이 배포합니다.

자동화된 AI 개발 파이프라인, 11개의 품질 게이트 및 신뢰도 프로필 포함
한 개발자가 11개의 자동화된 품질 게이트를 갖춘 AI 기반 파이프라인을 구축하여 수동 승인 없이 종단 간 실행되도록 했습니다. 신뢰도 프로필, 자동 복구 및 캐싱을 활용하여 설계, 계획, 빌드, 테스트 및 보안 검사를 자율적으로 처리하며, 토큰 사용량을 60-84% 감소시켰습니다.

오래된 노키아 폰에서 작은 AI 에이전트 디버깅하기: 성공까지의 18번의 시도
한 개발자가 구형 노키아 안드로이드 폰에서 Termux를 통해 Picobot이라는 ~12MB의 AI 에이전트를 실행하려고 시도했으며, 무료 모델, OpenRouter, Groq를 테스트한 후 빠르고 안정적인 설정을 위해 Google의 Gemini Flash API를 선택했습니다.