Nyx: AI 에이전트를 위한 자율 테스트 하네스

Nyx는 전통적인 소프트웨어 테스트가 다루지 않는 실패 모드를 해결하기 위해 특별히 AI 에이전트를 위해 설계된 자율 테스트 하네스입니다. 이는 사용자가 접하기 전에 AI 시스템에서 논리 버그, 추론 실패, 에이전트 행동의 엣지 케이스, 보안 취약점을 찾아냅니다.
기술적 접근 방식
이 시스템은 순수 블랙박스 솔루션으로 작동하여 테스트 중인 AI 에이전트에 대한 특별한 접근 권한이 필요하지 않습니다. 이는 사용자가 경험하는 것과 동일한 조건에서 테스트를 가능하게 합니다. 주요 기능은 다음과 같습니다:
- 현실적인 상호작용을 시뮬레이션하는 다중 턴 적응형 대화
- 음성, 텍스트, 이미지, 문서 및 브라우저 상호작용을 포함한 다중 모달 테스트 기능
- 효율적인 테스트를 위한 기본 대규모 병렬 실행
사용 사례
Nyx는 AI 에이전트에서 몇 가지 특정 실패 모드를 식별합니다:
- 논리 버그 및 추론 실패
- 지시 사항 준수 실패
- 에이전트 행동의 엣지 케이스
- 탈옥, 프롬프트 주입 및 도구 하이재킹을 포함한 레드팀 보안 테스트
개발자는 특정 실패 모드에 대한 정적 평가를 작성하는 대신, Nyx를 어떤 AI 시스템에든 지정하면 이 도구가 관련 문제를 자율적으로 발견합니다. 출처에 따르면, 이 도구는 일반적으로 수동 감사가 수 시간이 걸리는 문제를 10분 이내에 찾아냅니다.
개발자들은 이 작업이 초기 단계임을 인정하며 방법론이 발전할 것으로 기대합니다. 그들은 시스템을 반복 개선하면서 커뮤니티 피드백을 적극적으로 구하고 있습니다.
📖 Read the full source: HN AI Agents
👀 See Also

다중 에이전트 AI 시스템 비교: Anthropic의 Harness 대 Agyn의 엔지니어링 조직 모델
Anthropic은 장기 실행 애플리케이션 개발을 위한 하네스 설계를 발표한 반면, Agyn의 팀 기반 자율 소프트웨어 엔지니어링을 위한 다중 에이전트 시스템은 지난달 오픈소스로 공개되었습니다. 두 시스템 모두 단일 에이전트 모델을 거부하고 역할 분리, 구조화된 인계, 검토 루프를 선호합니다.

다중 단계 LLM 워크플로우를 위한 결정론적 컴파일러 아키텍처, 벤치마크에서 강력한 성과 보여
구조화된 LLM 워크플로우를 위한 결정론적 컴파일 아키텍처는 타입화된 노드 레지스트리, 파라미터 계약, 정적 검증을 사용하여 워크플로우 그래프를 사전에 컴파일합니다. 벤치마크 결과는 3-12개 이상의 노드로 구성된 다양한 워크플로우 깊이에서 GPT-4.1과 Claude Sonnet 4.6을 능가하는 성능을 보여줍니다.

오프 그리드 모바일 앱, 온디바이스 AI 도구 사용 추가 및 3배 속도 향상
오프 그리드 모바일 앱이 이제 AI 모델이 웹 검색, 계산기, 날짜/시간, 디바이스 정보와 같은 도구들을 완전히 오프라인에서 사용할 수 있도록 업데이트되었으며, 구성 가능한 KV 캐시 옵션으로 휴대폰에서 최대 30 토큰/초의 속도를 제공합니다.

Hollow Agent OS: 로컬 AI 작업자가 막힐 때 Claude를 수석 아키텍트로 호출
Hollow Agent OS는 로컬 Qwen 모델을 사용하여 24시간 실행되지만, 논리 오류가 발생하거나 큰 변경이 필요할 때 MCP를 통해 Claude를 호출합니다. Claude는 파일 구조를 재구성하고, 코드를 검토하며, 자율 로컬 작업자들의 매니저 역할을 합니다.