허깅페이스의 물리학 인턴: 멀티 에이전트 프레임워크, CritPt 벤치마크에서 제미니 대비 2배 성능
Hugging Face가 physics-intern을 출시했습니다. 이는 이론 물리학 연구를 위해 설계된 오픈소스 다중 에이전트 프레임워크입니다. 복잡한 문제를 전문화된 하위 에이전트(컴퓨팅, 주장 검토, 연구 전략 도전 에이전트 등)에 할당되는 집중된 작업으로 분해하여 과학적 연구 프로세스를 모방합니다.
아키텍처 및 워크플로
이 프레임워크는 연구 수준의 문제를 여러 하위 작업으로 분해하며, 각 작업은 전담 하위 에이전트가 처리합니다:
- 컴퓨팅 에이전트: 수치 계산 및 시뮬레이션을 처리합니다.
- 검토 에이전트: 주장의 정확성과 일관성을 평가합니다.
- 전략 도전 에이전트: 전체 연구 방향을 비판하고 대안을 제안합니다.
이 에이전트 하네스는 도메인에 구애받지 않도록 설계되었지만, 이론 물리학에 특화되어 조정되었습니다.
벤치마크 성능
CritPt 벤치마크(물리학의 임계점 분석)에서 physics-intern은 Gemini 모델의 성능을 두 배로 향상시키고 GPT-5.5 Pro를 능가하는 새로운 최첨단 결과를 달성했으며, 모두 훨씬 더 낮은 비용으로 이루어졌습니다. 구체적인 수치는 소스에 명시되지 않았지만, 성능 향상은 "두 배" 및 "새로운 SOTA"로 설명됩니다.
사용 가능성
이 프레임워크는 Hugging Face Space로 제공됩니다. 아키텍처와 설계 결정을 자세히 설명하는 블로그 게시물은 아래 링크에서 확인할 수 있습니다. 커뮤니티의 기여와 확장을 환영합니다.
대상: 특히 이론 물리학과 같은 과학 분야에서 에이전트 기반 워크플로를 구축하는 연구자 및 개발자.
📖 전체 소스 읽기: r/LocalLLaMA
👀 See Also

Fewshell: 인간 승인 없이 명령어 실행을 거부하는 자체 호스트형 SSH 코파일럿
Fewshell은 모든 명령에 대해 인간의 승인을 필수로 하는 모바일+데스크톱 SSH 코파일럿으로, 자동 승인을 활성화하는 설정이 없습니다. AI 안전 연구에 종사하는 전 아마존 AI SDE가 만들었습니다.

MCP 코드 모드를 활용한 효율적인 Claude 키워드 연구
한 개발자가 코드 모드 패턴을 사용해 Claude가 자율적인 키워드 연구를 수행할 수 있도록 하는 MCP 서버를 구축했습니다. 이로써 도구 정의에 필요한 토큰 수를 수천 개에서 약 1,000개로 줄였으며, 검색과 실행이라는 두 가지 도구만 사용합니다.

AI 코딩 도구 분석: 3,177개의 API 호출 해부하기
3,177개의 API 호출에 대한 기술적 분석은 4가지 AI 코딩 도구가 컨텍스트 창을 관리하는 방식을 밝혀내며 비효율성과 차이점을 드러냅니다.

Altimate 코드: 오픈소스 에이전트 기반 데이터 엔지니어링 하네스
Altimate Code는 AI 에이전트를 위한 결정론적 데이터 엔지니어링 도구를 제공하는 오픈소스 하네스로, 환각 SQL 및 누락된 스키마 컨텍스트와 같은 문제를 해결합니다. 컬럼 수준 계보, SQL 안티패턴 감지, dbt 통합을 포함하며, ADE-bench에서 74.4% 성능을 보여주는 벤치마크 결과가 있습니다.