카파시의 자율 연구 프로젝트: AI 에이전트가 밤새 LLM 학습 실험을 실행합니다

카파시의 자동연구 프로젝트가 하는 일
안드레이 카파시가 "AI 연구자 루프" 개념을 보여주는 "autoresearch"라는 작은 저장소를 공개했습니다. 이 시스템은 AI 에이전트를 사용하여 단일 GPU에서 밤새 LLM 훈련 실험을 자율적으로 실행합니다.
작동 방식
에이전트는 다음과 같은 워크플로우를 따릅니다:
train.py파일을 지속적으로 수정합니다- 5분짜리 나노챗 훈련 실험을 실행합니다
- 검증 비트퍼바이트(
val_bpb) 지표가 개선되었는지 확인합니다 - 사용자가 자는 동안 이 사이클을 반복합니다
설정 및 구성
이 프로젝트는 매우 간단한 설정을 가지고 있습니다:
- 하드웨어: 하나의 GPU
- 파일: 하나의 메인 파일
- 지표: 하나의 주요 지표(
val_bpb)
사람은 program.md에 연구 조직 프롬프트를 작성하고, 에이전트가 코드 반복 작업을 처리합니다.
실험 처리량
실험당 고정된 5분 예산으로, 시스템은 시간당 약 12개의 실험을 실행할 수 있습니다.
이 접근 방식은 AI 에이전트가 매개변수 공간과 훈련 구성을 자율적으로 탐색할 수 있는 자동화된 연구의 실용적인 구현을 보여주며, 언어 모델을 다루는 개발자들의 실험 주기를 가속화할 수 있습니다.
📖 전체 소스 읽기: r/LocalLLaMA
👀 See Also

오픈 소스 MCP 서버가 클로드를 메일침프 API에 연결합니다
한 개발자가 Claude Code를 사용하여 Mailchimp MCP 서버를 구축했으며, 캠페인, 대상자, 보고서, 자동화 및 전자상거래를 위한 53가지 도구와 내장 안전 모드 및 읽기 전용 구성을 제공합니다.

Stoa Markets: 검증된 견적을 제공하는 GPU 및 AI 서버 마켓플레이스
Stoa는 신규 및 중고 GPU와 AI 서버를 사고팔 수 있는 마켓플레이스입니다. RFQ를 표준화하고, 거래 상대방을 검증하며, 확정 견적을 제공하여 GPU 시장의 가격 발견을 개선하는 것을 목표로 합니다.

오픈소스 감시 도구, OpenClaw 생태계에서 에이전트 신원 문제 해결
OpenClaw 사용자가 웹 서비스를 구축하는 과정에서 인간 사용자와 구분할 수 없는 에이전트 트래픽을 발견했으며, 이는 W3C DID 기반의 오픈 소스 신원 계층인 Vigil 개발로 이어졌습니다. Vigil은 에이전트를 위한 암호화 자격 증명과 행동 기록을 제공합니다.

로컬 35B MoE 모델, 에이전트 OS 코드 실패율 0% 달성
한 개발자가 멀티 에이전트 시스템의 런타임을 Qwen 3.6 35B A3B (MoE, 3B 활성 파라미터)로 전환한 후 코드 오류가 사라졌으며, 5계층 검증 게이트를 통해 100% 성공률을 달성했다고 보고했습니다.