DeepMind의 DiscoRL 메타 학습 업데이트 규칙이 JAX에서 PyTorch로 이식되었습니다

한 개발자가 DeepMind의 DiscoRL 메타 학습 업데이트 규칙을 JAX에서 PyTorch로 포팅했습니다. 이 작업은 'Distributed Compositional Reinforcement Learning'을 의미하는 DiscoRL에 대한 2025년 Nature 논문을 기반으로 하며, 새로운 작업에 빠르게 적응할 수 있는 에이전트를 훈련하기 위한 메타 학습 접근 방식입니다.
구현 세부 사항
이 포팅에는 https://github.com/asystemoffields/disco-torch에서 GitHub에서 사용할 수 있는 완전한 구현이 포함되어 있습니다. 저장소에는 다음이 포함됩니다:
- 실험을 위한 Colab 노트북
- 구현을 사용하기 위한 API
- Hugging Face에 호스팅된 사전 훈련된 가중치
개발자는 Claude Code를 사용하여 JAX에서 PyTorch로의 포팅 과정을 지원했습니다. 이러한 유형의 번역 작업은 연구자들이 다른 프레임워크에서 구현을 사용할 수 있도록 하거나 한 프레임워크를 다른 프레임워크보다 선호할 때 ML 커뮤니티에서 흔히 볼 수 있습니다.
DiscoRL과 같은 메타 학습 접근 방식은 에이전트가 이전 경험을 활용하여 새로운 작업을 빠르게 학습할 수 있도록 설계되었습니다. '업데이트 규칙'은 학습 중에 에이전트의 정책 또는 가치 함수가 어떻게 조정되는지에 대한 수학적 공식을 나타냅니다. 이러한 구현을 포팅하면 PyTorch 사용자가 JAX에서 작업할 필요 없이 이러한 기술을 실험할 수 있습니다.
📖 전체 출처 읽기: r/LocalLLaMA
👀 See Also

Ruflo: 다중 AI 에이전트를 팀으로 운영하는 오픈소스 플랫폼
Ruflo는 복잡한 작업을 팀으로 협력하는 여러 AI 에이전트를 함께 실행할 수 있는 오픈소스 플랫폼입니다. 이전에는 Claude Flow로 알려졌으며, 작업을 여러 부분으로 나누어야 하는 워크플로우를 조정하는 데 도움을 줍니다.

초보자에게 적합한 라이브 빌드: 첫 번째 OpenClaw 에이전트
클로캐스트가 7월 8일 초보자 친화적인 라이브 빌드 세션을 진행합니다. 코딩 없이 OpenClaw 에이전트를 설정하는 방법을 보여줍니다. Discord에서 참여하거나 YouTube에서 녹화를 시청하세요.

토큰 리듀서: 지능적인 컨텍스트 압축을 위한 Claude 코드 플러그인
Token Reducer는 AST 기반 청킹, 하이브리드 검색, TextRank 압축을 사용하여 저장소 컨텍스트를 로컬에서 처리하여 토큰 사용량을 90-98% 줄이는 Claude Code 플러그인입니다. MIT 라이선스로 제공되며 플러그인 마켓플레이스를 통해 이용할 수 있습니다.

코드베이스에서 지속적인 AI 에이전트 메모리를 위한 순회 가능한 스킬 그래프
개발자가 코드베이스 내부에 존재하는 3계층 스킬 그래프 시스템을 구축하여 AI 코딩 어시스턴트가 세션 간 지속적인 메모리를 유지할 수 있도록 했습니다. 이 시스템은 단일한 컨텍스트 파일 대신 자기 주도적 지침과 함께 점진적 공개 방식을 사용합니다.