DeepMind의 DiscoRL 메타 학습 업데이트 규칙이 JAX에서 PyTorch로 이식되었습니다

✍️ OpenClawRadar📅 게시일: March 9, 2026🔗 Source
DeepMind의 DiscoRL 메타 학습 업데이트 규칙이 JAX에서 PyTorch로 이식되었습니다
Ad

한 개발자가 DeepMind의 DiscoRL 메타 학습 업데이트 규칙을 JAX에서 PyTorch로 포팅했습니다. 이 작업은 'Distributed Compositional Reinforcement Learning'을 의미하는 DiscoRL에 대한 2025년 Nature 논문을 기반으로 하며, 새로운 작업에 빠르게 적응할 수 있는 에이전트를 훈련하기 위한 메타 학습 접근 방식입니다.

구현 세부 사항

이 포팅에는 https://github.com/asystemoffields/disco-torch에서 GitHub에서 사용할 수 있는 완전한 구현이 포함되어 있습니다. 저장소에는 다음이 포함됩니다:

  • 실험을 위한 Colab 노트북
  • 구현을 사용하기 위한 API
  • Hugging Face에 호스팅된 사전 훈련된 가중치

개발자는 Claude Code를 사용하여 JAX에서 PyTorch로의 포팅 과정을 지원했습니다. 이러한 유형의 번역 작업은 연구자들이 다른 프레임워크에서 구현을 사용할 수 있도록 하거나 한 프레임워크를 다른 프레임워크보다 선호할 때 ML 커뮤니티에서 흔히 볼 수 있습니다.

DiscoRL과 같은 메타 학습 접근 방식은 에이전트가 이전 경험을 활용하여 새로운 작업을 빠르게 학습할 수 있도록 설계되었습니다. '업데이트 규칙'은 학습 중에 에이전트의 정책 또는 가치 함수가 어떻게 조정되는지에 대한 수학적 공식을 나타냅니다. 이러한 구현을 포팅하면 PyTorch 사용자가 JAX에서 작업할 필요 없이 이러한 기술을 실험할 수 있습니다.

📖 전체 출처 읽기: r/LocalLLaMA

Ad

👀 See Also

Ruflo: 다중 AI 에이전트를 팀으로 운영하는 오픈소스 플랫폼
Tools

Ruflo: 다중 AI 에이전트를 팀으로 운영하는 오픈소스 플랫폼

Ruflo는 복잡한 작업을 팀으로 협력하는 여러 AI 에이전트를 함께 실행할 수 있는 오픈소스 플랫폼입니다. 이전에는 Claude Flow로 알려졌으며, 작업을 여러 부분으로 나누어야 하는 워크플로우를 조정하는 데 도움을 줍니다.

OpenClawRadar
초보자에게 적합한 라이브 빌드: 첫 번째 OpenClaw 에이전트
Tools

초보자에게 적합한 라이브 빌드: 첫 번째 OpenClaw 에이전트

클로캐스트가 7월 8일 초보자 친화적인 라이브 빌드 세션을 진행합니다. 코딩 없이 OpenClaw 에이전트를 설정하는 방법을 보여줍니다. Discord에서 참여하거나 YouTube에서 녹화를 시청하세요.

OpenClawRadar
토큰 리듀서: 지능적인 컨텍스트 압축을 위한 Claude 코드 플러그인
Tools

토큰 리듀서: 지능적인 컨텍스트 압축을 위한 Claude 코드 플러그인

Token Reducer는 AST 기반 청킹, 하이브리드 검색, TextRank 압축을 사용하여 저장소 컨텍스트를 로컬에서 처리하여 토큰 사용량을 90-98% 줄이는 Claude Code 플러그인입니다. MIT 라이선스로 제공되며 플러그인 마켓플레이스를 통해 이용할 수 있습니다.

OpenClawRadar
코드베이스에서 지속적인 AI 에이전트 메모리를 위한 순회 가능한 스킬 그래프
Tools

코드베이스에서 지속적인 AI 에이전트 메모리를 위한 순회 가능한 스킬 그래프

개발자가 코드베이스 내부에 존재하는 3계층 스킬 그래프 시스템을 구축하여 AI 코딩 어시스턴트가 세션 간 지속적인 메모리를 유지할 수 있도록 했습니다. 이 시스템은 단일한 컨텍스트 파일 대신 자기 주도적 지침과 함께 점진적 공개 방식을 사용합니다.

OpenClawRadar