DeepMind DiscoRL Regra de Atualização de Meta Aprendizado Migrada do JAX para PyTorch

✍️ OpenClawRadar📅 Publicado: March 9, 2026🔗 Source
DeepMind DiscoRL Regra de Atualização de Meta Aprendizado Migrada do JAX para PyTorch
Ad

Um desenvolvedor portou a regra de atualização de meta-aprendizado DiscoRL da DeepMind do JAX para PyTorch. O trabalho é baseado no artigo da Nature de 2025 sobre DiscoRL, que significa 'Distributed Compositional Reinforcement Learning' (Aprendizado por Reforço Composicional Distribuído) — uma abordagem de meta-aprendizado para treinar agentes que podem se adaptar rapidamente a novas tarefas.

Ad

Detalhes da Implementação

A portabilidade inclui uma implementação completa disponível no GitHub em https://github.com/asystemoffields/disco-torch. O repositório contém:

  • Um notebook Colab para experimentação
  • Uma API para usar a implementação
  • Pesos pré-treinados hospedados no Hugging Face

O desenvolvedor usou o Claude Code para auxiliar no processo de portabilidade do JAX para PyTorch. Esse tipo de trabalho de tradução é comum na comunidade de aprendizado de máquina quando pesquisadores querem disponibilizar implementações em diferentes frameworks ou quando preferem trabalhar com um framework em vez de outro.

Abordagens de meta-aprendizado como DiscoRL são projetadas para permitir que agentes aprendam novas tarefas rapidamente aproveitando experiências anteriores. A 'regra de atualização' refere-se à formulação matemática de como a política ou função de valor do agente é ajustada durante o aprendizado. Portar tais implementações permite que usuários do PyTorch experimentem essas técnicas sem precisar trabalhar no JAX.

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also

Análise do Conselho LLM Revela Estratégias Práticas de Otimização de Tokens de Código Claude
Tools

Análise do Conselho LLM Revela Estratégias Práticas de Otimização de Tokens de Código Claude

Um desenvolvedor usou a ferramenta LLM Council com 5 personas para analisar padrões de uso do Claude Code, identificando que o modo de pensamento estendido por padrão era o maior consumidor de tokens. O playbook resultante alcançou redução de 60-70% nos tokens com mesma ou melhor qualidade de saída.

OpenClawRadar
Desbloqueando a Proatividade: Uma Análise Profunda das Inovações do Clawbot pela Comunidade
Tools

Desbloqueando a Proatividade: Uma Análise Profunda das Inovações do Clawbot pela Comunidade

Descubra como entusiastas estão aprimorando a proatividade de seus Clawbots por meio de estratégias inventivas e insights impulsionados pela comunidade. Um olhar sobre as discussões e revelações do r/openclaw.

OpenClawRadar
Servidor MCP de Nutrição Construído com Claude Code para Exportação de Diário Alimentar
Tools

Servidor MCP de Nutrição Construído com Claude Code para Exportação de Diário Alimentar

Um desenvolvedor criou um servidor MCP de nutrição usando Claude Code após aplicativos comerciais bloquearem a exportação de dados, criando uma ferramenta que registra refeições via Claude, gera resumos e exporta para Excel sem precisar trocar de aplicativos.

OpenClawRadar
Agente AFK do Claude Code: Execute Trabalhadores Autônomos com Suporte do Discord via Plugin do Teams
Tools

Agente AFK do Claude Code: Execute Trabalhadores Autônomos com Suporte do Discord via Plugin do Teams

Use o plugin de canais oficial e o agente de equipes com a variável de ambiente CLAUDE_CODE_EXPERIMENTAL_AGENT_TEAMS=1 para iniciar trabalhadores individuais a partir do Discord. Inclui um CLAUDE.md completo para um agente líder que despacha, nunca trabalha e força o desligamento de trabalhadores silenciosos após 60 minutos.

OpenClawRadar