DeepMind DiscoRL Regla de Actualización de Metaaprendizaje Migrada de JAX a PyTorch

Un desarrollador ha adaptado la regla de actualización de metaaprendizaje DiscoRL de DeepMind de JAX a PyTorch. El trabajo se basa en el artículo de Nature de 2025 sobre DiscoRL, que significa 'Distributed Compositional Reinforcement Learning' (Aprendizaje por Refuerzo Distribuido y Composicional), un enfoque de metaaprendizaje para entrenar agentes que pueden adaptarse rápidamente a nuevas tareas.
Detalles de la Implementación
La adaptación incluye una implementación completa disponible en GitHub en https://github.com/asystemoffields/disco-torch. El repositorio contiene:
- Un cuaderno de Colab para experimentación
- Una API para usar la implementación
- Pesos preentrenados alojados en Hugging Face
El desarrollador utilizó Claude Code para ayudar con el proceso de adaptación de JAX a PyTorch. Este tipo de trabajo de traducción es común en la comunidad de ML cuando los investigadores quieren hacer que las implementaciones estén disponibles en diferentes marcos de trabajo o cuando prefieren trabajar con un marco sobre otro.
Los enfoques de metaaprendizaje como DiscoRL están diseñados para permitir que los agentes aprendan nuevas tareas rápidamente aprovechando experiencias previas. La 'regla de actualización' se refiere a la formulación matemática de cómo se ajusta la política o función de valor del agente durante el aprendizaje. Adaptar tales implementaciones permite a los usuarios de PyTorch experimentar con estas técnicas sin necesidad de trabajar en JAX.
📖 Read the full source: r/LocalLLaMA
👀 Ver también

Charlas Directas: Una Habilidad de Código Abierto para Claude que Exige Retroalimentación Honesta, No Validación
Una nueva habilidad de Claude de código abierto llamada Straight Talk hace que Claude se niegue a validar ideas hasta que entienda la situación, luego genera contraargumentos y pone a prueba las suposiciones.

CLAUDE.md: El archivo de reemplazo reduce los tokens de salida de Claude en un 63%
CLAUDE.md es un archivo único que reduce la verbosidad de la salida de Claude aproximadamente un 63% sin cambios en el código. Se enfoca en la adulación, verbosidad y ruido de formato en las respuestas de Claude.

Complemento de Canal Personalizado de WhatsApp para Claude Code Usando Baileys
Un desarrollador creó un complemento de canal personalizado que agrega soporte de WhatsApp a Claude Code 2.1.80+ usando Baileys v7, implementando el protocolo WhatsApp Web Multi-Device como un servidor MCP con la capacidad experimental claude/channel.

El complemento MCP de caché de prompts reduce automáticamente los costos de la API de Claude al identificar contextos estables.
El complemento MCP de caché de prompts identifica automáticamente partes estables del contexto, como prompts del sistema y definiciones de herramientas, luego las marca para la función de caché de Anthropic para reducir los costos de API en un 80-92% en sesiones de codificación.