El pasante de física de Hugging Face: El marco multiagente duplica a Gemini en el benchmark CritPt

✍️ OpenClawRadar📅 Publicado: 12 de mayo de 2026🔗 Source
Ad

Hugging Face lanzó physics-intern, un marco multiagente de código abierto diseñado para la investigación en física teórica. Imita el proceso de investigación científica al descomponer problemas complejos en tareas enfocadas que son asignadas a subagentes especializados, incluidos agentes de cómputo, revisión de afirmaciones y desafío de estrategia de investigación.

Arquitectura y flujo de trabajo

El marco descompone problemas a nivel de investigación en varias subtareas, cada una manejada por un subagente dedicado:

  • Agente de cómputo: Maneja cálculos numéricos y simulaciones.
  • Agente de revisión: Evalúa afirmaciones en cuanto a corrección y coherencia.
  • Agente de desafío de estrategia: Critica la dirección general de la investigación y sugiere alternativas.

Este arnés de agentes está diseñado para ser independiente del dominio, pero fue ajustado específicamente para física teórica.

Ad

Rendimiento en benchmarks

En el benchmark CritPt (análisis de puntos críticos en física), physics-intern duplicó el rendimiento de los modelos Gemini y alcanzó un nuevo resultado de última generación, superando a GPT-5.5 Pro, todo a un costo significativamente menor. Las cifras específicas no se detallaron en la fuente, pero la ganancia de rendimiento se describe como "duplicación" y "nuevo SOTA".

Disponibilidad

El marco está disponible como un Hugging Face Space. La publicación del blog que detalla la arquitectura y las decisiones de diseño se puede encontrar en el enlace a continuación. Se alientan las contribuciones y extensiones de la comunidad.

Para quién es: Investigadores y desarrolladores que construyen flujos de trabajo de agentes para dominios científicos, especialmente física teórica.

📖 Leer la fuente completa: r/LocalLLaMA

Ad

👀 Ver también

tmux-IDE: Un IDE Multiagente Basado en Terminal para Claude
Herramientas

tmux-IDE: Un IDE Multiagente Basado en Terminal para Claude

tmux-IDE es un IDE de terminal de código abierto y declarativo centrado en la ingeniería de agentes que crea diseños multiagente para agentes de codificación Claude. Permite a los desarrolladores iniciar su IDE a través de SSH, dar indicaciones a Claude y apagar su máquina mientras Claude continúa trabajando en sesiones de tmux.

OpenClawRadar
🦀
Herramientas

Un plugin escrito por Claw añade soporte para el nivel de pensamiento Qwen 3.8 27B a OpenClaw

Un desarrollador comparte un plugin, escrito íntegramente por un agente de IA, que propaga los niveles de pensamiento de Qwen 3.8 a través de la plantilla de chat, con anulaciones opcionales por llamada y soporte de modo instructivo.

OpenClawRadar
Engram: Capa de memoria de código abierto para clientes Claude Code y MCP
Herramientas

Engram: Capa de memoria de código abierto para clientes Claude Code y MCP

Engram es una capa de memoria de código abierto que funciona como un servidor MCP con cualquier cliente como Claude Code, Cursor o Windsurf. Almacena recuerdos ilimitados con búsqueda semántica vectorial, logra un 80% de precisión en el benchmark LOCOMO y utiliza alrededor de 800 tokens por consulta frente a 5K+ para enfoques basados en archivos.

OpenClawRadar
StartClaw: Una herramienta de automatización de navegador sin cabeza construida sobre ZeroClaw con integración de Claude
Herramientas

StartClaw: Una herramienta de automatización de navegador sin cabeza construida sobre ZeroClaw con integración de Claude

StartClaw es una herramienta de automatización de navegadores construida sobre la base Rust de ZeroClaw con Composio v3 para integraciones, diseñada para ejecutarse sin interfaz gráfica en la nube sin requerir hardware local. Utiliza exclusivamente Claude para garantizar fiabilidad e incluye una compactación de contexto integrada que reduce el uso de tokens aproximadamente 5 veces.

OpenClawRadar