Interné en physique chez Hugging Face : Un cadre multi-agent double les performances de Gemini sur le benchmark CritPt

✍️ OpenClawRadar📅 Publié: May 12, 2026🔗 Source
Ad

Hugging Face a publié physics-intern, un framework multi-agents open source conçu pour la recherche en physique théorique. Il imite le processus de recherche scientifique en décomposant des problèmes complexes en tâches ciblées confiées à des sous-agents spécialisés—notamment des agents de calcul, de vérification des affirmations et de défi stratégique de recherche.

Architecture et flux de travail

Le framework décompose les problèmes de niveau recherche en plusieurs sous-tâches, chacune traitée par un sous-agent dédié :

  • Agent de calcul : Effectue les calculs numériques et les simulations.
  • Agent de vérification : Évalue la justesse et la cohérence des affirmations.
  • Agent de défi stratégique : Critique l'orientation générale de la recherche et propose des alternatives.

Ce harnais agentique est conçu pour être indépendant du domaine, mais a été spécifiquement ajusté pour la physique théorique.

Ad

Performances sur les benchmarks

Sur le benchmark CritPt (analyse des points critiques en physique), physics-intern a doublé les performances des modèles Gemini et a obtenu un nouveau résultat de pointe, dépassant GPT-5.5 Pro—le tout à un coût nettement inférieur. Les chiffres précis n'ont pas été détaillés dans la source, mais le gain de performance est décrit comme « doublé » et « nouveau SOTA ».

Disponibilité

Le framework est disponible en tant qu'espace Hugging Face. L'article de blog détaillant l'architecture et les choix de conception se trouve au lien ci-dessous. Les contributions et extensions de la communauté sont encouragées.

À qui s'adresse-t-il : Aux chercheurs et développeurs construisant des flux de travail agentiques pour les domaines scientifiques, en particulier la physique théorique.

📖 Lire la source complète : r/LocalLLaMA

Ad

👀 See Also

Proposition Claude : Mémoire de portée et isolation hermétique des instances
Tools

Proposition Claude : Mémoire de portée et isolation hermétique des instances

Proposition formelle à Anthropic d'un utilisateur avancé : mémoire à portée globale/locale et isolation hermétique d'instance pour Claude, permettant des sessions déterministes et auditées.

OpenClawRadar
L'extension Microsoft DebugMCP pour VS Code confère aux agents IA des capacités de débogage.
Tools

L'extension Microsoft DebugMCP pour VS Code confère aux agents IA des capacités de débogage.

Microsoft DebugMCP est une extension VS Code qui expose le débogueur complet de VS Code aux agents d'IA de codage via le Model Context Protocol (MCP), leur permettant de définir des points d'arrêt, d'exécuter le code pas à pas, d'inspecter des variables et d'évaluer des expressions.

OpenClawRadar
Deblank : Outil pour Supprimer le Formatage du Code afin de Réduire les Tokens des LLM
Tools

Deblank : Outil pour Supprimer le Formatage du Code afin de Réduire les Tokens des LLM

Deblank est un outil open-source qui supprime la mise en forme du code (indentation, espaces, sauts de ligne) avant de l'envoyer aux LLM, réduisant les tokens d'environ 30 % pour Java/C++ et d'environ 9 % pour Python, avec une latence d'environ 76 ms. Il prend en charge Python, Java, C/C++, C#, JS/TS et Go.

OpenClawRadar
Mneme : un accrochage PreToolUse qui bloque les modifications de Claude Code violant les décisions architecturales
Tools

Mneme : un accrochage PreToolUse qui bloque les modifications de Claude Code violant les décisions architecturales

Mneme est un hook PreToolUse pour Claude Code qui vérifie chaque édition/écriture/multi-édition par rapport à un fichier de décisions local avant toute écriture sur disque, bloquant les violations sans intervention manuelle.

OpenClawRadar