Interné en physique chez Hugging Face : Un cadre multi-agent double les performances de Gemini sur le benchmark CritPt
Hugging Face a publié physics-intern, un framework multi-agents open source conçu pour la recherche en physique théorique. Il imite le processus de recherche scientifique en décomposant des problèmes complexes en tâches ciblées confiées à des sous-agents spécialisés—notamment des agents de calcul, de vérification des affirmations et de défi stratégique de recherche.
Architecture et flux de travail
Le framework décompose les problèmes de niveau recherche en plusieurs sous-tâches, chacune traitée par un sous-agent dédié :
- Agent de calcul : Effectue les calculs numériques et les simulations.
- Agent de vérification : Évalue la justesse et la cohérence des affirmations.
- Agent de défi stratégique : Critique l'orientation générale de la recherche et propose des alternatives.
Ce harnais agentique est conçu pour être indépendant du domaine, mais a été spécifiquement ajusté pour la physique théorique.
Performances sur les benchmarks
Sur le benchmark CritPt (analyse des points critiques en physique), physics-intern a doublé les performances des modèles Gemini et a obtenu un nouveau résultat de pointe, dépassant GPT-5.5 Pro—le tout à un coût nettement inférieur. Les chiffres précis n'ont pas été détaillés dans la source, mais le gain de performance est décrit comme « doublé » et « nouveau SOTA ».
Disponibilité
Le framework est disponible en tant qu'espace Hugging Face. L'article de blog détaillant l'architecture et les choix de conception se trouve au lien ci-dessous. Les contributions et extensions de la communauté sont encouragées.
À qui s'adresse-t-il : Aux chercheurs et développeurs construisant des flux de travail agentiques pour les domaines scientifiques, en particulier la physique théorique.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

Agent-Xray : Outil open-source pour déboguer les défaillances des agents IA à partir des journaux de traces
Agent-Xray est un outil open-source sous licence MIT qui analyse les journaux de traces des agents IA pour classer les échecs en catégories comme spin, tool_bug et early_abort, et inclut un mode d'application pour tester les correctifs contre des défis adverses.

Développé un logiciel de comptabilité forensique avec mon père — CaseTrail automatise la détection des fraudes financières
Un duo père-fils a développé CaseTrail, un outil de comptabilité judiciaire basé sur l'IA qui ingère les relevés bancaires et identifie les anomalies. L'article détaille l'intégration avec les LLM pour l'analyse des transactions.

Ghostbar : un client IA Swift natif macOS d'environ 5 Mo qui se cache du partage d'écran
Ghostbar est un client IA natif Swift pour la barre de menus macOS (~5 Mo) qui utilise window.sharingType = .none pour devenir invisible aux enregistreurs d'écran. Fonctionne avec Ollama, vLLM, llama.cpp et tout backend compatible OpenAI.

Ouroboros ajoute un mode d'entretien PM pour Claude Code afin de combler l'écart de spécifications
Ouroboros inclut désormais un mode PM qui exécute un entretien guidé avant de passer le relais à Claude Code, posant des questions telles que : quel problème est résolu, pour qui, et quelles contraintes sont importantes. Le résultat est un document PRD/PM avec objectif, histoires utilisateur, contraintes, critères de réussite, hypothèses et éléments reportés.