Interné en physique chez Hugging Face : Un cadre multi-agent double les performances de Gemini sur le benchmark CritPt
Hugging Face a publié physics-intern, un framework multi-agents open source conçu pour la recherche en physique théorique. Il imite le processus de recherche scientifique en décomposant des problèmes complexes en tâches ciblées confiées à des sous-agents spécialisés—notamment des agents de calcul, de vérification des affirmations et de défi stratégique de recherche.
Architecture et flux de travail
Le framework décompose les problèmes de niveau recherche en plusieurs sous-tâches, chacune traitée par un sous-agent dédié :
- Agent de calcul : Effectue les calculs numériques et les simulations.
- Agent de vérification : Évalue la justesse et la cohérence des affirmations.
- Agent de défi stratégique : Critique l'orientation générale de la recherche et propose des alternatives.
Ce harnais agentique est conçu pour être indépendant du domaine, mais a été spécifiquement ajusté pour la physique théorique.
Performances sur les benchmarks
Sur le benchmark CritPt (analyse des points critiques en physique), physics-intern a doublé les performances des modèles Gemini et a obtenu un nouveau résultat de pointe, dépassant GPT-5.5 Pro—le tout à un coût nettement inférieur. Les chiffres précis n'ont pas été détaillés dans la source, mais le gain de performance est décrit comme « doublé » et « nouveau SOTA ».
Disponibilité
Le framework est disponible en tant qu'espace Hugging Face. L'article de blog détaillant l'architecture et les choix de conception se trouve au lien ci-dessous. Les contributions et extensions de la communauté sont encouragées.
À qui s'adresse-t-il : Aux chercheurs et développeurs construisant des flux de travail agentiques pour les domaines scientifiques, en particulier la physique théorique.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

Protocole de Mémoire d'Agent (AMP) : Spécification Ouverte pour la Mémoire Interopérable des Agents IA au-dessus de MCP
AMP définit une interface standard pour la mémoire persistante des agents compatibles MCP avec six verbes principaux : encoder, rappeler, oublier, consolider, épingler et statistiques. Comprend une suite de tests de conformité et une implémentation de référence.

Compétence Open Source pour Agents de Codage IA Parallèles avec Supervision Humaine
Définition de compétence en markdown pour exécuter des agents Claude Code en parallèle dans des worktrees git séparés, avec validation de branche d'intégration, tests de fumée et un passage humain obligatoire avant la fusion en production.

Adeu v1.4 : MCP open-source pour le suivi des modifications dans les fichiers DOCX
Adeu v1.4 injecte chirurgicalement des révisions OOXML natives dans les fichiers DOCX, en préservant le formatage, la numérotation et les mises en page. Ajoute l'édition en ligne des notes de bas de page et de fin, la vérification des termes définis, les cartes de renvois et l'aller-retour des listes à plusieurs niveaux.

Les compétences de Claude contournent silencieusement les instructions : des pièges non documentés révélés
Un utilisateur découvre que les compétences Claude imposent silencieusement des limites strictes sur les entrées utilisateur via `ask_user_input_v0` (max 3 questions, 4 options chacune), que `Write` écrase les fichiers tandis que `create_file` refuse sur Claude.ai, et que les chemins relatifs dans `references/` ne sont pas résolus. Un dépôt communautaire répertorie les résultats.