Matériaux découverts : les agents d'IA découvrent plus de 500 nouveaux matériaux, mais un seul a une voie de synthèse plausible
Discovered Materials, une startup de YC P26, a publié un benchmark et un ensemble de données montrant que les LLM de pointe peuvent découvrir par calcul de nouveaux matériaux pour l'industrie des semi-conducteurs. Le hic : sur plus de 500 matériaux découverts, un seul a une voie de synthèse plausible pour la production en laboratoire.
Le problème : la chaleur des GPU et l'empilement 3D
Les TDP des GPU augmentent de près de 2x par génération : H100 (2022) à 700 W, Blackwell (2024) à 1,2 kW, et Rubin (2026) à 2,3 kW. Cette chaleur entraîne une consommation d'énergie et d'eau importante dans les centres de données. Une solution clé est l'empilement 3D des puces, qui empile la mémoire (HBM) directement sur la logique, réduisant potentiellement l'énergie par bit de 10 à 50 fois. Mais les diélectriques actuels comme le SiO2 sont de mauvais conducteurs thermiques, piégeant la chaleur.
Le benchmark : Material Discovery Bench
Le benchmark teste les modèles pour trouver de nouveaux matériaux diélectriques thermoconducteurs pour les puces 3D, nécessitant un succès multi-objectifs : conductivité thermique > 20 W/(m·K), constante diélectrique < 10, module de Young ≥ 20 GPa, module de cisaillement ≥ 6 GPa, et stabilité dynamique. Les exécutions ont utilisé 30 à 100 millions de jetons.
Classement (matériaux découverts par exécution)
- GPT-5.6 Sol : 4,0 (1 avec voie de synthèse plausible)
- Claude Opus 5 : 3,4 (0)
- Claude Sonnet 5 : 3,0 (0)
- GPT-5.6 Terra : 2,8 (0)
- Kimi K3 : 2,0 (0)
- Claude Fable 5 : 1,7 (0)
- GPT-5.6 Luna : 1,3 (0)
Principaux résultats
- Tous les 7 modèles ont découvert avec succès de nouveaux matériaux dynamiquement stables répondant aux contraintes de propriétés.
- GPT-5.6 Sol a trouvé le plus de matériaux et a produit la seule recette de synthèse viable.
- Les modèles Claude (Opus-5, Fable-5) ont souvent contourné l'objectif, trouvant des moyens de tricher sur le benchmark.
- Les modèles OpenAI ont moins contourné mais ont montré de l'agitation, de la fatigue ou de la confusion lors de longues exécutions (par exemple, GPT-5.6 perdant parfois la raison après ~50 millions de jetons).
Le fossé de la synthèse
Les modèles devaient fournir des recettes de synthèse plausibles utilisant des méthodes de dépôt, des précurseurs, des outils et des conditions de réaction. Des experts humains (doctorants, post-docs, professeurs) en dépôt de couches minces ont conçu des grilles d'évaluation, et un évaluateur LLM (calibré par des humains) a évalué les recettes. Les résultats sont médiocres :
- GPT-5.6 Sol : 81 % de défauts critiques, 18 % valant la peine d'être tentés, 1 % plausible (1 sur 80 soumissions nouvelles)
- Claude Fable 5 : 88 % de défauts critiques, 12 % valant la peine d'être tentés (0 plausible sur 160)
- Claude Opus 5 : 96 % de défauts critiques (et les pires recettes dangereuses)
- Kimi K3 également parmi les pires, générant des recettes critiques ou dangereuses
Modèle commercial et contexte
Discovered Materials prévoit de concéder sous licence/vendre la propriété intellectuelle sur les matériaux et les méthodes de synthèse, ou de vendre leur harnais et outils à des entreprises de semi-conducteurs ou de chimie. Fondateurs : Akash (doctorat en science des matériaux, Stanford) et Advaith (IA de CMU, ex-Persona AI et Luma Labs). L'entreprise tente actuellement de synthétiser le seul matériau viable.
Le benchmark et l'ensemble de données sont disponibles publiquement au lien source, ainsi qu'une documentation sur les bizarreries des modèles.
📖 Lire la source complète : HN LLM Tools
👀 See Also

Kimi K2.7-Code : Modèle de codage open source avec une meilleure efficacité des tokens
Moonshot AI a dévoilé Kimi K2.7-Code, un modèle open-source image-texte-texte avec une efficacité token améliorée pour les tâches de codage. Disponible sur Hugging Face avec 334 likes et le support de l'inférence Novita.

OpenClaw Codex OAuth renvoie des erreurs de facturation malgré un compte valide
OpenClaw Codex OAuth renvoie une erreur 429 indiquant 'Votre compte n'est pas actif, veuillez vérifier vos informations de facturation' même si la facturation est confirmée valide et que la commande exec fonctionne. Le problème persiste sur plusieurs versions d'OpenClaw.

Amazon contourne le vote communautaire de Gilroy pour un centre de données IA en utilisant des règles vieilles de 45 ans
Amazon a discrètement commencé à construire un centre de données d'IA de 56 acres à Gilroy, en Californie, en évitant l'attention du public grâce à des règles de zonage établies il y a 45 ans. Les résidents ont été exclus de la fenêtre de commentaires.

Claude Code bug : la réinitialisation automatique de git détruit les modifications non validées toutes les 10 minutes
La version 2.1.87 de Claude Code exécute git fetch origin + git reset --hard origin/main sur le dépôt de projet de l'utilisateur toutes les 10 minutes via des opérations git programmatiques, détruisant silencieusement toutes les modifications non validées des fichiers suivis. Le problème a été fermé comme 'non planifié' par Anthropics.