ThermoQA : Benchmark ouvert pour l'ingénierie thermodynamique testant les LLM sur 293 problèmes de calcul

✍️ OpenClawRadar📅 Publié: March 21, 2026🔗 Source
ThermoQA : Benchmark ouvert pour l'ingénierie thermodynamique testant les LLM sur 293 problèmes de calcul
Ad

Vue d'ensemble du benchmark ThermoQA

ThermoQA est un benchmark ouvert pour la thermodynamique technique, comprenant 293 problèmes de calcul ouverts répartis sur trois niveaux :

  • Niveau 1 : Recherches de propriétés (110 questions) — Exemple : "quelle est l'enthalpie de l'eau à 5 MPa, 400°C ?"
  • Niveau 2 : Analyse de composants (101 questions) — Turbines, compresseurs, échangeurs de chaleur avec calculs d'énergie/entropie/exergie
  • Niveau 3 : Analyse de cycle complet (82 questions) — Cycles de Rankine, Brayton, turbines à gaz à cycle combiné

Les données de référence proviennent de CoolProp (IAPWS-IF97). Pas de choix multiples — les modèles doivent produire des valeurs numériques exactes.

Résultats du classement (moyenne sur 3 exécutions)

  • 1. Claude Opus 4.6 : Niveau 1 : 96,4 %, Niveau 2 : 92,1 %, Niveau 3 : 93,6 %, Composite : 94,1 %
  • 2. GPT-5.4 : Niveau 1 : 97,8 %, Niveau 2 : 90,8 %, Niveau 3 : 89,7 %, Composite : 93,1 %
  • 3. Gemini 3.1 Pro : Niveau 1 : 97,9 %, Niveau 2 : 90,8 %, Niveau 3 : 87,5 %, Composite : 92,5 %
  • 4. DeepSeek-R1 : Niveau 1 : 90,5 %, Niveau 2 : 89,2 %, Niveau 3 : 81,0 %, Composite : 87,4 %
  • 5. Grok 4 : Niveau 1 : 91,8 %, Niveau 2 : 87,9 %, Niveau 3 : 80,4 %, Composite : 87,3 %
  • 6. MiniMax M2.5 : Niveau 1 : 85,2 %, Niveau 2 : 76,2 %, Niveau 3 : 52,7 %, Composite : 73,0 %
Ad

Principales conclusions

  • Les classements varient entre les niveaux : Gemini est en tête au Niveau 1 (97,9 %) mais chute à la 3e place au Niveau 3 (87,5 %). Opus est 3e sur les recherches mais 1er sur l'analyse de cycles, montrant que mémoriser les tables de vapeur ≠ raisonnement.
  • L'eau supercritique perturbe tout : écart de 44,5 points de pourcentage. Les modèles mémorisent les tables des manuels mais ne peuvent pas gérer les régions non linéaires près du point critique. Un modèle a donné h = 1 887 kJ/kg alors que la valeur correcte est 2 586 kJ/kg — une erreur de 27 %.
  • Le R-134a est le point aveugle : Tous les modèles chutent à 44–63 % sur les problèmes de réfrigérant contre 75–98 % sur l'eau, montrant un biais dans les données d'entraînement.
  • La cohérence d'exécution varie d'un facteur 10 : GPT-5.4 σ = ±0,1 % sur le Niveau 3 contre DeepSeek-R1 σ = ±2,5 % sur le Niveau 2.

Ressources open source

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

Les développeurs de Spotify utilisent l'IA pour des contributions sans code.
News

Les développeurs de Spotify utilisent l'IA pour des contributions sans code.

Les principaux développeurs de Spotify n'ont pas écrit de code depuis décembre grâce à l'IA, notamment via leur système interne 'Honk' qui facilite les déploiements de code à distance et en temps réel en utilisant Claude Code.

OpenClawRadar
Analyse de santé du projet : Facteur de bus et activité de validation dans les dépôts Claw/Assistant
News

Analyse de santé du projet : Facteur de bus et activité de validation dans les dépôts Claw/Assistant

Un utilisateur de Reddit a collecté des données de commit de projets majeurs de claw/assistant et a découvert que beaucoup ont un bus factor de 1, ce qui signifie qu'un seul auteur représente plus de 50% des commits. Certains projets montrent des chutes drastiques d'activité en avril.

OpenClawRadar
Difficultés d'un LLM local avec le Solitaire Unreal Engine : Qwen 3.6-27B brûle 687 000 jetons sur une carte
News

Difficultés d'un LLM local avec le Solitaire Unreal Engine : Qwen 3.6-27B brûle 687 000 jetons sur une carte

La tentative d'un développeur de construire un jeu de Solitaire dans Unreal Engine en utilisant Qwen 3.6-27B a consommé 687k tokens pour une seule carte, nécessitant des interventions manuelles pour les téléchargements PNG, la création de maillage et des invites lourdes.

OpenClawRadar
La discussion sur Reddit met en lumière le passage des chatbots aux agents autonomes avec exécution locale.
News

La discussion sur Reddit met en lumière le passage des chatbots aux agents autonomes avec exécution locale.

Un post Reddit distingue les chatbots des agents autonomes en utilisant des exemples concrets et note la tendance vers l'exécution locale avec des modèles comme LLaMA fonctionnant sur des postes de travail privés.

OpenClawRadar