EsoLang-Bench : Un benchmark de codage utilisant des langages ésotériques pour tester le raisonnement des LLM

EsoLang-Bench est un nouveau benchmark de codage conçu pour tester si les grands modèles de langage peuvent véritablement raisonner sur des problèmes ou s'ils se contentent simplement de faire du pattern-matching sur les données d'entraînement. Le benchmark utilise des langages de programmation ésotériques avec une présence minimale dans les données d'entraînement.
Conception du benchmark
Le benchmark utilise cinq langages de programmation ésotériques : Brainfuck, Befunge-98, Whitespace, Unlambda et Shakespeare. Ces langages ont été choisis car ils ont pratiquement zéro données d'entraînement dans les pipelines de pré-entraînement typiques. Le benchmark contient les mêmes problèmes algorithmiques que HumanEval sur la même gamme de difficultés, simplement traduits dans ces langages ésotériques.
Méthodologie de test
Les chercheurs ont testé cinq modèles : GPT-5.2, O4-mini, Gemini 3 Pro, Qwen3-235B et Kimi K2. Ils ont utilisé cinq stratégies d'invite, notamment :
- Auto-échafaudage
- Paires codeur-critique
- Pipeline ReAct
Résultats
Le meilleur résultat unique était de 11,2 % sur Befunge-98 avec l'auto-échafaudage. Les problèmes de difficulté Moyenne, Difficile et Très difficile sont restés à 0 % pour tous les modèles, langages et stratégies. L'invite few-shot n'a donné que +0,8 point de pourcentage en moyenne, ce que les chercheurs décrivent comme statistiquement indiscernable du bruit.
Les systèmes agentiques comme Claude Code et Codex ont obtenu des résultats 2 à 3 fois meilleurs que les approches non agentiques, mais cette amélioration provenait principalement de boucles de rétroaction plus fines et d'une meilleure gestion du contexte plutôt que d'une preuve de transfert de raisonnement réel.
Analyse des erreurs
La répartition des erreurs révèle des schémas intéressants :
- Sur Brainfuck (qui a une certaine présence en ligne), les modèles pouvaient produire une syntaxe valide mais échouaient sur la logique
- Sur Whitespace (qui a presque aucune donnée d'entraînement), les modèles ne pouvaient même pas produire de programmes valides du tout
Cela montre un écart clair entre les performances des modèles sur les langages avec des données de pré-entraînement et ceux avec pratiquement aucune.
Objectif et disponibilité
Le benchmark vise à créer des évaluations où les scores élevés sont réellement difficiles à falsifier, allant au-delà de simples problèmes plus difficiles dans des langages grand public comme Python. Les chercheurs suggèrent que cette approche crée des évaluations où l'incitation économique à tricher sur le benchmark n'existe pas, et la seule voie vers de bonnes performances est un véritable apprentissage de la généralisation.
EsoLang-Bench est disponible comme modèle pour que d'autres puissent s'en inspirer, que ce soit par de nouveaux langages, de nouveaux types de problèmes ou des domaines totalement différents hors distribution.
📖 Read the full source: r/LocalLLaMA
👀 See Also

Le mistral.rs ajoute le support de Gemma 4 12B : multimodal, agentique et MTP
mistral.rs supporte désormais Gemma 4 12B avec intégration multimodale, agentique et MTP. Installation en une ligne et exécution avec recherche web, exécution de code et interface utilisateur intégrée.

InsAIts Runtime Security Monitor for Claude Code Atteint 8 000 Téléchargements sur PyPI
InsAIts, un moniteur de sécurité d'exécution pour les sessions d'agent Claude Code, a atteint 8 140 téléchargements totaux sur PyPI. La version 3.4.0 ajoute un Gestionnaire de Contexte Adaptatif, un système d'injection d'ancres en couches et des améliorations du tableau de bord.

Plugin Peek pour Claude Code : Navigation Automatique dans la Mémoire de Session
Peek est un plugin Claude Code qui capture et injecte automatiquement les corrections et préférences des utilisateurs pour orienter l'assistant IA. Il utilise une recherche par fusion avec des embeddings, BM25, une décroissance temporelle et des filtres de métadonnées pour fournir un contexte pertinent sans sollicitation manuelle.

L'extension Claude Toolbox ajoute des signets au niveau des messages et une recherche en texte intégral
Claude Toolbox est une extension Chrome qui permet de marquer des messages individuels, de rechercher en texte intégral dans toutes les conversations et d'exporter au format TXT ou JSON. Le niveau gratuit couvre 2 conversations ; le niveau payant est à 5 $/mois ou 49 $ à vie.