Lathoa : une appli de maths pour enfants où l'IA est censée se tromper
Lathoa est une appli d'entraînement aux maths pour les enfants d'environ 10 à 14 ans. Un robot nommé Errol déroule un problème de maths étape par étape, et l'une de ces étapes est délibérément fausse. Le rôle de l'enfant est de repérer l'étape erronée et d'expliquer ce qui ne va pas. Parfois il n'y a aucune erreur — donc appuyer systématiquement sur « il y a une erreur » ne fonctionne pas. Un cas jouable est disponible sur la page d'accueil, sans inscription.
Comment fonctionne le score
- Si l'utilisateur trouve une vraie erreur, il doit saisir une explication pour gagner des XP supplémentaires.
- La rapidité compte aussi dans le score — plus la réponse est rapide, plus on gagne de points.
- Il n'y a pas d'interaction directe ni de discussion avec un LLM ; l'enfant ne fait jamais de prompt à un modèle.
Le plus difficile : faire en sorte que le modèle se trompe exprès
L'auteur souligne ce constat contre-intuitif : amener un LLM à se tromper volontairement est difficile. Environ une fois sur deux, le modèle donne la bonne réponse et l'étiquette comme fausse, ou produit une « erreur » qui est en réalité correcte. Cela a imposé une pipeline de vérification avant qu'un cas n'arrive à un enfant.
Pipeline d'évaluation
- Une simple vérification arithmétique refait le calcul exactement quand c'est possible.
- Un second modèle résout le même problème sans voir le travail d'Errol. Si les deux modèles sont en désaccord, le cas est écarté.
- Le harnais de Lathoa est décrit comme stable, avec de nombreuses étapes d'évaluation pour détecter les incohérences et les injections de prompt.
- Point faible connu : le second modèle peut commettre la même erreur que le premier. La vérification arithmétique est là pour rattraper ça.
- Cette vérification arithmétique ne fonctionne pour l'instant que sur les cas en anglais. L'allemand et le grec utilisent la virgule comme séparateur décimal, et l'analyse n'est pas encore au point.
La question pédagogique ouverte
La vraie question de l'auteur est de savoir si repérer l'erreur de quelqu'un d'autre enseigne quelque chose que résoudre le problème soi-même n'enseigne pas. Il n'en est pas sûr et aimerait avoir l'avis d'enseignants. Si vous travaillez avec cette tranche d'âge, c'est le fil de discussion où intervenir.
À noter pour quiconque construit des outils similaires : le schéma deux modèles + vérification symbolique est ici un modèle raisonnable pour toute tâche où l'on a besoin d'une sortie vérifiablement précise, et pas seulement plausible. Le mode de défaillance — un modèle vérificateur qui partage le même angle mort que le générateur — est la limitation classique autour de laquelle il faut concevoir, et ce projet la nomme ouvertement.
📖 Lire la source complète : HN LLM Tools
👀 See Also

Claude Code v2.1.144 : Sessions en arrière-plan, cadrage /modèle et délai de démarrage de 15s
Claude Code v2.1.144 ajoute /resume pour les sessions en arrière-plan, limite /model à la session en cours et corrige un blocage de 75 secondes au démarrage lorsque api.anthropic.com est inaccessible avec un délai d'attente de 15 secondes.
Keenable SELECT : Exécuter des requêtes SQL sur les résultats de recherche Web
Keenable SELECT est un serveur MCP qui vous permet d'interroger le web avec SQL. Un seul appel peut rechercher plus de 1 000 pages, filtrer avec des clauses WHERE précises et extraire des champs via LLM—le tout dans une seule instruction SELECT.

TestThread : Cadre de Test Open Source pour Agents IA
TestThread est un framework de test open source pour les agents d'IA qui exécute des tests sur des points de terminaison en direct, fournit des résultats de réussite/échec avec un diagnostic IA, et inclut des fonctionnalités comme la correspondance sémantique, la détection de PII et l'intégration CI/CD.

MCP Memory Gateway : Un serveur MCP pour la mémoire persistante dans Claude Code
Un développeur a construit un serveur MCP appelé MCP Memory Gateway en utilisant Claude Code comme principal outil de développement. Il fournit à Claude Code une mémoire persistante entre les sessions grâce à la capture de retours, des règles de prévention et l'injection de contexte.