Lathoa: Eine Mathe-App für Kinder, bei der die KI absichtlich Fehler macht
Lathoa ist eine Mathe-Übungs-App für Kinder zwischen etwa 10 und 14 Jahren. Eine Roboterfigur namens Errol geht eine Matheaufgabe Schritt für Schritt durch, und einer dieser Schritte ist absichtlich falsch. Die Aufgabe des Kindes ist es, den fehlerhaften Schritt zu erkennen und zu erklären, was daran falsch ist. Manchmal ist nichts falsch – also funktioniert es nicht, einfach immer auf „Da ist ein Fehler“ zu tippen. Auf der Startseite gibt es einen spielbaren Fall ohne Anmeldung.
Wie die Punktevergabe funktioniert
- Wenn der Nutzer einen echten Fehler findet, muss er eine Erklärung eingeben, um zusätzliche XP zu erhalten.
- Auch die Geschwindigkeit fließt in die Punktzahl ein – schnellere Antworten bringen mehr Punkte.
- Es gibt keine direkte Interaktion oder Unterhaltung mit einem LLM; das Kind gibt niemals einen Prompt an ein Modell.
Das Schwierige: das Modell absichtlich falsch machen
Der Autor hebt die kontraintuitive Erkenntnis hervor: Ein LLM dazu zu bringen, absichtlich falsch zu liegen, ist schwierig. Etwa die Hälfte der Zeit gibt das Modell die richtige Antwort und kennzeichnet sie als falsch, oder es erzeugt einen „Fehler“, der tatsächlich korrekt ist. Das erzwang eine Verifikationspipeline, bevor ein Fall ein Kind erreicht.
Evaluierungspipeline
- Ein einfacher arithmetischer Check rechnet die Mathematik wo möglich exakt nach.
- Ein zweites Modell löst dasselbe Problem, ohne Errols Arbeit zu sehen. Wenn die beiden Modelle uneinig sind, wird der Fall verworfen.
- Lathoas Testumgebung wird als stabil beschrieben, mit vielen Evaluierungsschritten, um Inkonsistenzen und Prompt-Injections zu erkennen.
- Bekannte Schwachstelle: Das zweite Modell kann denselben Fehler machen wie das erste. Der arithmetische Check soll das abfangen.
- Dieser arithmetische Check funktioniert derzeit nur bei englischen Fällen. Deutsch und Griechisch verwenden ein Komma für Dezimalzahlen, und das Parsing stimmt noch nicht.
Die offene pädagogische Frage
Die eigentliche Frage des Autors ist, ob das Finden von Fehlern anderer etwas lehrt, was das eigene Lösen des Problems nicht vermittelt. Er ist sich nicht sicher und möchte von Lehrkräften hören. Wenn Sie mit dieser Altersgruppe arbeiten, ist das der Thread, in dem Sie sich einbringen können.
Erwähnenswert für alle, die ähnliche Tools bauen: Das Muster aus zwei Modellen plus symbolischem Check ist eine vernünftige Vorlage für jede Aufgabe, bei der Sie eine verifizierbar spezifische Ausgabe benötigen, nicht nur eine plausible. Der Fehlermodus – ein Verifizierermodell, das denselben blinden Fleck hat wie der Generator – ist die klassische Einschränkung, um die herum man designen muss, und dieses Projekt benennt sie offen.
📖 Read the full source: HN LLM Tools
👀 Siehe auch

Spectr: Ein MCP, das App-Spezifikationen aus Bildschirmaufnahmen für pixelgenaue Claude-Klone schreibt
Spectr ist ein MCP-Server, CLI und Claude Code Skill, der eine .mp4/.mov-Bildschirmaufnahme einer iOS-App nimmt und eine 7-teilige spec.md mit Hex-Codes, Schriftgewichten, Abständen, Übergängen und Navigationsgraphen generiert – und damit die 30-minütige manuelle Spezifikation pro Bildschirm überflüssig macht.

CC-Ledger: Verfolgen Sie Claude-Code-Kosten pro Sitzung und PR mit lokalem SQLite
CC-Ledger ist ein Rust-Binärprogramm, das in Claude Code eingreift und jede Anfrage in einer lokalen SQLite-Datenbank protokolliert. Erfassen Sie ausufernde Sitzungen live und erhalten Sie Kostenaufschlüsselungen pro PR, ohne einen API-Schlüssel zu benötigen. Enthält macOS-Menüleiste, Web-Dashboard und CLI-Ansichten.

Career-Ops Fork fügt LinkedIn-Job-Entdeckung mit Apify hinzu
Ein Entwickler hat das career-ops Claude Code-System geforkt und LinkedIn-Jobsuche mit Apify hinzugefügt, um die Hauptbeschränkung des ursprünglichen Projekts zu beheben, das nur vorkonfigurierte Karriereseiten von Unternehmen durchsuchte.

Einführung in Xrouter: Ein intelligenter hybrider LLM-Router zur Optimierung von Kosten und Leistung.
Entdecken Sie Xrouter, eine Open-Source-Kreation, die lokale mit Cloud-Inferenz dynamisch integriert und darauf abzielt, die KI-Kosten zu senken, während die Effizienz gesteigert wird.