Eine Fehlausrichtung der KI in der Mathematik: Tao, der Economist und eine HN-Debatte mit 622 Kommentaren
Am 11. September 2026 erschienen sowohl auf Terry Taos Blog als auch in The Economist Beiträge zum selben Thema: KI-Fehlausrichtung in der Mathematik. Der Hacker-News-Thread, der beide zusammenführte, erreichte 560 Punkte und 622 Kommentare – die Diskussion leistet hier die eigentliche Arbeit, denn die Originalbeiträge sind upstream hinter einer Paywall, und die technische Substanz steckt in den HN-Kommentaren.
Worüber tatsächlich gestritten wird
Es geht um Fehlausrichtung, nicht um Fähigkeiten. Die Sorge ist nicht, dass LLMs schlecht in Mathematik sind – sondern dass die Anreize rund um KI-gestützte Mathematik in eine andere Richtung zeigen als in Richtung Mathematik. Konkret sind die Behauptungen, die in dieser Debatte kursieren:
- Formalisierungsdruck: Lean 4 und Mathlib haben maschinell prüfbare Beweise praktikabel gemacht, was verändert, was „fertig“ bedeutet. Ein LLM, das eine plausibel aussehende Beweisskizze produziert, ist nicht dasselbe wie eines, das einen kompilierbaren Beweis liefert.
- Benchmark-Verdrängung: Tools wie AlphaProof und AlphaGeometry punkten bei Wettbewerbsaufgaben (im IMO-Stil). Das ist ein enges, klar spezifiziertes Ziel. Forschungsmathematik ist das nicht.
- Review-Engpass: Wenn KI die Beweisgenerierung schneller beschleunigt, als Menschen sie verifizieren können, entsteht ein wachsender Rückstand unverifizierter Behauptungen – das Gegenteil dessen, was Formalisierung eigentlich bringen soll.
- Credit und Zuschreibung: Taos eigene Argumentation dreht sich eher darum, wo menschliches Urteilsvermögen weiterhin im Loop sitzen muss – und was passiert, wenn es das nicht tut.
Warum Entwickler das interessieren sollte
Das Muster lässt sich verallgemeinern. Wer schon einmal einen Agenten ausgeliefert hat, der Code schreibt, kennt den Fehlermodus: Das Modell produziert etwas syntaktisch Gültiges und semantisch Falsches, und die Kosten verschieben sich vom Schreiben zum Reviewen. Mathematik ist der sauberste Testfall, weil sie einen Verifier hat – Lean, Coq, Isabelle –, dem Vibes egal sind. Wenn Fehlausrichtung schon dort auftritt, tritt sie überall sonst zuerst auf.
Der HN-Thread ist das nützliche Artefakt. 622 Kommentare zu einem paywalled Beitragspaar bedeuten normalerweise, dass die eigentlichen Argumente in den Kommentaren stecken. Lest ihn.
📖 Read the full source: HN LLM Tools
👀 Siehe auch

Mistral AI übernimmt Emmi AI zum Aufbau eines KI-Stacks für das Industrieingenieurwesen
Mistral AI übernimmt Emmi AI und integriert Physics-AI-Modelle für industrielle Simulation in den Bereichen Energie, Automobil, Halbleiter und Luft- und Raumfahrt. Das kombinierte Team von über 30 Forschern wird ein neues Büro in Linz eröffnen.

Xiaomi veröffentlicht MiMo-V2.5-Pro als Open Source: Nähert sich Claude Opus 4.6 bei Programmier-Benchmarks
Xiaomi hat MiMo-V2.5-Pro veröffentlicht, ein Open-Source-Coding-Modell, das bei einem Universitäts-Compiler-Projekt 233/233 Punkte erzielte, eigenständig einen Videoeditor entwickelte und auf SWE-Bench und Terminal-Bench innerhalb der besten 1% von Claude Opus 4.6 liegt.

Das Bauen-vs.-Kaufen-Paradoxon im Zeitalter der KI-Agenten
Entwickler, die 100 $/Stunde verdienen, verbringen regelmäßig 10+ Stunden mit der Erstellung mit Claude und n8n, um 30–50 $/Monat für ein funktionierendes Produkt zu vermeiden, und ignorieren dabei die Opportunitätskosten von über 1.000 $.

Grammatikbasierte Methode übertrifft oder hält mit KI in Autorenanalyse Schritt
Eine Studie der University of Manchester ergab, dass LambdaG, eine grammatikbasierte Methode zur Autorschaftsanalyse, in den meisten Testdatensätzen mit führenden KI-Systemen gleichzog oder sie übertraf, während es größere Transparenz und geringere Rechenkosten bietet.