Несоответствие ИИ в математике: Тао, экономист и HN-дебаты с 622 комментариями
11 сентября 2026 года в блоге Терри Тао и в The Economist одновременно вышли материалы на одну и ту же тему: AI-misalignment в математике. Ветка на Hacker News, объединившая их, набрала 560 баллов и 622 комментария — основная работа идёт именно в обсуждении, поскольку оригинальные публикации находятся за пейволлом, а техническая суть сосредоточена в комментариях на HN.
О чём на самом деле спорят
Речь идёт о misalignment, а не о возможностях. Проблема не в том, что LLM плохо справляются с математикой, — а в том, что стимулы вокруг математики с поддержкой ИИ ведут куда-то не в математику. Конкретно в этом споре циркулируют такие утверждения:
- Давление формализации: Lean 4 и Mathlib сделали проверяемые машиной доказательства жизнеспособными, и это меняет смысл слова «готово». LLM, выдающая правдоподобный набросок доказательства, — это не то же самое, что LLM, выдающая доказательство, которое компилируется.
- Подмена бенчмарков: Инструменты вроде AlphaProof и AlphaGeometry показывают результаты на олимпиадных задачах (в стиле IMO). Это узкая, чётко очерченная цель. Исследовательская математика — нет.
- Узкое место рецензирования: Если ИИ ускоряет генерацию доказательств быстрее, чем люди успевают их проверять, возникает растущий backlog непроверенных утверждений — противоположность тому, что должна давать формализация.
- Авторство и признание: Сам Тао, как правило, говорит о том, где именно человеческое суждение всё ещё должно оставаться в цикле, и что происходит, когда его там нет.
Почему это важно разработчикам
Эта закономерность обобщается. Если вы уже выпустили агента, который пишет код, вам знаком этот сценарий отказа: модель выдаёт что-то синтаксически корректное и семантически неверное, и затраты смещаются с написания на ревью. Математика — самый чистый тестовый случай, потому что у неё есть верификатор — Lean, Coq, Isabelle, — которому всё равно на «вайбы». Если misalignment проявляется даже там, значит, везде в остальном он проявляется ещё раньше.
Ветка на HN — самый полезный артефакт. 622 комментария к паре постов за пейволлом обычно означают, что настоящие аргументы живут именно в комментариях. Прочитайте их.
📖 Read the full source: HN LLM Tools
👀 Смотрите также

Ограничения распознавания речи Claude и обходной путь пользователя с помощью Spokenly и Parakeet TDT
Пользователь сообщает, что встроенная микрофонная транскрипция Claude неточна по сравнению с ChatGPT, создавая больше работы, чем экономит. Они реализовали обходное решение с использованием Spokenly на Mac с моделью Parakeet TDT от NVIDIA для улучшения производительности.

Навигация по проблеме интеграции OpenClaw 2026.2.6-3 и OpenRouter
Пользователи OpenClaw 2026.2.6-3 в связке с OpenRouter сталкиваются с постоянными ошибками '401 Пользователь не найден'. Присоединяйтесь к обсуждению в сообществе, где они исследуют решения и делятся советами по устранению неполадок.

约束衰减:为什么LLM代理在后端结构化代码中失败
Новое исследование вводит понятие «ограничительного затухания»: по мере накопления структурных требований производительность LLM-агентов резко падает — способные агенты теряют 30 пунктов в проценте прохождения утверждений, слабые приближаются к нулю. Практические выводы для всех, кто использует AI-агентов для написания кода.

Клод AI пострадал от массового сбоя: веб-интерфейс не работает, ошибки API участились
Claude.ai недоступен, а API возвращает повышенный уровень ошибок по состоянию на 28 апреля 2025 года, 19:15 UTC. Официальная страница статуса подтверждает текущий инцидент.