Lathoa: детское математическое приложение, где ИИ специально ошибается
Lathoa — это приложение для практики по математике для детей примерно от 10 до 14 лет. Робот по имени Эррол проходит математическую задачу шаг за шагом, и один из этих шагов намеренно неверный. Задача ребёнка — найти плохой шаг и объяснить, что с ним не так. Иногда всё правильно — так что просто нажимать «здесь ошибка» каждый раз не получится. На главной странице есть играбельный пример без регистрации.
Как работает подсчёт очков
- Если пользователь находит настоящую ошибку, ей нужно ввести объяснение, чтобы получить дополнительные XP.
- Скорость также влияет на счёт — более быстрые ответы приносят больше очков.
- Прямого взаимодействия или чата с LLM нет; ребёнок никогда не пишет запросы модели.
Самое сложное: заставить модель ошибаться намеренно
Автор отмечает контринтуитивный вывод: заставить LLM ошибаться намеренно трудно. Примерно в половине случаев модель даёт правильный ответ и помечает его как неверный или выдаёт «ошибку», которая на самом деле правильна. Это вынудило создать конвейер проверки, прежде чем какой-либо пример попадёт к ребёнку.
Конвейер оценки
- Простая арифметическая проверка заново выполняет вычисления там, где это возможно.
- Вторая модель решает ту же задачу без просмотра работы Эррола. Если две модели расходятся, пример отбрасывается.
- Стенд Lathoa описывается как стабильный, с множеством этапов оценки для выявления несоответствий и промпт-инъекций.
- Известное слабое место: вторая модель может совершить ту же ошибку, что и первая. Арифметическая проверка существует, чтобы это поймать.
- Сейчас эта арифметическая проверка работает только на английских примерах. В немецком и греческом для десятичных дробей используется запятая, и парсинг пока не настроен правильно.
Открытый педагогический вопрос
Настоящий вопрос автора — учит ли поиск чужой ошибки чему-то, чему не учит самостоятельное решение задачи. Он не уверен и хочет услышать мнение учителей. Если вы работаете с этой возрастной группой, это та тема, где стоит высказаться.
Стоит отметить для всех, кто создаёт похожие инструменты: шаблон «две модели + символьная проверка» здесь — разумный образец для любой задачи, где нужен проверяемо конкретный результат, а не просто правдоподобный. Режим отказа — модель-верификатор разделяет ту же слепую зону, что и генератор, — это классическое ограничение, которое нужно обойти при проектировании, и этот проект открыто его называет.
📖 Читать полный источник: HN LLM Tools
👀 Смотрите также

Основатель AgentMail рассказывает об адаптации для агентов после того, как OpenClaw раскрыл блокировку CAPTCHA
AgentMail, email API для ИИ-агентов, перестроил процесс адаптации после того, как его собственный агент OpenClaw не справился с CAPTCHA от Cloudflare. Новая система предлагает единую REST-точку для программного создания аккаунтов, сохраняя при этом участие человека для верификации.

Предоставление Клоду локальной LLM в качестве ассистента через MCP на Mac
Разработчик подключает Claude к локальной Qwen 2.5 Coder 14B через Ollama и MCP, создавая бесплатного ассистента для делегирования задач, таких как обработка текста и работа с большими файлами.

Krasis: гибридная среда выполнения для больших моделей MoE на CPU/GPU демонстрирует скорость предзаполнения 3,324 ток/с на RTX 5080
Krasis — это гибридная среда выполнения CPU/GPU, предназначенная для работы с большими моделями типа Mixture-of-Experts (MoE). Она обрабатывает предварительное заполнение на GPU, а декодирование — на CPU, достигая скорости 3324 токена/с на RTX 5080 с моделью Qwen3-Coder-Next 80B Q4. Для работы требуется примерно в 2,5 раза больше оперативной памяти, чем размер модели, что позволяет запускать модели, слишком большие для видеопамяти.

PhantomCrowd: Мультиагентный симулятор аудитории с использованием Claude Code
PhantomCrowd — это маркетинговая многокомпонентная система прогнозирования, которая моделирует реакцию реальной аудитории на контент перед его публикацией. Она генерирует 10–500 персонажей с уникальными демографическими данными и личностными характеристиками, каждый из которых независимо реагирует на контент, такой как рекламные тексты или посты в соцсетях.