Lathoa: детское математическое приложение, где ИИ специально ошибается

✍️ OpenClawRadar📅 Опубликовано: 1 октября 2026 г.🔗 Source
Ad

Lathoa — это приложение для практики по математике для детей примерно от 10 до 14 лет. Робот по имени Эррол проходит математическую задачу шаг за шагом, и один из этих шагов намеренно неверный. Задача ребёнка — найти плохой шаг и объяснить, что с ним не так. Иногда всё правильно — так что просто нажимать «здесь ошибка» каждый раз не получится. На главной странице есть играбельный пример без регистрации.

Как работает подсчёт очков

  • Если пользователь находит настоящую ошибку, ей нужно ввести объяснение, чтобы получить дополнительные XP.
  • Скорость также влияет на счёт — более быстрые ответы приносят больше очков.
  • Прямого взаимодействия или чата с LLM нет; ребёнок никогда не пишет запросы модели.

Самое сложное: заставить модель ошибаться намеренно

Автор отмечает контринтуитивный вывод: заставить LLM ошибаться намеренно трудно. Примерно в половине случаев модель даёт правильный ответ и помечает его как неверный или выдаёт «ошибку», которая на самом деле правильна. Это вынудило создать конвейер проверки, прежде чем какой-либо пример попадёт к ребёнку.

Ad

Конвейер оценки

  • Простая арифметическая проверка заново выполняет вычисления там, где это возможно.
  • Вторая модель решает ту же задачу без просмотра работы Эррола. Если две модели расходятся, пример отбрасывается.
  • Стенд Lathoa описывается как стабильный, с множеством этапов оценки для выявления несоответствий и промпт-инъекций.
  • Известное слабое место: вторая модель может совершить ту же ошибку, что и первая. Арифметическая проверка существует, чтобы это поймать.
  • Сейчас эта арифметическая проверка работает только на английских примерах. В немецком и греческом для десятичных дробей используется запятая, и парсинг пока не настроен правильно.

Открытый педагогический вопрос

Настоящий вопрос автора — учит ли поиск чужой ошибки чему-то, чему не учит самостоятельное решение задачи. Он не уверен и хочет услышать мнение учителей. Если вы работаете с этой возрастной группой, это та тема, где стоит высказаться.

Стоит отметить для всех, кто создаёт похожие инструменты: шаблон «две модели + символьная проверка» здесь — разумный образец для любой задачи, где нужен проверяемо конкретный результат, а не просто правдоподобный. Режим отказа — модель-верификатор разделяет ту же слепую зону, что и генератор, — это классическое ограничение, которое нужно обойти при проектировании, и этот проект открыто его называет.

📖 Читать полный источник: HN LLM Tools

Ad

👀 Смотрите также

Основатель AgentMail рассказывает об адаптации для агентов после того, как OpenClaw раскрыл блокировку CAPTCHA
Инструменты

Основатель AgentMail рассказывает об адаптации для агентов после того, как OpenClaw раскрыл блокировку CAPTCHA

AgentMail, email API для ИИ-агентов, перестроил процесс адаптации после того, как его собственный агент OpenClaw не справился с CAPTCHA от Cloudflare. Новая система предлагает единую REST-точку для программного создания аккаунтов, сохраняя при этом участие человека для верификации.

OpenClawRadar
Предоставление Клоду локальной LLM в качестве ассистента через MCP на Mac
Инструменты

Предоставление Клоду локальной LLM в качестве ассистента через MCP на Mac

Разработчик подключает Claude к локальной Qwen 2.5 Coder 14B через Ollama и MCP, создавая бесплатного ассистента для делегирования задач, таких как обработка текста и работа с большими файлами.

OpenClawRadar
Krasis: гибридная среда выполнения для больших моделей MoE на CPU/GPU демонстрирует скорость предзаполнения 3,324 ток/с на RTX 5080
Инструменты

Krasis: гибридная среда выполнения для больших моделей MoE на CPU/GPU демонстрирует скорость предзаполнения 3,324 ток/с на RTX 5080

Krasis — это гибридная среда выполнения CPU/GPU, предназначенная для работы с большими моделями типа Mixture-of-Experts (MoE). Она обрабатывает предварительное заполнение на GPU, а декодирование — на CPU, достигая скорости 3324 токена/с на RTX 5080 с моделью Qwen3-Coder-Next 80B Q4. Для работы требуется примерно в 2,5 раза больше оперативной памяти, чем размер модели, что позволяет запускать модели, слишком большие для видеопамяти.

OpenClawRadar
PhantomCrowd: Мультиагентный симулятор аудитории с использованием Claude Code
Инструменты

PhantomCrowd: Мультиагентный симулятор аудитории с использованием Claude Code

PhantomCrowd — это маркетинговая многокомпонентная система прогнозирования, которая моделирует реакцию реальной аудитории на контент перед его публикацией. Она генерирует 10–500 персонажей с уникальными демографическими данными и личностными характеристиками, каждый из которых независимо реагирует на контент, такой как рекламные тексты или посты в соцсетях.

OpenClawRadar