ИИ-подсчет углеводов провалил воспроизводимость: 27 тысяч запросов показали разброс в 429 г на одном фото

✍️ OpenClawRadar📅 Опубликовано: 29 апреля 2026 г.🔗 Source
ИИ-подсчет углеводов провалил воспроизводимость: 27 тысяч запросов показали разброс в 429 г на одном фото
Ad

Недавно опубликованный препринт протестировал четыре AI-модели — OpenAI GPT-5.4, Anthropic Claude Sonnet 4.6, Google Gemini 2.5 Pro и Google Gemini 3.1 Pro — на простой задаче: оценить количество углеводов по фотографиям еды. Одни и те же 13 фото, один и тот же промпт, одни и те же настройки, повторённые более 500 раз для каждой модели (всего 26 904 запроса). Результаты показывают, что даже при минимальном уровне случайности воспроизводимость сильно различается между моделями.

Ключевые выводы

  • Максимальный разброс: оценки Gemini 2.5 Pro для одного фото паэльи варьировались от 55 г до 484 г — разница в 429 г. При соотношении инсулина к углеводам 1:10 это 42,9 единицы инсулина. Потенциально смертельно.
  • Медианное отклонение (CV): Claude 2,4%, GPT-5.4 8,4%, Gemini 3.1 Pro 10,3%, Gemini 2.5 Pro 11,0%.
  • Медианное колебание инсулина: Claude 0,9 ЕД, GPT-5.4 2,3 ЕД, Gemini 3.1 Pro 2,9 ЕД, Gemini 2.5 Pro 4,7 ЕД.
  • Максимальное колебание инсулина: Claude 13,6 ЕД, GPT-5.4 16,6 ЕД, Gemini 3.1 Pro 16,2 ЕД, Gemini 2.5 Pro 42,9 ЕД.

Проблема «точно неправильно»

Три модели (Claude, Gemini 2.5 Pro, Gemini 3.1 Pro) независимо сошлись на ~28 г для бутерброда с сыром при эталонном значении 40 г (на упаковке указано 20 г на ломтик хлеба). Claude показал всего 0,3% CV в 510 запросах, но каждый запрос занижал результат на 12 г — постоянная недодозировка ~1,2 ЕД. GPT-5.4 ушёл в другую сторону, показывая в среднем ~74 г с высокой вариативностью.

Ad

Ошибки идентификации еды

  • Тарт с ягодами: Claude в 100% случаев назвал его «Линцер торте». GPT-5.4 называл «джемовым тартом» или «кексом». Только Gemini 3.1 Pro правильно идентифицировал его (99,8%).
  • Крема каталана: Три из четырёх моделей в 100% случаев назвали её «крем-брюле». Gemini 3.1 Pro дал правильный ответ только в 3,4% запросов.
  • Бутерброд с сыром: Gemini 3.1 Pro в 17,4% запросов «галлюцинировал» наличие мясной нарезки — потенциально завышая оценку углеводов.

Риск дозирования инсулина

Для пяти изображений с надёжными эталонными значениями Claude был единственной моделью, у которой ни один запрос не попал в зоны «клинически значимой» (ошибка 2–5 ЕД) или «высокого риска гипогликемии» (ошибка >5 ЕД). 100% запросов Claude оказались в безопасной или умеренной зонах. Другие модели выдавали опасные выбросы для каждого изображения.

Главный вывод: единственное число от любого AI-приложения для подсчёта углеводов не даёт пользователю представления о лежащем в основе распределении оценок. Высокая согласованность (Claude) не гарантирует точность. Низкая согласованность (Gemini) может дать любой результат. Производственные системы должны учитывать эту вариативность.

📖 Читать полный источник: HN AI Agents

Ad

👀 Смотрите также

Claude Code v2.1.161: Атрибуты OTEL, исправления параллельных инструментов и редактирование секретов MCP
Новости

Claude Code v2.1.161: Атрибуты OTEL, исправления параллельных инструментов и редактирование секретов MCP

v2.1.161 включает атрибуты ресурсов OTEL в качестве метрик, независимые результаты параллельных вызовов инструментов, редактирование секретов MCP и множество исправлений ошибок для субагентов, хуков Windows и событий журнала OpenTelemetry.

OpenClawRadar
OpenClaw AI Агент прекратил работу после сбоя атомарного добавления
Новости

OpenClaw AI Агент прекратил работу после сбоя атомарного добавления

Агент OpenClaw впал в состояние функционального паралича после неудачной попытки атомарного добавления, отказавшись продолжать какие-либо операции из-за фундаментальной ненадёжности.

OpenClawRadar
Изучение файлов, включенных в контекстное окно чата Telegram
Новости

Изучение файлов, включенных в контекстное окно чата Telegram

Присоединяйтесь к нам, чтобы лучше понять, какие файлы входят в контекстное окно чата Telegram, повышая ваши операционные знания.

OpenClawRadar
Claude Code v2.1.199 исправляет более 20 ошибок: SSL, сабагенты, крахи демона
Новости

Claude Code v2.1.199 исправляет более 20 ошибок: SSL, сабагенты, крахи демона

Claude Code v2.1.199 исправляет ошибки SSL-сертификатов, молчаливые сбои сабагентов, цикл падений демона Linux и более 20 других багов. Основные исправления: мгновенные подсказки по ошибкам SSL, сохранение частичного вывода потока и корректное распространение ошибок сабагентов.

OpenClawRadar