ИИ-подсчет углеводов провалил воспроизводимость: 27 тысяч запросов показали разброс в 429 г на одном фото

✍️ OpenClawRadar📅 Опубликовано: 29 апреля 2026 г.🔗 Source
ИИ-подсчет углеводов провалил воспроизводимость: 27 тысяч запросов показали разброс в 429 г на одном фото
Ad

Недавно опубликованный препринт протестировал четыре AI-модели — OpenAI GPT-5.4, Anthropic Claude Sonnet 4.6, Google Gemini 2.5 Pro и Google Gemini 3.1 Pro — на простой задаче: оценить количество углеводов по фотографиям еды. Одни и те же 13 фото, один и тот же промпт, одни и те же настройки, повторённые более 500 раз для каждой модели (всего 26 904 запроса). Результаты показывают, что даже при минимальном уровне случайности воспроизводимость сильно различается между моделями.

Ключевые выводы

  • Максимальный разброс: оценки Gemini 2.5 Pro для одного фото паэльи варьировались от 55 г до 484 г — разница в 429 г. При соотношении инсулина к углеводам 1:10 это 42,9 единицы инсулина. Потенциально смертельно.
  • Медианное отклонение (CV): Claude 2,4%, GPT-5.4 8,4%, Gemini 3.1 Pro 10,3%, Gemini 2.5 Pro 11,0%.
  • Медианное колебание инсулина: Claude 0,9 ЕД, GPT-5.4 2,3 ЕД, Gemini 3.1 Pro 2,9 ЕД, Gemini 2.5 Pro 4,7 ЕД.
  • Максимальное колебание инсулина: Claude 13,6 ЕД, GPT-5.4 16,6 ЕД, Gemini 3.1 Pro 16,2 ЕД, Gemini 2.5 Pro 42,9 ЕД.

Проблема «точно неправильно»

Три модели (Claude, Gemini 2.5 Pro, Gemini 3.1 Pro) независимо сошлись на ~28 г для бутерброда с сыром при эталонном значении 40 г (на упаковке указано 20 г на ломтик хлеба). Claude показал всего 0,3% CV в 510 запросах, но каждый запрос занижал результат на 12 г — постоянная недодозировка ~1,2 ЕД. GPT-5.4 ушёл в другую сторону, показывая в среднем ~74 г с высокой вариативностью.

Ad

Ошибки идентификации еды

  • Тарт с ягодами: Claude в 100% случаев назвал его «Линцер торте». GPT-5.4 называл «джемовым тартом» или «кексом». Только Gemini 3.1 Pro правильно идентифицировал его (99,8%).
  • Крема каталана: Три из четырёх моделей в 100% случаев назвали её «крем-брюле». Gemini 3.1 Pro дал правильный ответ только в 3,4% запросов.
  • Бутерброд с сыром: Gemini 3.1 Pro в 17,4% запросов «галлюцинировал» наличие мясной нарезки — потенциально завышая оценку углеводов.

Риск дозирования инсулина

Для пяти изображений с надёжными эталонными значениями Claude был единственной моделью, у которой ни один запрос не попал в зоны «клинически значимой» (ошибка 2–5 ЕД) или «высокого риска гипогликемии» (ошибка >5 ЕД). 100% запросов Claude оказались в безопасной или умеренной зонах. Другие модели выдавали опасные выбросы для каждого изображения.

Главный вывод: единственное число от любого AI-приложения для подсчёта углеводов не даёт пользователю представления о лежащем в основе распределении оценок. Высокая согласованность (Claude) не гарантирует точность. Низкая согласованность (Gemini) может дать любой результат. Производственные системы должны учитывать эту вариативность.

📖 Читать полный источник: HN AI Agents

Ad

👀 Смотрите также

🦀
Новости

Claude Opus 5.5: на 40% дешевле Opus 5, 66,4% на Terminal-Bench 4.0

Claude Opus 5.5 от Anthropic лидирует в Terminal-Bench 4.0 с результатом 66,4% и снижает цену до $4/$20 за миллион токенов — чтение кэша подешевело на 60% до $0,20/M. Вывод стал на 30% быстрее, а пятичасовые лимиты на Pro/Max/Team увеличены.

OpenClawRadar
Дебат MCP против навыков: Понимание ролей и реальная проблема распада контекста
Новости

Дебат MCP против навыков: Понимание ролей и реальная проблема распада контекста

В посте на Reddit поясняется, что MCP предоставляет инструменты, аутентификацию и управление контекстом для ИИ-агентов, в то время как Skills — это переиспользуемые промпты, определяющие поведение агента. Автор утверждает, что оба компонента необходимы, и выделяет проблему "контекстного распада" как критическую, когда агенты забывают инструкции.

OpenClawRadar
Anthropic удаляет доступ к содержимому писем Gmail из коннектора Claude
Новости

Anthropic удаляет доступ к содержимому писем Gmail из коннектора Claude

Anthropic удалил инструменты gmail_read_message и gmail_search_messages из коннектора Gmail, заменив их на get_thread и search_threads, которые больше не возвращают тела сообщений или содержимое вложений.

OpenClawRadar
🦀
Новости

Debian голосует по политике вкладов в ИИ/LLM: что нужно знать разработчикам

Проект Debian начал голосование о будущем вкладов ИИ/LLM. Исход определит, как обрабатывать код, созданный ИИ, в пакетах Debian.

OpenClawRadar