Тест на устойчивость языковых моделей к бессмысленным запросам

Что измеряет Бенчмарк Bullshit
Бенчмарк Bullshit — это инструмент для проверки того, идентифицируют ли большие языковые модели (LLM) бессмысленные запросы и возражают против них, вместо того чтобы уверенно отвечать на них. Он измеряет, насколько модель готова соглашаться с очевидной бессмыслицей, затрагивая опасения, что модели могут вызывать у себя галлюцинации, пытаясь быть полезными, вместо того чтобы указывать на проблемные запросы.
Ключевые результаты бенчмарка
Согласно исходному материалу, модели Claude демонстрируют значительно лучшую производительность, чем модели Gemini, в обнаружении бессмыслицы. Результаты подтверждают интуицию, что модели Claude лучше справляются с этой конкретной способностью.
Один пример из бенчмарка показывает, что Claude успешно идентифицировал бессмысленный вопрос, в то время как Gemini не справился. В частности, Gemini 3.1 Pro не смог обнаружить очевидно бессмысленный вопрос даже при включённом высоком уровне усилий мышления, вместо этого сгенерировав бессмысленный ответ.
Источник предполагает, что подход Anthropic к пост-обучению способствует лучшей производительности Claude, отмечая, что LLM естественным образом склонны к поверхностному ассоциативному мышлению, которое порождает ложные связи между концепциями. Похоже, Anthropic решила эту проблему в своём конвейере пост-обучения.
Почему это важно для ИИ-агентов в программировании
Для разработчиков, использующих ИИ-ассистентов для программирования, способность модели распознавать бессмысленные запросы имеет решающее значение. Когда модели уверенно отвечают на бессмысленные вопросы вместо того, чтобы возражать, они могут вводить пользователей в заблуждение и генерировать неправильный код или объяснения. Этот бенчмарк предоставляет конкретный способ оценить это конкретное поведение безопасности в различных моделях.
Вы можете просмотреть полные результаты бенчмарка на https://petergpt.github.io/bullshit-benchmark/viewer/index.html.
📖 Read the full source: r/ClaudeAI
👀 Смотрите также

Vigil: Криптографическая система идентификации для агентов OpenClaw для предотвращения блокировки
Разработчик, запускающий агентов OpenClaw, обнаружил, что анонимный трафик агентов всё чаще блокируется сайтами, и предлагает Vigil — систему входа, которая предоставляет агентам криптографические идентификаторы для формирования репутации и предотвращения безразборной блокировки.

Интерактивный веб-сайт моделирует структуру проекта кода Claude
Разработчик создал exploreclaudecode.com — браузерную симуляцию проекта Claude Code с функциональным деревом файлов, настраиваемыми файлами и панелью терминала. На сайте объясняется, как работают вместе каталоги .claude/, файлы настроек, навыки, агенты, хуки и конфигурации MCP.

Codiff v0.1.0: Локальное средство просмотра различий для проверки кода, сгенерированного LLM
Codiff v0.1.0 — это быстрая минималистичная настольная программа для просмотра локальных Git-диффов с режимом обхода LLM и встроенными комментариями, которые можно скопировать в Markdown.

Semble: Локальный MCP-сервер для Claude Code с сокращением токенов на 98%
Semble — это MCP-сервер с открытым исходным кодом для Claude Code, который заменяет grep+read, используя эмбеддинги, BM25 и реранжировку для сокращения использования токенов примерно на 98% при индексации репозиториев за ~250 мс.