Тест на устойчивость языковых моделей к бессмысленным запросам

Что измеряет Бенчмарк Bullshit
Бенчмарк Bullshit — это инструмент для проверки того, идентифицируют ли большие языковые модели (LLM) бессмысленные запросы и возражают против них, вместо того чтобы уверенно отвечать на них. Он измеряет, насколько модель готова соглашаться с очевидной бессмыслицей, затрагивая опасения, что модели могут вызывать у себя галлюцинации, пытаясь быть полезными, вместо того чтобы указывать на проблемные запросы.
Ключевые результаты бенчмарка
Согласно исходному материалу, модели Claude демонстрируют значительно лучшую производительность, чем модели Gemini, в обнаружении бессмыслицы. Результаты подтверждают интуицию, что модели Claude лучше справляются с этой конкретной способностью.
Один пример из бенчмарка показывает, что Claude успешно идентифицировал бессмысленный вопрос, в то время как Gemini не справился. В частности, Gemini 3.1 Pro не смог обнаружить очевидно бессмысленный вопрос даже при включённом высоком уровне усилий мышления, вместо этого сгенерировав бессмысленный ответ.
Источник предполагает, что подход Anthropic к пост-обучению способствует лучшей производительности Claude, отмечая, что LLM естественным образом склонны к поверхностному ассоциативному мышлению, которое порождает ложные связи между концепциями. Похоже, Anthropic решила эту проблему в своём конвейере пост-обучения.
Почему это важно для ИИ-агентов в программировании
Для разработчиков, использующих ИИ-ассистентов для программирования, способность модели распознавать бессмысленные запросы имеет решающее значение. Когда модели уверенно отвечают на бессмысленные вопросы вместо того, чтобы возражать, они могут вводить пользователей в заблуждение и генерировать неправильный код или объяснения. Этот бенчмарк предоставляет конкретный способ оценить это конкретное поведение безопасности в различных моделях.
Вы можете просмотреть полные результаты бенчмарка на https://petergpt.github.io/bullshit-benchmark/viewer/index.html.
📖 Read the full source: r/ClaudeAI
👀 Смотрите также

Sponsio: Детерминированные защитные барьеры для OpenClaw — блокировка «легальных, но неправильных» вызовов инструментов
Инструмент с открытым исходным кодом, который располагается на границе инструментов и оценивает каждый вызов с помощью контрактов темпоральной логики (~0,14 ms p50). Запрещает агентам редактировать файлы за пределами рабочего каталога, выполнять force-push или запускать миграции в неправильной базе данных.

Сервер MCP для контекста кодовой базы с упаковкой по глубине
Новый MCP-сервер упаковывает контекст кодовой базы на 5 уровнях глубины в рамках лимита токенов, решая проблему, когда ИИ-агенты для программирования либо загружают слишком мало файлов, либо получают плоскую карту репозитория без фактического содержимого.

Claude Code Ultracode Mode запускает 70-агентный конвейер для глубокого поиска
Один запрос «глубокого поиска» в режиме ultracode от Claude Code автоматически создал конвейер из 4 этапов с ~70 агентами, каждый из которых независимо извлекал и перекрестно проверял проекты. Скрипт-оркестратор держит промежуточные результаты вне контекстного окна, предотвращая перегрузку контекста.

Деклован: Сообщества-ориентированный сканер вредоносного ПО OpenClaw
Declawed — это новый сканер вредоносного ПО SKILL.md для OpenClaw, ориентированный на обнаружение произвольной инъекции команд, вредоносного контента и кражи информации в навыках ClawHub.