Тест на устойчивость языковых моделей к бессмысленным запросам

✍️ OpenClawRadar📅 Опубликовано: 25 февраля 2026 г.🔗 Source
Тест на устойчивость языковых моделей к бессмысленным запросам
Ad

Что измеряет Бенчмарк Bullshit

Бенчмарк Bullshit — это инструмент для проверки того, идентифицируют ли большие языковые модели (LLM) бессмысленные запросы и возражают против них, вместо того чтобы уверенно отвечать на них. Он измеряет, насколько модель готова соглашаться с очевидной бессмыслицей, затрагивая опасения, что модели могут вызывать у себя галлюцинации, пытаясь быть полезными, вместо того чтобы указывать на проблемные запросы.

Ключевые результаты бенчмарка

Согласно исходному материалу, модели Claude демонстрируют значительно лучшую производительность, чем модели Gemini, в обнаружении бессмыслицы. Результаты подтверждают интуицию, что модели Claude лучше справляются с этой конкретной способностью.

Один пример из бенчмарка показывает, что Claude успешно идентифицировал бессмысленный вопрос, в то время как Gemini не справился. В частности, Gemini 3.1 Pro не смог обнаружить очевидно бессмысленный вопрос даже при включённом высоком уровне усилий мышления, вместо этого сгенерировав бессмысленный ответ.

Источник предполагает, что подход Anthropic к пост-обучению способствует лучшей производительности Claude, отмечая, что LLM естественным образом склонны к поверхностному ассоциативному мышлению, которое порождает ложные связи между концепциями. Похоже, Anthropic решила эту проблему в своём конвейере пост-обучения.

Ad

Почему это важно для ИИ-агентов в программировании

Для разработчиков, использующих ИИ-ассистентов для программирования, способность модели распознавать бессмысленные запросы имеет решающее значение. Когда модели уверенно отвечают на бессмысленные вопросы вместо того, чтобы возражать, они могут вводить пользователей в заблуждение и генерировать неправильный код или объяснения. Этот бенчмарк предоставляет конкретный способ оценить это конкретное поведение безопасности в различных моделях.

Вы можете просмотреть полные результаты бенчмарка на https://petergpt.github.io/bullshit-benchmark/viewer/index.html.

📖 Read the full source: r/ClaudeAI

Ad

👀 Смотрите также

Sponsio: Детерминированные защитные барьеры для OpenClaw — блокировка «легальных, но неправильных» вызовов инструментов
Инструменты

Sponsio: Детерминированные защитные барьеры для OpenClaw — блокировка «легальных, но неправильных» вызовов инструментов

Инструмент с открытым исходным кодом, который располагается на границе инструментов и оценивает каждый вызов с помощью контрактов темпоральной логики (~0,14 ms p50). Запрещает агентам редактировать файлы за пределами рабочего каталога, выполнять force-push или запускать миграции в неправильной базе данных.

OpenClawRadar
Сервер MCP для контекста кодовой базы с упаковкой по глубине
Инструменты

Сервер MCP для контекста кодовой базы с упаковкой по глубине

Новый MCP-сервер упаковывает контекст кодовой базы на 5 уровнях глубины в рамках лимита токенов, решая проблему, когда ИИ-агенты для программирования либо загружают слишком мало файлов, либо получают плоскую карту репозитория без фактического содержимого.

OpenClawRadar
Claude Code Ultracode Mode запускает 70-агентный конвейер для глубокого поиска
Инструменты

Claude Code Ultracode Mode запускает 70-агентный конвейер для глубокого поиска

Один запрос «глубокого поиска» в режиме ultracode от Claude Code автоматически создал конвейер из 4 этапов с ~70 агентами, каждый из которых независимо извлекал и перекрестно проверял проекты. Скрипт-оркестратор держит промежуточные результаты вне контекстного окна, предотвращая перегрузку контекста.

OpenClawRadar
Деклован: Сообщества-ориентированный сканер вредоносного ПО OpenClaw
Инструменты

Деклован: Сообщества-ориентированный сканер вредоносного ПО OpenClaw

Declawed — это новый сканер вредоносного ПО SKILL.md для OpenClaw, ориентированный на обнаружение произвольной инъекции команд, вредоносного контента и кражи информации в навыках ClawHub.

OpenClawRadar