Тест на устойчивость языковых моделей к бессмысленным запросам

✍️ OpenClawRadar📅 Опубликовано: 25 февраля 2026 г.🔗 Source
Тест на устойчивость языковых моделей к бессмысленным запросам
Ad

Что измеряет Бенчмарк Bullshit

Бенчмарк Bullshit — это инструмент для проверки того, идентифицируют ли большие языковые модели (LLM) бессмысленные запросы и возражают против них, вместо того чтобы уверенно отвечать на них. Он измеряет, насколько модель готова соглашаться с очевидной бессмыслицей, затрагивая опасения, что модели могут вызывать у себя галлюцинации, пытаясь быть полезными, вместо того чтобы указывать на проблемные запросы.

Ключевые результаты бенчмарка

Согласно исходному материалу, модели Claude демонстрируют значительно лучшую производительность, чем модели Gemini, в обнаружении бессмыслицы. Результаты подтверждают интуицию, что модели Claude лучше справляются с этой конкретной способностью.

Один пример из бенчмарка показывает, что Claude успешно идентифицировал бессмысленный вопрос, в то время как Gemini не справился. В частности, Gemini 3.1 Pro не смог обнаружить очевидно бессмысленный вопрос даже при включённом высоком уровне усилий мышления, вместо этого сгенерировав бессмысленный ответ.

Источник предполагает, что подход Anthropic к пост-обучению способствует лучшей производительности Claude, отмечая, что LLM естественным образом склонны к поверхностному ассоциативному мышлению, которое порождает ложные связи между концепциями. Похоже, Anthropic решила эту проблему в своём конвейере пост-обучения.

Ad

Почему это важно для ИИ-агентов в программировании

Для разработчиков, использующих ИИ-ассистентов для программирования, способность модели распознавать бессмысленные запросы имеет решающее значение. Когда модели уверенно отвечают на бессмысленные вопросы вместо того, чтобы возражать, они могут вводить пользователей в заблуждение и генерировать неправильный код или объяснения. Этот бенчмарк предоставляет конкретный способ оценить это конкретное поведение безопасности в различных моделях.

Вы можете просмотреть полные результаты бенчмарка на https://petergpt.github.io/bullshit-benchmark/viewer/index.html.

📖 Read the full source: r/ClaudeAI

Ad

👀 Смотрите также

Vigil: Криптографическая система идентификации для агентов OpenClaw для предотвращения блокировки
Инструменты

Vigil: Криптографическая система идентификации для агентов OpenClaw для предотвращения блокировки

Разработчик, запускающий агентов OpenClaw, обнаружил, что анонимный трафик агентов всё чаще блокируется сайтами, и предлагает Vigil — систему входа, которая предоставляет агентам криптографические идентификаторы для формирования репутации и предотвращения безразборной блокировки.

OpenClawRadar
Интерактивный веб-сайт моделирует структуру проекта кода Claude
Инструменты

Интерактивный веб-сайт моделирует структуру проекта кода Claude

Разработчик создал exploreclaudecode.com — браузерную симуляцию проекта Claude Code с функциональным деревом файлов, настраиваемыми файлами и панелью терминала. На сайте объясняется, как работают вместе каталоги .claude/, файлы настроек, навыки, агенты, хуки и конфигурации MCP.

OpenClawRadar
Codiff v0.1.0: Локальное средство просмотра различий для проверки кода, сгенерированного LLM
Инструменты

Codiff v0.1.0: Локальное средство просмотра различий для проверки кода, сгенерированного LLM

Codiff v0.1.0 — это быстрая минималистичная настольная программа для просмотра локальных Git-диффов с режимом обхода LLM и встроенными комментариями, которые можно скопировать в Markdown.

OpenClawRadar
Semble: Локальный MCP-сервер для Claude Code с сокращением токенов на 98%
Инструменты

Semble: Локальный MCP-сервер для Claude Code с сокращением токенов на 98%

Semble — это MCP-сервер с открытым исходным кодом для Claude Code, который заменяет grep+read, используя эмбеддинги, BM25 и реранжировку для сокращения использования токенов примерно на 98% при индексации репозиториев за ~250 мс.

OpenClawRadar