Тест на устойчивость языковых моделей к бессмысленным запросам

✍️ OpenClawRadar📅 Опубликовано: 25 февраля 2026 г.🔗 Source
Тест на устойчивость языковых моделей к бессмысленным запросам
Ad

Что измеряет Бенчмарк Bullshit

Бенчмарк Bullshit — это инструмент для проверки того, идентифицируют ли большие языковые модели (LLM) бессмысленные запросы и возражают против них, вместо того чтобы уверенно отвечать на них. Он измеряет, насколько модель готова соглашаться с очевидной бессмыслицей, затрагивая опасения, что модели могут вызывать у себя галлюцинации, пытаясь быть полезными, вместо того чтобы указывать на проблемные запросы.

Ключевые результаты бенчмарка

Согласно исходному материалу, модели Claude демонстрируют значительно лучшую производительность, чем модели Gemini, в обнаружении бессмыслицы. Результаты подтверждают интуицию, что модели Claude лучше справляются с этой конкретной способностью.

Один пример из бенчмарка показывает, что Claude успешно идентифицировал бессмысленный вопрос, в то время как Gemini не справился. В частности, Gemini 3.1 Pro не смог обнаружить очевидно бессмысленный вопрос даже при включённом высоком уровне усилий мышления, вместо этого сгенерировав бессмысленный ответ.

Источник предполагает, что подход Anthropic к пост-обучению способствует лучшей производительности Claude, отмечая, что LLM естественным образом склонны к поверхностному ассоциативному мышлению, которое порождает ложные связи между концепциями. Похоже, Anthropic решила эту проблему в своём конвейере пост-обучения.

Ad

Почему это важно для ИИ-агентов в программировании

Для разработчиков, использующих ИИ-ассистентов для программирования, способность модели распознавать бессмысленные запросы имеет решающее значение. Когда модели уверенно отвечают на бессмысленные вопросы вместо того, чтобы возражать, они могут вводить пользователей в заблуждение и генерировать неправильный код или объяснения. Этот бенчмарк предоставляет конкретный способ оценить это конкретное поведение безопасности в различных моделях.

Вы можете просмотреть полные результаты бенчмарка на https://petergpt.github.io/bullshit-benchmark/viewer/index.html.

📖 Read the full source: r/ClaudeAI

Ad

👀 Смотрите также

hiresTI: Нативный проигрыватель TIDAL для Linux с поддержкой OpenClaw/MCP
Инструменты

hiresTI: Нативный проигрыватель TIDAL для Linux с поддержкой OpenClaw/MCP

hiresTI — это нативный клиент TIDAL для рабочего стола Linux, ориентированный на стабильное воспроизведение, высококачественный аудиовыход, интерфейс GTK4/Libadwaita и интеграцию с OpenClaw через MCP для удалённого управления. Приложение сочетает слой интерфейса на Python с аудиоядром на Rust.

OpenClawRadar
开发者用每千次提示中的咒骂次数指标追踪沮丧情绪,涉及44,212条Claude Code日志
Инструменты

开发者用每千次提示中的咒骂次数指标追踪沮丧情绪,涉及44,212条Claude Code日志

Разработчик отслеживал 'fpk' (f-бомбы на тысячу промптов) по 44 212 промптам Claude Code за 5 месяцев и обнаружил, что уровень разочарования снизился в 3,4 раза с Claude Opus 4-5 до 4-7, причем большая часть ругательств была направлена на инструменты окружения, а не на модель.

OpenClawRadar
IronBee: Открытый слой верификации для Claude Code и Cursor
Инструменты

IronBee: Открытый слой верификации для Claude Code и Cursor

IronBee — это открытый слой верификации, который заставляет AI-агентов для программирования тестировать изменения в реальном браузере перед завершением задач. В ходе тестирования он обнаружил ошибки в 82% сессий Claude Code, которые были бы отправлены без проверки.

OpenClawRadar
Терминальный 3D-рендерер, созданный с помощью мультиагентной системы кодирования Claude
Инструменты

Терминальный 3D-рендерер, созданный с помощью мультиагентной системы кодирования Claude

Разработчик создал tortuise — чисто терминальный 3D-рендерер, отображающий гауссовы сплаты с помощью символов Unicode и ASCII, построенный за 3 дня с использованием 70-80 ИИ-агентов, скоординированных через настройку Claude Code с подагентами внутри подагентов.

OpenClawRadar