Точность Claude Opus 4.6 снизилась в тесте на галлюцинации BridgeBench.

BridgeMind AI сообщили в Twitter, что точность Claude Opus 4.6 в тесте на галлюцинации BridgeBench снизилась с 83% до 68%. Этот твит был опубликован на Hacker News, где набрал 58 баллов и 11 комментариев.
Тест на галлюцинации BridgeBench — это эталонный тест, используемый для измерения того, как часто модели ИИ генерируют некорректную или вымышленную информацию. Снижение точности с 83% до 68% представляет собой значительный регресс производительности в этой конкретной оценке.
Для разработчиков, использующих ИИ-агентов для программирования, тесты на галлюцинации, такие как BridgeBench, важны для понимания надёжности модели. Когда модели галлюцинируют в контексте программирования, они могут генерировать неправильный код, предлагать несуществующие API или предоставлять вводящие в заблуждение ссылки на документацию.
Обсуждение этого твита на Hacker News, вероятно, включает технический анализ от разработчиков, работающих с моделями ИИ. Эти беседы обычно затрагивают практические последствия для рабочих процессов разработки, стратегий тестирования и способы снижения рисков галлюцинаций в производственных системах.
Падение точности в конкретных тестах не обязательно отражает общую деградацию производительности модели, но они подчёркивают области, где недавние обновления могли привести к регрессам. Разработчикам следует проверять критически важные предложения по коду и поддерживать протоколы тестирования при работе с обновлёнными моделями ИИ.
📖 Read the full source: HN AI Agents
👀 Смотрите также
Пользователи плана Claude теперь получают ежемесячные кредиты Agent SDK начиная с 15 июня 2026 года
Подписчики планов Claude Pro, Max, Team и Enterprise могут ежемесячно получать кредит на использование Agent SDK, который покрывает claude -p, интеграцию с GitHub Actions и сторонние приложения. Кредиты обновляются каждый месяц, предоставляются на пользователя и не могут суммироваться.
各国政府正重金押注人工智能——《经济学人》警告风险
The Economist утверждает, что правительства делают опасную ставку на бум ИИ, рискуя экономическими иsecurity pitfalls. Ключевые опасения: чрезмерная зависимость от технологических гигантов, поспешное регулирование и потенциальное перемещение рабочих мест.
Claude Code v2.1.207: Автоматический режим GA, исправление зависания терминала и усиление безопасности
Автоматический режим теперь стабилен без опции на Bedrock/Vertex/Foundry. Исправлено зависание терминала при длинном выводе, внедрение команд в плагины и многое другое.

Выявлены четыре пробела в UX/продукте в процессе адаптации пользователей Claude
Пользователь выявил четыре конкретных пробела в UX/продукте при настройке Claude на Desktop, Cowork, Dispatch и в приложении для iPhone во время активного использования. Проблемы включают: задачи Dispatch входят в бесконечный цикл при отключении десктопа, единственный постоянный поток в Dispatch, панель чата, привязанная к вкладке в Chrome, и отсутствие файлов Google Drive в интерфейсе базы знаний мобильного приложения.