Точность Claude Opus 4.6 снизилась в тесте на галлюцинации BridgeBench.

BridgeMind AI сообщили в Twitter, что точность Claude Opus 4.6 в тесте на галлюцинации BridgeBench снизилась с 83% до 68%. Этот твит был опубликован на Hacker News, где набрал 58 баллов и 11 комментариев.
Тест на галлюцинации BridgeBench — это эталонный тест, используемый для измерения того, как часто модели ИИ генерируют некорректную или вымышленную информацию. Снижение точности с 83% до 68% представляет собой значительный регресс производительности в этой конкретной оценке.
Для разработчиков, использующих ИИ-агентов для программирования, тесты на галлюцинации, такие как BridgeBench, важны для понимания надёжности модели. Когда модели галлюцинируют в контексте программирования, они могут генерировать неправильный код, предлагать несуществующие API или предоставлять вводящие в заблуждение ссылки на документацию.
Обсуждение этого твита на Hacker News, вероятно, включает технический анализ от разработчиков, работающих с моделями ИИ. Эти беседы обычно затрагивают практические последствия для рабочих процессов разработки, стратегий тестирования и способы снижения рисков галлюцинаций в производственных системах.
Падение точности в конкретных тестах не обязательно отражает общую деградацию производительности модели, но они подчёркивают области, где недавние обновления могли привести к регрессам. Разработчикам следует проверять критически важные предложения по коду и поддерживать протоколы тестирования при работе с обновлёнными моделями ИИ.
📖 Read the full source: HN AI Agents
👀 Смотрите также

Cowork жестко прописывает средние усилия и игнорирует пользовательские настройки для Claude Opus.
Пользователь с планом Max обнаружил, что Cowork передает --effort medium --model claude-opus-4-6 как жестко заданные флаги CLI, игнорируя переменные окружения и переопределения в settings.json. Это означает, что пользователи заперты на среднем уровне усилий и стандартном окне контекста, несмотря на оплату высокого уровня усилий и доступа к 1M контексту.

Почему OpenClaw так быстро сжигает токены? Исследуем явление.
OpenClaw, ведущий AI-агент по программированию, reportedly сжигает токены в беспрецедентных объемах. Мы рассматриваем, что это означает для пользователей и возможные причины этого явления.

ИИ замедляется: к 2030 году потребуется выручка в $3 трлн для поддержания пузыря
Эд Зитрон утверждает, что генеративный ИИ замедляется, а не ускоряется, и экономика просто не сходится. Статья сосредоточена на ошеломляющих требованиях к капиталу: доход в 3 триллиона долларов и более к концу 2030 года, чтобы поддерживать существование индустрии ИИ, исходя из затрат на строительство центров обработки данных и обязательств гиперскейлеров.

Claude Code v2.1.196: Модели организации по умолчанию, исправление безопасности, восстановление фоновых задач
Claude Code v2.1.196 добавляет модели организации по умолчанию, исправляет проблему безопасности с запуском серверов MCP, улучшает надежность фоновых сессий и сокращает использование токенов в /code-review на 25%.