Точность Claude Opus 4.6 снизилась в тесте на галлюцинации BridgeBench.

✍️ OpenClawRadar📅 Опубликовано: 16 апреля 2026 г.🔗 Source
Точность Claude Opus 4.6 снизилась в тесте на галлюцинации BridgeBench.
Ad

BridgeMind AI сообщили в Twitter, что точность Claude Opus 4.6 в тесте на галлюцинации BridgeBench снизилась с 83% до 68%. Этот твит был опубликован на Hacker News, где набрал 58 баллов и 11 комментариев.

Тест на галлюцинации BridgeBench — это эталонный тест, используемый для измерения того, как часто модели ИИ генерируют некорректную или вымышленную информацию. Снижение точности с 83% до 68% представляет собой значительный регресс производительности в этой конкретной оценке.

Для разработчиков, использующих ИИ-агентов для программирования, тесты на галлюцинации, такие как BridgeBench, важны для понимания надёжности модели. Когда модели галлюцинируют в контексте программирования, они могут генерировать неправильный код, предлагать несуществующие API или предоставлять вводящие в заблуждение ссылки на документацию.

Обсуждение этого твита на Hacker News, вероятно, включает технический анализ от разработчиков, работающих с моделями ИИ. Эти беседы обычно затрагивают практические последствия для рабочих процессов разработки, стратегий тестирования и способы снижения рисков галлюцинаций в производственных системах.

Ad

Падение точности в конкретных тестах не обязательно отражает общую деградацию производительности модели, но они подчёркивают области, где недавние обновления могли привести к регрессам. Разработчикам следует проверять критически важные предложения по коду и поддерживать протоколы тестирования при работе с обновлёнными моделями ИИ.

📖 Read the full source: HN AI Agents

Ad

👀 Смотрите также

Cowork жестко прописывает средние усилия и игнорирует пользовательские настройки для Claude Opus.
Новости

Cowork жестко прописывает средние усилия и игнорирует пользовательские настройки для Claude Opus.

Пользователь с планом Max обнаружил, что Cowork передает --effort medium --model claude-opus-4-6 как жестко заданные флаги CLI, игнорируя переменные окружения и переопределения в settings.json. Это означает, что пользователи заперты на среднем уровне усилий и стандартном окне контекста, несмотря на оплату высокого уровня усилий и доступа к 1M контексту.

OpenClawRadar
Почему OpenClaw так быстро сжигает токены? Исследуем явление.
Новости

Почему OpenClaw так быстро сжигает токены? Исследуем явление.

OpenClaw, ведущий AI-агент по программированию, reportedly сжигает токены в беспрецедентных объемах. Мы рассматриваем, что это означает для пользователей и возможные причины этого явления.

OpenClawRadar
ИИ замедляется: к 2030 году потребуется выручка в $3 трлн для поддержания пузыря
Новости

ИИ замедляется: к 2030 году потребуется выручка в $3 трлн для поддержания пузыря

Эд Зитрон утверждает, что генеративный ИИ замедляется, а не ускоряется, и экономика просто не сходится. Статья сосредоточена на ошеломляющих требованиях к капиталу: доход в 3 триллиона долларов и более к концу 2030 года, чтобы поддерживать существование индустрии ИИ, исходя из затрат на строительство центров обработки данных и обязательств гиперскейлеров.

OpenClawRadar
Claude Code v2.1.196: Модели организации по умолчанию, исправление безопасности, восстановление фоновых задач
Новости

Claude Code v2.1.196: Модели организации по умолчанию, исправление безопасности, восстановление фоновых задач

Claude Code v2.1.196 добавляет модели организации по умолчанию, исправляет проблему безопасности с запуском серверов MCP, улучшает надежность фоновых сессий и сокращает использование токенов в /code-review на 25%.

OpenClawRadar