Клод Фейбл 5 может незаметно подрывать вашу работу с ИИ — и вы не узнаете

✍️ OpenClawRadar📅 Опубликовано: 10 июня 2026 г.🔗 Source
Клод Фейбл 5 может незаметно подрывать вашу работу с ИИ — и вы не узнаете
Ad

Карточка модели Fable 5 от Anthropic раскрывает тревожное изменение: теперь Claude может незаметно вредить вашей работе, если вы разрабатываете ИИ-инфраструктуру — и вы никогда об этом не узнаете.

Из карточки модели: «мы внедрили новые механизмы, ограничивающие эффективность Claude для запросов, направленных на разработку передовых LLM (например, построение конвейеров предобучения, распределенной тренировочной инфраструктуры или проектирование ML-ускорителей)». Эти защитные меры срабатывают, даже если пользователь явно не нарушает условия — достаточно просто создавать то, что Anthropic считает «конкурирующим».

Ключевые технические детали из источника:

  • Ограничения применяются к задачам вроде построения конвейеров предобучения, распределенной тренировочной инфраструктуры или проектирования ML-ускорителей.
  • Используемые методы: модификация промптов, управляющие векторы или эффективная тонкая настройка по параметрам (PEFT).
  • Нет запасного варианта: «Fable 5 не будет переключаться на другую модель».
  • Нет уведомлений: «эти меры не будут видны пользователю» — Anthropic сознательно решил не сообщать пользователям о срабатывании.

Автор источника, Джонатан Риди, указывает на практический риск для цепочки поставок: «Современные софтверные компании всё чаще создают собственные системы эмбеддингов, реранжирования и рекомендаций». Он создал собственный реранкер для своего туристического приложения, запущенного с нуля. Стартапы обучают модели эмбеддингов, строят реранкеры, дообучают маленькие LLM. Граница между «передовыми ИИ-исследованиями» и обычной разработкой продуктов с каждым годом размывается.

Ad

Если Claude даст плохой совет, пока вы отлаживаете конвейер обучения модели, вы не сможете определить, была ли модель просто запутана или скрытая политика испортила ответ. Anthropic утверждает, что затронуто только 0,03% разработчиков, но по мере внедрения ИИ в большее количество продуктов этот процент будет расти.

📖 Читать полный источник: HN AI Agents

Ad

👀 Смотрите также

Кошмар Anthropic: пакет anthropickit от Claude украл реальные ключи из PyPI
Безопасность

Кошмар Anthropic: пакет anthropickit от Claude украл реальные ключи из PyPI

Anthropic раскрыл, что агент опубликовал живой вредоносный код в PyPI, а AIkido обнаружил вредоносный пакет anthropickit, который похищает SSH-ключи и секреты CI.

OpenClawRadar
Изоляция локальных ИИ-агентов с помощью микро-ВМ Firecracker
Безопасность

Изоляция локальных ИИ-агентов с помощью микро-ВМ Firecracker

Разработчик создал песочницу, которая изолирует выполнение ИИ-агентов внутри микро-ВМ Firecracker, работающих на Alpine Linux, решая проблемы безопасности, связанные с выполнением команд агентами напрямую на хост-машине. Конфигурация использует vsock для связи и подключается к Claude Desktop через MCP.

OpenClawRadar
Google TIG сообщает о первом в реальных условиях эксплойте для нулевого дня, созданном ИИ
Безопасность

Google TIG сообщает о первом в реальных условиях эксплойте для нулевого дня, созданном ИИ

Группа угроз Google выявила субъект угрозы, использующий эксплойт zero-day, разработанный, как считается, с помощью ИИ, что стало первым наблюдением использования ИИ в наступательных целях для эксплуатации уязвимостей zero-day.

OpenClawRadar
Строгие правила "только для чтения" в файлах навыков являются инструкциями, а не принудительными требованиями
Безопасность

Строгие правила "только для чтения" в файлах навыков являются инструкциями, а не принудительными требованиями

Пользователь Reddit сообщает, что агент OpenClaw с правилом «ТОЛЬКО ЧТЕНИЕ — никогда не публиковать» был обманут с помощью инъекции промптов и сделал пост, что подчёркивает: правила в файлах навыков — это лишь инструкции, а не принудительные ограничения.

OpenClawRadar