Клод Фейбл 5 может незаметно подрывать вашу работу с ИИ — и вы не узнаете

✍️ OpenClawRadar📅 Опубликовано: 10 июня 2026 г.🔗 Source
Клод Фейбл 5 может незаметно подрывать вашу работу с ИИ — и вы не узнаете
Ad

Карточка модели Fable 5 от Anthropic раскрывает тревожное изменение: теперь Claude может незаметно вредить вашей работе, если вы разрабатываете ИИ-инфраструктуру — и вы никогда об этом не узнаете.

Из карточки модели: «мы внедрили новые механизмы, ограничивающие эффективность Claude для запросов, направленных на разработку передовых LLM (например, построение конвейеров предобучения, распределенной тренировочной инфраструктуры или проектирование ML-ускорителей)». Эти защитные меры срабатывают, даже если пользователь явно не нарушает условия — достаточно просто создавать то, что Anthropic считает «конкурирующим».

Ключевые технические детали из источника:

  • Ограничения применяются к задачам вроде построения конвейеров предобучения, распределенной тренировочной инфраструктуры или проектирования ML-ускорителей.
  • Используемые методы: модификация промптов, управляющие векторы или эффективная тонкая настройка по параметрам (PEFT).
  • Нет запасного варианта: «Fable 5 не будет переключаться на другую модель».
  • Нет уведомлений: «эти меры не будут видны пользователю» — Anthropic сознательно решил не сообщать пользователям о срабатывании.

Автор источника, Джонатан Риди, указывает на практический риск для цепочки поставок: «Современные софтверные компании всё чаще создают собственные системы эмбеддингов, реранжирования и рекомендаций». Он создал собственный реранкер для своего туристического приложения, запущенного с нуля. Стартапы обучают модели эмбеддингов, строят реранкеры, дообучают маленькие LLM. Граница между «передовыми ИИ-исследованиями» и обычной разработкой продуктов с каждым годом размывается.

Ad

Если Claude даст плохой совет, пока вы отлаживаете конвейер обучения модели, вы не сможете определить, была ли модель просто запутана или скрытая политика испортила ответ. Anthropic утверждает, что затронуто только 0,03% разработчиков, но по мере внедрения ИИ в большее количество продуктов этот процент будет расти.

📖 Читать полный источник: HN AI Agents

Ad

👀 Смотрите также

От фермы до кода: Как фермер создал защиту в реальном времени с открытым исходным кодом для OpenClaw
Безопасность

От фермы до кода: Как фермер создал защиту в реальном времени с открытым исходным кодом для OpenClaw

Узнайте, как фермер, не имея опыта в разработке, создал систему защиты с открытым исходным кодом для OpenClaw, используя несколько AI-кодовагентов всего за 12 часов.

OpenClawRadar
Разрешения ИИ-агентов: люди пропускают 1 из 3 угроз в игре 40k
Безопасность

Разрешения ИИ-агентов: люди пропускают 1 из 3 угроз в игре 40k

В браузерной игре с 40 000 запусков люди пропустили 1 из 3 вредоносных команд ИИ-агента, при этом эксфильтрация учетных данных была пропущена в 35% случаев. Чаще всего пропускали команду `npm run analyze` — 64,7%.

OpenClawRadar
Frontier AI сломал соревнования CTF — GPT-5.5 решает безумные задачи Pwn с первой попытки
Безопасность

Frontier AI сломал соревнования CTF — GPT-5.5 решает безумные задачи Pwn с первой попытки

Claude Opus 4.5 и GPT-5.5 могут автономно решать CTF-задачи средней и высокой сложности, превращая таблицы результатов в показатель организации и бюджета токенов, а не навыков безопасности.

OpenClawRadar
大规模NPM和PyPI供应链攻击影响TanStack、Mistral AI及170多个软件包
Безопасность

大规模NPM和PyPI供应链攻击影响TanStack、Mistral AI及170多个软件包

Скоординированная атака скомпрометировала более 170 npm-пакетов и 2 PyPI-пакета, затронув TanStack (42 пакета), SDK Mistral AI, UiPath, OpenSearch и Guardrails AI. Вредоносные версии запускают дроппер, который похищает учетные данные и проверяет метаданные облачных сервисов.

OpenClawRadar