Merlin Research выпускает модель Qwen3.5-4B-Safety-Thinking для структурированного рассуждения.

Исследовательская группа Merlin Research представила Qwen3.5-4B-Safety-Thinking — модель рассуждений с 4 миллиардами параметров, ориентированную на безопасность и построенную на основе Qwen3.5. Эта модель специально разработана для структурированного «мышления» и приложений безопасности в реальных сценариях, с особым акцентом на агентные системы.
Ключевые улучшения и особенности
- Улучшенная способность точно следовать строгим инструкциям в промптах
- Основана на использовании методов Bloom и Petri от Anthropic
- Устойчива к попыткам взлома
- Повышенная устойчивость к «аномальным» и враждебным промптам
- Контекстное окно до 1 миллиона токенов
- Использует фреймворки от Anthropic — Bloom и Petri
Модель доступна на Hugging Face по адресу MerlinSafety/Qwen3.5-4B-Safety-Thinking.
Для разработчиков, работающих с ИИ-агентами, эта модель представляет собой специализированный инструмент для критически важных с точки зрения безопасности приложений, где приоритетами являются структурированные рассуждения и устойчивость к манипуляциям с промптами. Интеграция методов Bloom и Petri от Anthropic указывает на фокус на конституционных подходах к согласованию ИИ.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

Anthropic вводит новую кредитную систему для OpenClaw: детали и влияние
Anthropic снова ограничивает OpenClaw: с 15 июня 2026 года все программное использование переводится в отдельный пул кредитов с ежемесячными лимитами, без переноса остатка и с тарификацией за превышение по тарифам API.

Антропные автоэнкодеры естественного языка превращают активации Клода в читаемый английский — вот как
Anthropic представляет Natural Language Autoencoders (NLA), которые преобразуют внутренние активации Claude в текстовые объяснения, раскрывая рассуждения модели о рифмах, осведомленность о тестах на безопасность и обнаружение жульничества.

Anthropic запускает Claude Code Channels для интеграции в мессенджеры
Anthropic запустила Claude Code Channels, позволяя разработчикам отправлять сообщения в сессии Claude Code из Telegram или Discord с полным доступом к инструментам, включая редактирование файлов, запуск тестов и операции с git. Функция требует платного тарифа Anthropic и поддерживает две платформы по сравнению с 20+ у OpenClaw.

Последнее обновление сломало расширение Claude для VS Code на Windows из-за жестко заданного пути для Linux
Недавнее обновление расширения VS Code от Anthropic жестко прописывает путь Linux, что ломает расширение на Windows. Возврат к предыдущей версии восстанавливает функциональность.