Merlin Research выпускает модель Qwen3.5-4B-Safety-Thinking для структурированного рассуждения.

Исследовательская группа Merlin Research представила Qwen3.5-4B-Safety-Thinking — модель рассуждений с 4 миллиардами параметров, ориентированную на безопасность и построенную на основе Qwen3.5. Эта модель специально разработана для структурированного «мышления» и приложений безопасности в реальных сценариях, с особым акцентом на агентные системы.
Ключевые улучшения и особенности
- Улучшенная способность точно следовать строгим инструкциям в промптах
- Основана на использовании методов Bloom и Petri от Anthropic
- Устойчива к попыткам взлома
- Повышенная устойчивость к «аномальным» и враждебным промптам
- Контекстное окно до 1 миллиона токенов
- Использует фреймворки от Anthropic — Bloom и Petri
Модель доступна на Hugging Face по адресу MerlinSafety/Qwen3.5-4B-Safety-Thinking.
Для разработчиков, работающих с ИИ-агентами, эта модель представляет собой специализированный инструмент для критически важных с точки зрения безопасности приложений, где приоритетами являются структурированные рассуждения и устойчивость к манипуляциям с промптами. Интеграция методов Bloom и Petri от Anthropic указывает на фокус на конституционных подходах к согласованию ИИ.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также
Бенчмарк усилий рассуждения Opus 4.7: Средний превосходит Высокий и Максимум в реальных задачах
В 29 задачах из репозитория GraphQL-go-tools Opus 4.7 в Claude Code показывает пик при среднем уровне рассуждений — более высокие настройки ухудшают корректность и увеличивают стоимость без улучшения качества патчей.

Ubuntu Linux планирует интеграцию функций ИИ в течение следующего года, начиная с локального вывода
Canonical объявляет о многолетней AI-стратегии для Ubuntu, сосредоточенной на локальном выведении, агентных рабочих процессах и контекстно-зависимых возможностях ОС. Функции будут внедряться на протяжении 2026 года.

Документированные проблемы с загрузкой файлов и индексацией в Claude Projects
В Claude Projects подтверждены несколько проблем на стороне сервера: файлы застревают при индексации, режим поиска RAG активируется преждевременно при ~13 файлах независимо от количества токенов, а кэшированное содержимое сохраняется даже после удаления и повторной загрузки.

Пользователи OpenRouter сообщают о баге с подписью в thinking-блоках Sonnet 4.5
Баг, затрагивающий режим extended thinking в Claude Sonnet 4.5 через OpenRouter, вызывает ошибки валидации подписи.