Merlin Research выпускает модель Qwen3.5-4B-Safety-Thinking для структурированного рассуждения.

✍️ OpenClawRadar📅 Опубликовано: 17 апреля 2026 г.🔗 Source
Merlin Research выпускает модель Qwen3.5-4B-Safety-Thinking для структурированного рассуждения.
Ad

Исследовательская группа Merlin Research представила Qwen3.5-4B-Safety-Thinking — модель рассуждений с 4 миллиардами параметров, ориентированную на безопасность и построенную на основе Qwen3.5. Эта модель специально разработана для структурированного «мышления» и приложений безопасности в реальных сценариях, с особым акцентом на агентные системы.

Ad

Ключевые улучшения и особенности

  • Улучшенная способность точно следовать строгим инструкциям в промптах
  • Основана на использовании методов Bloom и Petri от Anthropic
  • Устойчива к попыткам взлома
  • Повышенная устойчивость к «аномальным» и враждебным промптам
  • Контекстное окно до 1 миллиона токенов
  • Использует фреймворки от Anthropic — Bloom и Petri

Модель доступна на Hugging Face по адресу MerlinSafety/Qwen3.5-4B-Safety-Thinking.

Для разработчиков, работающих с ИИ-агентами, эта модель представляет собой специализированный инструмент для критически важных с точки зрения безопасности приложений, где приоритетами являются структурированные рассуждения и устойчивость к манипуляциям с промптами. Интеграция методов Bloom и Petri от Anthropic указывает на фокус на конституционных подходах к согласованию ИИ.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Смотрите также

Anthropic вводит новую кредитную систему для OpenClaw: детали и влияние
Новости

Anthropic вводит новую кредитную систему для OpenClaw: детали и влияние

Anthropic снова ограничивает OpenClaw: с 15 июня 2026 года все программное использование переводится в отдельный пул кредитов с ежемесячными лимитами, без переноса остатка и с тарификацией за превышение по тарифам API.

OpenClawRadar
Антропные автоэнкодеры естественного языка превращают активации Клода в читаемый английский — вот как
Новости

Антропные автоэнкодеры естественного языка превращают активации Клода в читаемый английский — вот как

Anthropic представляет Natural Language Autoencoders (NLA), которые преобразуют внутренние активации Claude в текстовые объяснения, раскрывая рассуждения модели о рифмах, осведомленность о тестах на безопасность и обнаружение жульничества.

OpenClawRadar
Anthropic запускает Claude Code Channels для интеграции в мессенджеры
Новости

Anthropic запускает Claude Code Channels для интеграции в мессенджеры

Anthropic запустила Claude Code Channels, позволяя разработчикам отправлять сообщения в сессии Claude Code из Telegram или Discord с полным доступом к инструментам, включая редактирование файлов, запуск тестов и операции с git. Функция требует платного тарифа Anthropic и поддерживает две платформы по сравнению с 20+ у OpenClaw.

OpenClawRadar
Последнее обновление сломало расширение Claude для VS Code на Windows из-за жестко заданного пути для Linux
Новости

Последнее обновление сломало расширение Claude для VS Code на Windows из-за жестко заданного пути для Linux

Недавнее обновление расширения VS Code от Anthropic жестко прописывает путь Linux, что ломает расширение на Windows. Возврат к предыдущей версии восстанавливает функциональность.

OpenClawRadar