A Merlin Research lança o modelo Qwen3.5-4B-Safety-Thinking para raciocínio estruturado.

A Merlin Research lançou o Qwen3.5-4B-Safety-Thinking, um modelo de raciocínio alinhado à segurança com 4 bilhões de parâmetros, construído sobre o Qwen3.5. Este modelo foi especificamente projetado para aplicações de 'pensamento' estruturado e segurança em cenários do mundo real, com foco particular em sistemas de agentes.
Principais melhorias e recursos
- Melhor capacidade de seguir instruções rigorosas em prompts com precisão
- Baseado no uso dos métodos Bloom e Petri da Anthropic
- Resistente a tentativas de hacking
- Maior resistência a prompts 'anormais' e adversariais
- Janela de contexto de até 1 milhão de tokens
- Utiliza estruturas da Anthropic - Bloom e Petri
O modelo está disponível no Hugging Face em MerlinSafety/Qwen3.5-4B-Safety-Thinking.
Para desenvolvedores que trabalham com agentes de IA, este modelo representa uma ferramenta especializada para aplicações críticas de segurança, onde o raciocínio estruturado e a resistência à manipulação de prompts são prioridades. A integração dos métodos Bloom e Petri da Anthropic sugere um foco em abordagens de IA constitucional para alinhamento.
📖 Read the full source: r/LocalLLaMA
👀 See Also

OpenClaw v2026.7.1: Reformulação da Interface de Controle, Integração, Aplicativos Móveis, GPT-5.6, Tencent Hy3, Meta Muse Spark 1.1
OpenClaw v2026.7.1 traz uma grande reformulação na UI de Controle, onboarding redesenhado, aplicativos iOS/Android/macOS atualizados, compatibilidade com GPT-5.6, suporte a Tencent Hy3 e Meta Muse Spark 1.1, e fluxos de trabalho aprimorados para Codex e agentes de código.

Agentic GRPO: Primeiro IA a Superar Todos os Humanos em uma Competição de Programação
Novo algoritmo RL Agentic GRPO permite que IA supere todos os humanos em competição de programação, fornecendo recompensas imediatas e correção tardia.

Do Prompting à Engenharia de Especificação: A Mudança para a Arquitetura Planejador-Executor
O desenvolvimento de IA está mudando de prompts baseados em chat simples para uma arquitetura planejador-trabalhador, onde humanos atuam como engenheiros de especificação. Isso requer definir critérios de aceitação rigorosos, arquitetura de restrições e padrões de decomposição para agentes de IA autônomos.

Conta do Google Suspensa Após Tentativa de Integração do OpenClaw
A conta do Google de um desenvolvedor foi suspensa em menos de 48 horas após configurar o acesso à API para integração com o OpenClaw, sendo sinalizada como atividade de bot apesar de ter sido criada manualmente.