Merlin Research veröffentlicht das Qwen3.5-4B-Safety-Thinking-Modell für strukturiertes Denken.

Merlin Research hat Qwen3.5-4B-Safety-Thinking veröffentlicht, ein sicherheitsausgerichtetes 4-Milliarden-Parameter-Reasoning-Modell, das auf Qwen3.5 basiert. Dieses Modell ist speziell für strukturiertes 'Denken' und Sicherheitsanwendungen in realen Szenarien konzipiert, mit besonderem Fokus auf Agentensysteme.
Wichtige Verbesserungen und Funktionen
- Verbesserte Fähigkeit, strikte Anweisungen in Prompts genau zu befolgen
- Basierend auf der Verwendung von Bloom- und Petri-Methoden von Anthropic
- Resistent gegen Hacking-Versuche
- Erhöhte Widerstandsfähigkeit gegen 'abnormale' und adversariale Prompts
- Bis zu 1 Million Token Kontextfenster
- Verwendet Frameworks von Anthropic - Bloom und Petri
Das Modell ist auf Hugging Face unter MerlinSafety/Qwen3.5-4B-Safety-Thinking verfügbar.
Für Entwickler, die mit KI-Agenten arbeiten, stellt dieses Modell ein spezialisiertes Werkzeug für sicherheitskritische Anwendungen dar, bei denen strukturiertes Reasoning und Widerstandsfähigkeit gegen Prompt-Manipulation Priorität haben. Die Integration von Anthropics Bloom- und Petri-Methoden deutet auf einen Fokus auf konstitutionelle KI-Ansätze zur Alignment-Problematik hin.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

Uber hat sein jährliches Claude-Code-Budget in vier Monaten aufgebraucht – was das bedeutet
Uber hat sein gesamtes Claude Code-Jahresbudget Berichten zufolge bereits nach vier Monaten aufgebraucht. Der Beitrag analysiert, warum das Abomodell an seine Grenzen stieß und was Entwickler daraus lernen können.

OpenClaw v2026.3.12 Dashboard-Redesign konsolidiert Interface-Elemente
OpenClaw v2026.3.12 bietet ein komplett neu gestaltetes Dashboard, das modulare Ansichten für Chat, Konfiguration, Agenten und Sitzungen sowie Befehls-Palette, mobile Untertabs, Slash-Befehle, Suche, Export und angeheftete Nachrichten in einer einzigen Oberfläche vereint.

KI-Kohlenhydratzählen scheitert an Reproduzierbarkeit: 27.000 Anfragen ergeben 429g Abweichung bei einem Foto
Eine Studie mit 26.904 KI-Abfragen in 4 Modellen ergab, dass Gemini 2.5 Pro seine Kohlenhydratschätzungen für ein einzelnes Paella-Foto von 55 g bis 484 g variierte – ein potenzieller Insulinausschlag von 42,9 IE. Claude zeigte nur eine mediane Variation von 2,4 %.

Stanford-Bericht zeigt, dass KI-Experten und die Öffentlichkeit unterschiedliche Ansichten über die KI-Auswirkungen haben
Der jährliche KI-Industriebericht der Stanford University deckt erhebliche Lücken zwischen dem Optimismus von KI-Experten und der öffentlichen Besorgnis auf. Während sich Experten auf AGI-Risiken konzentrieren, sorgen sich die Bürger um Arbeitsplätze, medizinische Versorgung und Energiekosten.