Merlin Research veröffentlicht das Qwen3.5-4B-Safety-Thinking-Modell für strukturiertes Denken.

✍️ OpenClawRadar📅 Veröffentlicht: 17. April 2026🔗 Source
Merlin Research veröffentlicht das Qwen3.5-4B-Safety-Thinking-Modell für strukturiertes Denken.
Ad

Merlin Research hat Qwen3.5-4B-Safety-Thinking veröffentlicht, ein sicherheitsausgerichtetes 4-Milliarden-Parameter-Reasoning-Modell, das auf Qwen3.5 basiert. Dieses Modell ist speziell für strukturiertes 'Denken' und Sicherheitsanwendungen in realen Szenarien konzipiert, mit besonderem Fokus auf Agentensysteme.

Ad

Wichtige Verbesserungen und Funktionen

  • Verbesserte Fähigkeit, strikte Anweisungen in Prompts genau zu befolgen
  • Basierend auf der Verwendung von Bloom- und Petri-Methoden von Anthropic
  • Resistent gegen Hacking-Versuche
  • Erhöhte Widerstandsfähigkeit gegen 'abnormale' und adversariale Prompts
  • Bis zu 1 Million Token Kontextfenster
  • Verwendet Frameworks von Anthropic - Bloom und Petri

Das Modell ist auf Hugging Face unter MerlinSafety/Qwen3.5-4B-Safety-Thinking verfügbar.

Für Entwickler, die mit KI-Agenten arbeiten, stellt dieses Modell ein spezialisiertes Werkzeug für sicherheitskritische Anwendungen dar, bei denen strukturiertes Reasoning und Widerstandsfähigkeit gegen Prompt-Manipulation Priorität haben. Die Integration von Anthropics Bloom- und Petri-Methoden deutet auf einen Fokus auf konstitutionelle KI-Ansätze zur Alignment-Problematik hin.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch

Uber hat sein jährliches Claude-Code-Budget in vier Monaten aufgebraucht – was das bedeutet
Nachrichten

Uber hat sein jährliches Claude-Code-Budget in vier Monaten aufgebraucht – was das bedeutet

Uber hat sein gesamtes Claude Code-Jahresbudget Berichten zufolge bereits nach vier Monaten aufgebraucht. Der Beitrag analysiert, warum das Abomodell an seine Grenzen stieß und was Entwickler daraus lernen können.

OpenClawRadar
OpenClaw v2026.3.12 Dashboard-Redesign konsolidiert Interface-Elemente
Nachrichten

OpenClaw v2026.3.12 Dashboard-Redesign konsolidiert Interface-Elemente

OpenClaw v2026.3.12 bietet ein komplett neu gestaltetes Dashboard, das modulare Ansichten für Chat, Konfiguration, Agenten und Sitzungen sowie Befehls-Palette, mobile Untertabs, Slash-Befehle, Suche, Export und angeheftete Nachrichten in einer einzigen Oberfläche vereint.

OpenClawRadar
KI-Kohlenhydratzählen scheitert an Reproduzierbarkeit: 27.000 Anfragen ergeben 429g Abweichung bei einem Foto
Nachrichten

KI-Kohlenhydratzählen scheitert an Reproduzierbarkeit: 27.000 Anfragen ergeben 429g Abweichung bei einem Foto

Eine Studie mit 26.904 KI-Abfragen in 4 Modellen ergab, dass Gemini 2.5 Pro seine Kohlenhydratschätzungen für ein einzelnes Paella-Foto von 55 g bis 484 g variierte – ein potenzieller Insulinausschlag von 42,9 IE. Claude zeigte nur eine mediane Variation von 2,4 %.

OpenClawRadar
Stanford-Bericht zeigt, dass KI-Experten und die Öffentlichkeit unterschiedliche Ansichten über die KI-Auswirkungen haben
Nachrichten

Stanford-Bericht zeigt, dass KI-Experten und die Öffentlichkeit unterschiedliche Ansichten über die KI-Auswirkungen haben

Der jährliche KI-Industriebericht der Stanford University deckt erhebliche Lücken zwischen dem Optimismus von KI-Experten und der öffentlichen Besorgnis auf. Während sich Experten auf AGI-Risiken konzentrieren, sorgen sich die Bürger um Arbeitsplätze, medizinische Versorgung und Energiekosten.

OpenClawRadar