Merlin Research publie le modèle Qwen3.5-4B-Safety-Thinking pour le raisonnement structuré.

✍️ OpenClawRadar📅 Publié: April 17, 2026🔗 Source
Merlin Research publie le modèle Qwen3.5-4B-Safety-Thinking pour le raisonnement structuré.
Ad

Merlin Research a dévoilé Qwen3.5-4B-Safety-Thinking, un modèle de raisonnement aligné sur la sécurité de 4 milliards de paramètres, construit sur Qwen3.5. Ce modèle est spécifiquement conçu pour des applications de 'raisonnement' structuré et de sécurité dans des scénarios réels, avec un accent particulier sur les systèmes d'agents.

Ad

Améliorations et fonctionnalités clés

  • Capacité améliorée à suivre avec précision des instructions strictes dans les prompts
  • Basé sur l'utilisation des méthodes Bloom et Petri d'Anthropic
  • Résistant aux tentatives de piratage
  • Résistance accrue aux prompts 'anormaux' et adversariaux
  • Fenêtre contextuelle allant jusqu'à 1 million de tokens
  • Utilise les frameworks d'Anthropic - Bloom et Petri

Le modèle est disponible sur Hugging Face à l'adresse MerlinSafety/Qwen3.5-4B-Safety-Thinking.

Pour les développeurs travaillant avec des agents IA, ce modèle représente un outil spécialisé pour des applications critiques en matière de sécurité où le raisonnement structuré et la résistance à la manipulation des prompts sont prioritaires. L'intégration des méthodes Bloom et Petri d'Anthropic suggère une approche centrée sur l'IA constitutionnelle pour l'alignement.

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

Enseigner le pourquoi à Claude : l'approche d'Anthropic pour éliminer le désalignement agentique
News

Enseigner le pourquoi à Claude : l'approche d'Anthropic pour éliminer le désalignement agentique

Anthropic a considérablement réduit le désalignement agentique (par exemple, le chantage) dans les modèles Claude en les entraînant sur des raisons et des principes plutôt que sur de simples démonstrations, obtenant des scores parfaits depuis Claude Haiku 4.5.

OpenClawRadar
Atlassian annonce 1 600 licenciements dans le cadre de sa transition vers l'IA
News

Atlassian annonce 1 600 licenciements dans le cadre de sa transition vers l'IA

Atlassian prévoit de supprimer environ 1 600 emplois alors que l'entreprise recentre ses priorités sur le développement de l'IA, selon un rapport de Reuters partagé sur Hacker News.

OpenClawRadar
Claude Code v2.1.85 est disponible : Améliorations MCP, Filtres de Hook et Corrections de Bogues
News

Claude Code v2.1.85 est disponible : Améliorations MCP, Filtres de Hook et Corrections de Bogues

Claude Code v2.1.85 ajoute des variables d'environnement pour les scripts d'aide aux en-têtes MCP, des champs conditionnels if pour les hooks afin de réduire le lancement de processus, et des correctifs pour les échecs de /compact, les problèmes d'activation/désactivation des plugins, et les problèmes de clavier dans les terminaux Ghostty, Kitty et WezTerm.

OpenClawRadar
Stratégie commerciale d'Anthropic : Les revenus de l'API motivent les limitations du service grand public
News

Stratégie commerciale d'Anthropic : Les revenus de l'API motivent les limitations du service grand public

Les abonnements grand public d'Anthropic fonctionnent à perte, subventionnés pour développer la notoriété de l'IA, tandis que leur activité API génère des revenus. Le niveau Pro à 20 $ est intentionnellement limité pour orienter les utilisateurs vers les abonnements Max à plus forte valeur.

OpenClawRadar