Merlin Research publie le modèle Qwen3.5-4B-Safety-Thinking pour le raisonnement structuré.

Merlin Research a dévoilé Qwen3.5-4B-Safety-Thinking, un modèle de raisonnement aligné sur la sécurité de 4 milliards de paramètres, construit sur Qwen3.5. Ce modèle est spécifiquement conçu pour des applications de 'raisonnement' structuré et de sécurité dans des scénarios réels, avec un accent particulier sur les systèmes d'agents.
Améliorations et fonctionnalités clés
- Capacité améliorée à suivre avec précision des instructions strictes dans les prompts
- Basé sur l'utilisation des méthodes Bloom et Petri d'Anthropic
- Résistant aux tentatives de piratage
- Résistance accrue aux prompts 'anormaux' et adversariaux
- Fenêtre contextuelle allant jusqu'à 1 million de tokens
- Utilise les frameworks d'Anthropic - Bloom et Petri
Le modèle est disponible sur Hugging Face à l'adresse MerlinSafety/Qwen3.5-4B-Safety-Thinking.
Pour les développeurs travaillant avec des agents IA, ce modèle représente un outil spécialisé pour des applications critiques en matière de sécurité où le raisonnement structuré et la résistance à la manipulation des prompts sont prioritaires. L'intégration des méthodes Bloom et Petri d'Anthropic suggère une approche centrée sur l'IA constitutionnelle pour l'alignement.
📖 Read the full source: r/LocalLLaMA
👀 See Also

NVIDIA annonce NemoClaw avec des fonctionnalités de sécurité OpenShell
NVIDIA a annoncé NemoClaw lors du GTC, s'appuyant sur OpenClaw pour ajouter une sécurité de niveau entreprise grâce à OpenShell, qui impose des garde-fous de confidentialité et de sécurité basés sur des politiques pour les agents d'IA.

Traduire en fr : Mises à jour de Claude Code v2.1.91 : Modèles de conception d'agent, règles de mémoire et améliorations des outils
Claude Code v2.1.91 ajoute un guide de référence pour les modèles de conception d'agents couvrant la conception de l'interface des outils, la gestion du contexte et les stratégies de mise en cache. La mise à jour simplifie les règles de sélection de la mémoire, ajoute une surveillance de sécurité contre l'empoisonnement de la mémoire et améliore les descriptions des outils Édition, LireFichier et Écrire.

Abonnés de l'UE signalent des limites d'utilisation non divulguées de Claude Pro – Possible violation du droit de la consommation
Un post Reddit détaille comment le marketing de Claude Pro promet « sans limites », mais les utilisateurs de l'UE subissent des frais supplémentaires et des plafonds de session non divulgués, ce qui pourrait enfreindre les directives européennes sur la protection des consommateurs.

Six parallèles étayés par la recherche entre les modes de défaillance des LLM et la cognition du TDAH
Un développeur atteint de TDAH identifie six parallèles entre les modes de défaillance des LLM et les sciences cognitives du TDAH, étayés par des recherches indépendantes sur le traitement associatif, la fabulation, les limitations de la mémoire de travail, la complétion de motifs, la dépendance structurelle et la continuité des fils de discussion.