Strands Decider 2B : un modèle de décision à 2 milliards de paramètres pour les workflows agentiques
Strands Labs (AWS) a publié Strands Decider 2B, un modèle de décision open source de 2 milliards de paramètres optimisé pour l'expérimentation locale rapide et les workflows agentiques. Contrairement aux LLM généralistes, les modèles de décision sont conçus pour choisir parmi un ensemble fixe d'options (par exemple, « Est-ce que "allumer les lumières" concerne la machine à café ? Oui ou non. ») ou attribuer des scores numériques simples (par exemple, un sentiment entre 0 et 1).
Ce que c'est et pourquoi c'est important
Les modèles de décision échangent la flexibilité contre la vitesse et la fiabilité. Ils renvoient toujours une réponse parmi les options fournies, fonctionnent avec une latence très faible et émettent un score de calibration (« à quel point puis-je être sûr que c'est correct ? ») que les API de LLM de pointe n'exposent pas. Le compromis : ils sont moins performants en raisonnement complexe et ne peuvent pas générer de texte, ce qui les rend inadaptés au codage, aux chatbots ou au résumé.
Strands positionne cela comme une nouvelle classe de modèles « système 1 », après le lancement de Jev par TypeSafe AI plus tôt ce mois-ci. L'objectif est de piloter les étapes de décision agentiques dans le SDK Strands Harness.
Architecture
Le modèle prend un torse Qwen3.5-2B pré-entraîné, retire la tête LM (supprimant la génération de texte) et la remplace par une tête pointeur qui note chaque option proposée. La tête compare l'état caché à chaque position d'option avec l'état caché à la position <answer>. La tête est petite — un peu plus de 1 M de paramètres — et le torse est affiné avec un adaptateur LoRA de rang 16.
Il s'agit de la v19 de l'architecture. La première itération utilisait une tête à encoches, qui performait nettement moins bien ; toutes les notes d'itération sont dans le dépôt.
Benchmarks
Strands a mesuré la précision sur l'ensemble public de JevBench et la calibration via le score de Brier sur le même ensemble :
- Précision : 3e sur 33 dans la classe 2B
- Précision en excluant les modèles juste au-dessus de 2B : 1er sur 30
- Latence (médiane) : ~115 ms sur une Nvidia RTX 3090, ~153 ms pour les petites tâches sur un MacBook M3
- La latence évolue à peu près linéairement avec la taille de la tâche
Disponibilité
- Code sur GitHub :
strands-decider-2b - Poids sur Hugging Face
- Inclut toutes les données d'entraînement et les scripts
- Fonctionne sur CPU ou GPU local — aucun appel API requis
Pour qui c'est
Les développeurs qui construisent des workflows agentiques et ont besoin de décisions oui/non ou de classification rapides et calibrées en périphérie, et les chercheurs qui veulent une petite base modifiable pour des expériences de modèles de décision.
📖 Lire la source complète : HN AI Agents
👀 See Also

Système d'exploitation Création : Un runtime LLM local à porte σ qui permet aux modèles de dire « Je ne sais pas » plutôt que d'halluciner
Creation OS enveloppe les LLM locaux (BitNet, Qwen, Gemma, tout GGUF) avec une σ-gate qui mesure plusieurs canaux d'incertitude et décide ACCEPTER, REPENSER ou S'ABSTENIR par sortie. Pas de cloud, pas d'API. Précision TruthfulQA améliorée d'environ 29% grâce à la régénération sélective.
Expérientiel : Passerelle de modèles open source avec routage intelligent
Experiential est une passerelle open source qui unifie les modèles hébergés, BYOK et locaux. Elle route le trafic en fonction du coût/qualité à l'aide de déploiements simulés et de traces OTel, avec un surcoût de moins de 1 ms pour les requêtes BYOK.

memora : Mémoire versionnée et typée pour agents IA – Git pour les croyances IA
memora est un outil CLI écrit en Rust qui versionne la mémoire des agents IA avec des capacités typées, traçables, branchables et fusionnables.

Savecraft MCP Server Fournit à Claude des Données Précises sur Magic: The Gathering
Savecraft est un serveur MCP open-source qui analyse localement le Player.log de MTG Arena, synchronise l'état de jeu et donne à Claude accès à 12 modules de référence experts construits sur des données réelles de Magic : The Gathering. L'outil empêche Claude d'halluciner les noms de cartes et les règles en lui fournissant un accès aux données réelles d'Arena, aux recommandations de draft de 17Lands et à la base de données complète de Scryfall.