Steerling-8B : Un modèle de langage interprétable avec attribution au niveau des tokens

✍️ OpenClawRadar📅 Publié: February 24, 2026🔗 Source
Steerling-8B : Un modèle de langage interprétable avec attribution au niveau des tokens
Ad

Architecture du modèle et capacités

Steerling-8B repose sur une architecture de diffusion discrète causale qui permet d'orienter la génération sur des séquences multi-tokens plutôt qu'au niveau du token suivant uniquement. La conception clé décompose les embeddings du modèle en trois voies explicites : environ 33 000 concepts « connus » supervisés, environ 100 000 concepts « découverts » que le modèle apprend par lui-même, et une composante résiduelle qui capture les informations restantes.

Le modèle utilise des fonctions de perte d'entraînement qui assurent le routage du signal à travers les concepts sans compromettre fondamentalement les performances. Les concepts alimentent les logits via un chemin linéaire, permettant à chaque prédiction de se décomposer exactement en contributions par concept. Ces contributions peuvent être modifiées au moment de l'inférence sans réentraînement.

Mesures de performance et d'interprétabilité

Malgré un entraînement nécessitant significativement moins de calcul que des modèles comparables, Steerling-8B atteint des performances compétitives sur les benchmarks standards. Le modèle surpasse à la fois LLaMA2-7B et Deepseek-7B en moyenne globale malgré l'utilisation de moins de FLOPs, et reste dans la fourchette des modèles entraînés avec 2 à 10 fois plus de puissance de calcul.

Sur un ensemble de validation réservé, plus de 84 % de la contribution au niveau des tokens provient du module de concepts, indiquant que le modèle n'utilise pas seulement le résiduel pour faire des prédictions. Lorsque la voie résiduelle est supprimée, la performance sur plusieurs tâches LM Harness ne montre qu'un effet mineur, suggérant que le signal prédictif du modèle est largement acheminé via les concepts plutôt que par des canaux cachés.

Steerling peut détecter des concepts connus dans le texte avec une AUC (aire sous la courbe) de 96,2 %.

Ad

Fonctionnalités pratiques

Pour tout groupe de tokens de sortie généré par Steerling, les utilisateurs peuvent retracer ces tokens vers :

  • Contexte d'entrée : Les tokens spécifiques du prompt qui ont influencé la sortie
  • Concepts : Des sujets compréhensibles par l'humain dans les représentations du modèle (à la fois le ton comme « analytique, clinique » et le contenu comme « Méthodologies d'altération génétique »)
  • Données d'entraînement : Les sources de données d'entraînement qui ont conduit à la sortie, montrant la répartition entre des sources comme ArXiv, Wikipédia et FLAN

Le modèle permet un alignement au moment de l'inférence via le contrôle des concepts, remplaçant des milliers d'exemples d'entraînement de sécurité par un pilotage explicite au niveau conceptuel. Il permet également de supprimer ou d'amplifier des concepts spécifiques au moment de l'inférence sans réentraînement.

Artéfacts disponibles

  • Poids du modèle disponibles sur Hugging Face
  • Code compagnon sur GitHub
  • Package sur PyPI

📖 Lire la source complète : HN AI Agents

Ad

👀 See Also

DoomVLM : Outil Open Source pour Tester les Modèles de Vision et Langage dans les Matchs à Mort de Doom
Tools

DoomVLM : Outil Open Source pour Tester les Modèles de Vision et Langage dans les Matchs à Mort de Doom

DoomVLM est désormais open source sous la forme d'un unique notebook Jupyter qui permet de tester des modèles de langage visuel jouant à Doom via des API compatibles OpenAI. L'outil prend en charge les modes deathmatch où jusqu'à 4 modèles peuvent s'affronter, avec des options de configuration complètes pour les prompts système, les descriptions d'outils et les paramètres d'échantillonnage.

OpenClawRadar
Système à 2 invites pour transporter le contexte entre les discussions Claude sans gaspillage de jetons
Tools

Système à 2 invites pour transporter le contexte entre les discussions Claude sans gaspillage de jetons

Un développeur partage deux prompts pour compresser l'intégralité d'une conversation Claude en un bloc de contexte structuré et le charger dans un nouveau chat, préservant les décisions, le travail et les prochaines étapes.

OpenClawRadar
Flavian : Un Framework de Développement WordPress avec 24 Agents de Code Claude Spécialisés
Tools

Flavian : Un Framework de Développement WordPress avec 24 Agents de Code Claude Spécialisés

Flavian est un framework de développement WordPress open-source construit autour de Claude Code, proposant 24 agents spécialisés pour des tâches comme le développement frontend, les audits de sécurité et la conversion Figma-vers-WordPress. Le créateur a constaté que les agents spécialisés surpassent significativement les agents polyvalents pour le développement WordPress.

OpenClawRadar
ClawDeckX : Plateforme Web Open Source de Style macOS pour la Gestion des Agents OpenClaw
Tools

ClawDeckX : Plateforme Web Open Source de Style macOS pour la Gestion des Agents OpenClaw

ClawDeckX est une plateforme web open-source pour installer, configurer et surveiller les agents OpenClaw. Elle propose des outils de gestion visuelle, une surveillance en temps réel et prend en charge 13 langues.

OpenClawRadar