Needle : un modèle d'appel d'outils de 26M paramètres construit entièrement sans FFN
Needle est un modèle de 26M paramètres conçu spécifiquement pour l'appel de fonctions en un seul essai. Il utilise des couches d'attention croisée et de gating sans FFN, basé sur l'idée que l'appel d'outils est une récupération et un assemblage (associer une requête à un nom d'outil, extraire les valeurs des arguments, produire du JSON) plutôt qu'un raisonnement. Le modèle atteint 6000 tok/s en préremplissage et 1200 tok/s en décodage sur des appareils grand public.
Détails d'entraînement
- Pré-entraîné sur 200B tokens sur 16 TPU v6e (27 heures)
- Post-entraîné sur 2B tokens de données synthétiques d'appel de fonctions (45 minutes)
- Données synthétisées via Gemini avec 15 catégories d'outils (minuteries, messagerie, navigation, maison intelligente, etc.)
Architecture : Réseaux d'attention simples
L'ensemble du modèle n'est qu'attention et gating — pas de MLP. Les auteurs soutiennent que les paramètres FFN sont gaspillés à cette échelle pour l'appel d'outils, et que cette découverte (pas de FFN) se généralise à toute tâche où le modèle a accès à des connaissances structurées externes (RAG, utilisation d'outils, génération augmentée par récupération). Le modèle n'a pas besoin de mémoriser des faits dans les poids FFN si les faits sont fournis dans l'entrée.
Benchmarks
Needle surpasse FunctionGemma-270M, Qwen-0.6B, Granite-350M et LFM2.5-350M pour l'appel de fonctions en un seul essai, bien que ces modèles aient plus de capacité pour les contextes conversationnels.
Comment l'utiliser
# Tester le modèle via le playground ou le fine-tuner sur votre Mac/PC
git clone https://github.com/cactus-compute/needle
- GitHub : github.com/cactus-compute/needle
- Poids : huggingface.co/Cactus-Compute/needle
- Documentation d'architecture : Documentation Simple Attention Networks
- Moteur d'inférence pour mobile/portables (Cactus) : github.com/cactus-compute/cactus
Tout est sous licence MIT.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

Protocole Mind : Un système open-source offre à Claude une mémoire persistante et une intégration biométrique en temps réel.
Mind Protocol est un système open-source où Claude fonctionne en continu en tant que compagnon autonome avec une mémoire persistante à travers toutes les sessions et des données en temps réel de montre Garmin injectées dans chaque conversation. L'architecture utilise Claude Code comme moteur central avec un orchestrateur qui génère des sessions parallèles et gère le cycle de vie.

Solution de contournement pour le déficit de migration de projet ChatGPT : Exporter les scripts et les invites
Un développeur a créé des scripts Python et des prompts Claude pour migrer des conversations de ChatGPT vers Claude lorsque l'exportation de données de ChatGPT ne contient pas les informations d'appartenance aux projets. La solution extrait les conversations en utilisant les titres capturés depuis l'interface.

SprintiQ : Planification de Sprint Open-Source pour Claude Code
SprintiQ est une plateforme agile open-source qui sert de couche d'orchestration pour Claude Code, offrant la génération d'user stories assistée par IA, la planification de sprints, le suivi de vélocité, et une CLI qui synchronise l'activité git avec les sprints en temps réel.

EvalShift : CLI open source pour détecter les régressions LLM lors de la migration de modèle
EvalShift est un CLI Python sous licence MIT qui compare les sorties des LLM source et cible sur des invites, des agents et des workflows d'appel d'outils, générant un rapport de régression HTML local.