Supra-50M-Reasoning : Petit modèle open-source avec raisonnement par chaîne de pensée

SupraLabs a publié Supra-50M-Reasoning (ThinkSupra-50M), un minuscule modèle de 50 millions de paramètres qui génère une chaîne de pensée complète avant de répondre. C'est la variante de raisonnement de Supra-50M-Instruct, affinée à partir de Supra-50M-Base à l'aide d'un ensemble de données synthétiques de 500 exemples générés par Qwen3 1.7B, entraîné pendant 6 époques avec SFT en bfloat16. Expérimental, sujet aux hallucinations et entièrement ouvert.
Format d'inférence
Chaque réponse suit cette structure :
<|begin_of_thought|> ... réflexion ... <|end_of_thought|> <|begin_of_solution|> ... réponse finale ... <|end_of_solution|>
Démarrage rapide
import torch from transformers import pipeline, AutoTokenizerMODEL_ID = "SupraLabs/Supra-50M-Reasoning" tokenizer = AutoTokenizer.from_pretrained(MODEL_ID, clean_up_tokenization_spaces=False) pipe = pipeline("text-generation", model=MODEL_ID, tokenizer=tokenizer, device_map="auto", torch_dtype=torch.bfloat16 if torch.cuda.is_available() else torch.float32)
def build_prompt(instruction, input_text=""): if input_text.strip(): return f"Below is an instruction that describes a task, paired with an input that provides further context. Write a response that appropriately completes the request.\n\n### Instruction:\n{instruction}\n\n### Input:\n{input_text}\n\n### Response:\n" return f"Below is an instruction that describes a task. Write a response that appropriately completes the request.\n\n### Instruction:\n{instruction}\n\n### Response:\n"
def generate(instruction, input_text=""): result = pipe(build_prompt(instruction, input_text), max_new_tokens=512, do_sample=True, temperature=0.3, top_k=50, top_p=0.9, repetition_penalty=1.15, pad_token_id=pipe.tokenizer.pad_token_id, eos_token_id=pipe.tokenizer.eos_token_id, return_full_text=False) return result[0]['generated_text'].strip()
Exemple de sortie
Prompt : "Qu'est-ce que l'IA ?"
Réflexion : "D'accord, l'utilisateur demande ce qu'est l'IA. Laissez-moi commencer par rappeler la définition de l'IA. L'IA est un sous-ensemble de l'apprentissage automatique, plus précisément des réseaux de neurones..."
Réponse : "L'IA est un sous-ensemble de l'apprentissage automatique qui permet aux machines d'apprendre à partir des données... utilisée dans la santé, la finance et même la robotique."
Prochaines étapes
SupraLabs prévoit des modèles plus grands : Supra-124M (Base, Chat, Raisonnement) et Supra-350M (Base, Chat, Raisonnement, Codage).
Modèle sur Hugging Face : Supra-50M-Reasoning
Dataset : SupraThink-Dataset-500x
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

Exécution de Claude Code hors ligne sur un M3 Pro avec Qwen3.6 : 4 correctifs qui ont fonctionné
Quatre correctifs de variables d'environnement permettent à Claude Code de fonctionner entièrement hors ligne sur un M3 Pro avec Qwen3.6 (MoE, ~3B actifs), bouclant un cycle d'incident SRE de l'investigation à la PR sans que les données quittent la machine.

Pile de modèles d'IA open source pour un remplacement économique de Claude
Un utilisateur de Reddit partage une pile de modèles d'IA fonctionnelle utilisant des modèles open source comme Llama 3.3 70b et DeepSeek R1 32b pour une exécution locale, réduisant les coûts mensuels d'IA de plus de 60 £ à moins de 3 £ en acheminant 90 % des tâches vers des modèles gratuits.

Plugin Claude Code pour la Recherche Commerciale sur Reddit
Un plugin Claude Code automatise la recherche sur Reddit pour les entreprises en recherchant des publications pertinentes, analysant les discussions et générant des rapports structurés en markdown avec les conclusions et les liens sources. Aucune clé API requise — installez-le via GitHub et exécutez-le avec une seule commande.

soul.py ajoute une mémoire persistante aux LLM locaux avec une approche simple basée sur des fichiers.
soul.py est une bibliothèque Python qui ajoute une mémoire persistante à tout LLM en utilisant deux fichiers markdown pour l'identité et la journalisation des conversations, fonctionnant avec les modèles Ollama, OpenAI et Anthropic sans nécessiter de bases de données ou de serveurs.