Supra-50M-Reasoning: открытая малогабаритная модель с цепью логических рассуждений

✍️ OpenClawRadar📅 Опубликовано: 20 июня 2026 г.🔗 Source
Supra-50M-Reasoning: открытая малогабаритная модель с цепью логических рассуждений
Ad

SupraLabs выпустила Supra-50M-Reasoning (ThinkSupra-50M) — крошечную модель с 50M параметров, которая перед ответом генерирует полную цепочку рассуждений (CoT). Это вариант для рассуждений от Supra-50M-Instruct, дообученный на базе Supra-50M-Base с использованием синтетического набора данных из 500 примеров, сгенерированных Qwen3 1.7B, обученный в течение 6 эпох с SFT в bfloat16. Экспериментальная версия, склонна к галлюцинациям, полностью открыта.

Формат вывода

Каждый ответ следует этой структуре:

<|begin_of_thought|> ... рассуждение ... <|end_of_thought|> <|begin_of_solution|> ... окончательный ответ ... <|end_of_solution|>

Быстрый старт

import torch
from transformers import pipeline, AutoTokenizer

MODEL_ID = "SupraLabs/Supra-50M-Reasoning" tokenizer = AutoTokenizer.from_pretrained(MODEL_ID, clean_up_tokenization_spaces=False) pipe = pipeline("text-generation", model=MODEL_ID, tokenizer=tokenizer, device_map="auto", torch_dtype=torch.bfloat16 if torch.cuda.is_available() else torch.float32)

def build_prompt(instruction, input_text=""): if input_text.strip(): return f"Below is an instruction that describes a task, paired with an input that provides further context. Write a response that appropriately completes the request.\n\n### Instruction:\n{instruction}\n\n### Input:\n{input_text}\n\n### Response:\n" return f"Below is an instruction that describes a task. Write a response that appropriately completes the request.\n\n### Instruction:\n{instruction}\n\n### Response:\n"

def generate(instruction, input_text=""): result = pipe(build_prompt(instruction, input_text), max_new_tokens=512, do_sample=True, temperature=0.3, top_k=50, top_p=0.9, repetition_penalty=1.15, pad_token_id=pipe.tokenizer.pad_token_id, eos_token_id=pipe.tokenizer.eos_token_id, return_full_text=False) return result[0]['generated_text'].strip()

Ad

Пример вывода

Промпт: "Что такое ИИ?"

Рассуждение: "Итак, пользователь спрашивает об ИИ. Давайте начну с того, что такое ИИ. ИИ — это подмножество машинного обучения, а именно нейронные сети..."

Ответ: "ИИ — это подмножество машинного обучения, которое позволяет машинам учиться на данных... используется в здравоохранении, финансах и даже в робототехнике."

Что дальше

SupraLabs планирует более крупные модели: Supra-124M (Base, Chat, Reasoning) и Supra-350M (Base, Chat, Reasoning, Coding).

Модель на Hugging Face: Supra-50M-Reasoning
Набор данных: SupraThink-Dataset-500x

📖 Читать полный источник: r/LocalLLaMA

Ad

👀 Смотрите также

Claude AI Opus отключает авторегулировку яркости Intel DPST через редактирование реестра в ключе 0002
Инструменты

Claude AI Opus отключает авторегулировку яркости Intel DPST через редактирование реестра в ключе 0002

Пользователь Reddit автоматизировал исправление автоматического затемнения Intel Display Power Saving Technology, позволив Claude AI Opus отредактировать реестр — ИИ нашел правильное значение FeatureTestControl и расположение ключа.

OpenClawRadar
Прямой разговор: навык Claude с открытым исходным кодом, который требует честной обратной связи, а не одобрения
Инструменты

Прямой разговор: навык Claude с открытым исходным кодом, который требует честной обратной связи, а не одобрения

Новый открытый навык Claude под названием Straight Talk заставляет Claude отказываться от подтверждения идей, пока он не поймет ситуацию, а затем генерирует контраргументы и проверяет предположения на прочность.

OpenClawRadar
Markdown как протокол для агентного пользовательского интерфейса с потоковым выполнением
Инструменты

Markdown как протокол для агентного пользовательского интерфейса с потоковым выполнением

Прототип использует Markdown в качестве унифицированного протокола для потоковой передачи текста, исполняемого кода и данных в одном ответе AI-агентов. Он поддерживает потоковое выполнение, где код запускается построчно по мере поступления, и примитив mount() для создания React UI с потоком данных между клиентом, сервером и LLM.

OpenClawRadar
Memento Vault: Локальный инструмент для сохранения контекста в сессиях Claude Code
Инструменты

Memento Vault: Локальный инструмент для сохранения контекста в сессиях Claude Code

Memento Vault — это набор хуков, которые автоматически захватывают транскрипты сессий, оценивают их и сохраняют атомарные заметки в локальном git-репозитории. Он обеспечивает поиск с нулевой стоимостью через BM25 + векторный поиск со средней задержкой 472 мс и вводит релевантный контекст при запуске сессии, при каждом запросе и при чтении файлов.

OpenClawRadar