Supra-50M-추론: 사고체인을 활용한 오픈소스 소형 모델

✍️ OpenClawRadar📅 게시일: June 20, 2026🔗 Source
Supra-50M-추론: 사고체인을 활용한 오픈소스 소형 모델
Ad

SupraLabs가 Supra-50M-Reasoning(ThinkSupra-50M)을 출시했습니다. 이는 응답 전에 완전한 사고 사슬(CoT)을 생성하는 50M 파라미터의 소형 모델입니다. Supra-50M-Instruct의 추론 변형으로, Qwen3 1.7B가 생성한 500개 합성 샘플 데이터셋을 사용하여 Supra-50M-Base에서 미세 조정되었으며, bfloat16으로 SFT를 통해 6 에폭 학습했습니다. 실험적이며 환각 현상이 발생하기 쉽고, 완전히 공개되었습니다.

추론 형식

모든 응답은 다음 구조를 따릅니다:

<|begin_of_thought|> ... 생각 ... <|end_of_thought|> <|begin_of_solution|> ... 최종 답변 ... <|end_of_solution|>

빠른 시작

import torch
from transformers import pipeline, AutoTokenizer

MODEL_ID = "SupraLabs/Supra-50M-Reasoning" tokenizer = AutoTokenizer.from_pretrained(MODEL_ID, clean_up_tokenization_spaces=False) pipe = pipeline("text-generation", model=MODEL_ID, tokenizer=tokenizer, device_map="auto", torch_dtype=torch.bfloat16 if torch.cuda.is_available() else torch.float32)

def build_prompt(instruction, input_text=""): if input_text.strip(): return f"Below is an instruction that describes a task, paired with an input that provides further context. Write a response that appropriately completes the request.\n\n### Instruction:\n{instruction}\n\n### Input:\n{input_text}\n\n### Response:\n" return f"Below is an instruction that describes a task. Write a response that appropriately completes the request.\n\n### Instruction:\n{instruction}\n\n### Response:\n"

def generate(instruction, input_text=""): result = pipe(build_prompt(instruction, input_text), max_new_tokens=512, do_sample=True, temperature=0.3, top_k=50, top_p=0.9, repetition_penalty=1.15, pad_token_id=pipe.tokenizer.pad_token_id, eos_token_id=pipe.tokenizer.eos_token_id, return_full_text=False) return result[0]['generated_text'].strip()

Ad

샘플 출력

프롬프트: "AI란 무엇인가?"

생각: "좋아요, 사용자가 AI에 대해 묻고 있습니다. 먼저 AI가 무엇인지 떠올려 봅시다. AI는 머신러닝의 하위 집합, 특히 신경망입니다..."

응답: "AI는 머신러닝의 하위 집합으로, 기계가 데이터로부터 학습할 수 있도록 하는 데 중점을 둡니다... 의료, 금융, 로봇공학 분야에서 사용됩니다."

다음 단계

SupraLabs는 더 큰 모델을 계획 중입니다: Supra-124M(Base, Chat, Reasoning)과 Supra-350M(Base, Chat, Reasoning, Coding).

Hugging Face 모델: Supra-50M-Reasoning
데이터셋: SupraThink-Dataset-500x

📖 전체 출처 읽기: r/LocalLLaMA

Ad

👀 See Also

벤치마크 결과: 메모리 시스템을 탑재한 클로드 에이전트 스웜, 토큰 비용 30-43% 절감 효과 확인
Tools

벤치마크 결과: 메모리 시스템을 탑재한 클로드 에이전트 스웜, 토큰 비용 30-43% 절감 효과 확인

한 개발자가 40점짜리 코딩 작업에서 6개의 에이전트로 구성된 Claude 스웜을 사용자 정의 메모리 시스템인 Stompy를 적용한 경우와 적용하지 않은 경우로 테스트했습니다. 결과에 따르면, 메모리를 적용한 Sonnet 4.6은 $3.98의 비용으로 완벽한 점수를 달성한 반면, 메모리를 적용하지 않은 경우 $7.04의 비용이 들었습니다. Haiku 4.5는 메모리 없이는 완전히 실패했지만, 메모리를 적용하면 39/40점을 기록했습니다.

OpenClawRadar
로우보트: 지식 그래프 메모리를 갖춘 오픈소스 AI 동료
Tools

로우보트: 지식 그래프 메모리를 갖춘 오픈소스 AI 동료

Rowboat는 작업을 살아있는 지식 그래프로 변환하는 오픈소스 앱으로, 데이터를 로컬에 마크다운 형식으로 저장하며 AI 기반 로컬 지원을 제공합니다.

OpenClawRadar
Ctxpact: 로컬 LLM을 위한 컨텍스트 압축 프록시
Tools

Ctxpact: 로컬 LLM을 위한 컨텍스트 압축 프록시

Ctxpact는 16k 컨텍스트 윈도우를 가진 로컬 LLM을 위해 과도하게 큰 입력을 압축하는 OpenAI 호환 프록시로, DCP, 요약, 추출 전략을 포함한 3단계 파이프라인을 사용합니다. 벤치마크 결과, 110k 토큰이 12k로 압축되었으며 8개의 독해 질문 중 8개 정답을 기록했습니다.

OpenClawRadar
VTCode: AST 수준 청킹으로 컨텍스트를 적극적으로 축소하는 Rust TUI 코딩 에이전트
Tools

VTCode: AST 수준 청킹으로 컨텍스트를 적극적으로 축소하는 Rust TUI 코딩 에이전트

VTCode는 AST 레벨 청킹을 통해 컨텍스트를 적극적으로 정리하는 오픈소스 Rust TUI 코딩 에이전트입니다. ripgrep과 ast-grep을 사용하며, macOS Seatbelt 및 Linux Landlock 샌드박싱, tree-sitter-bash를 통한 생성 명령어 검증을 지원합니다.

OpenClawRadar