Strands Decider 2B: Ein Entscheidungsmodell mit 2B Parametern für agentische Workflows
Strands Labs (AWS) hat Strands Decider 2B veröffentlicht, ein quelloffenes Entscheidungsmodell mit 2 Milliarden Parametern, das für schnelle lokale Experimente und agentische Workflows optimiert ist. Anders als Allzweck-LLMs sind Entscheidungsmodelle darauf ausgelegt, zwischen einer festen Auswahl von Optionen zu wählen (z. B. „Geht es bei ‚Licht einschalten‘ um die Kaffeemaschine? Ja oder nein.“) oder einfache numerische Werte zuzuweisen (z. B. Sentiment zwischen 0 und 1).
Was es ist und warum es wichtig ist
Entscheidungsmodelle tauschen Flexibilität gegen Geschwindigkeit und Zuverlässigkeit. Sie liefern immer eine Antwort aus den vorgegebenen Optionen, laufen mit sehr geringer Latenz und geben einen Kalibrierungswert aus („Wie sicher kann ich sein, dass dies korrekt ist?“), den Frontier-LLM-APIs nicht offenlegen. Der Nachteil: Sie sind schlechter bei komplexem Reasoning und können keinen Text generieren, weshalb sie für Coding, Chatbots oder Zusammenfassungen ungeeignet sind.
Strands positioniert dies als neue Klasse von „System-1“-Modellen, nachdem TypeSafe AI Anfang des Monats Jev veröffentlicht hat. Die Absicht ist, agentische Entscheidungsschritte im Strands Harness SDK anzutreiben.
Architektur
Das Modell nimmt einen vortrainierten Qwen3.5-2B-Torso, entfernt den LM-Head (und damit die Textgenerierung) und ersetzt ihn durch einen Pointer-Head, der jede angebotene Option bewertet. Der Head vergleicht den Hidden State an jeder Optionsposition mit dem Hidden State an der <answer>-Position. Der Head ist klein — etwas über 1 Mio. Parameter — und der Torso wird mit einem Rank-16-LoRA-Adapter feinabgestimmt.
Dies ist v19 der Architektur. Die erste Iteration verwendete einen Slot-Head, der deutlich schlechter abschnitt; alle Iterationsnotizen sind im Repo.
Benchmarks
Strands hat die Genauigkeit auf dem öffentlichen Set von JevBench gemessen und die Kalibrierung über den Brier-Score auf demselben Set:
- Genauigkeit: 3. von 33 in der 2B-Klasse
- Genauigkeit ohne Modelle knapp über 2B: 1. von 30
- Latenz (Median): ~115 ms auf einer Nvidia RTX 3090, ~153 ms für kleine Aufgaben auf einem M3 MacBook
- Die Latenz skaliert ungefähr linear mit der Aufgabengröße
Verfügbarkeit
- Code auf GitHub:
strands-decider-2b - Gewichte auf Hugging Face
- Enthält alle Trainingsdaten und Skripte
- Läuft lokal auf CPU oder GPU — keine API-Aufrufe erforderlich
Für wen es gedacht ist
Entwickler, die agentische Workflows bauen und schnelle, kalibrierte Ja/Nein- oder Klassifikationsentscheidungen am Edge benötigen, sowie Forscher, die eine kleine, hackbare Basis für Experimente mit Entscheidungsmodellen suchen.
📖 Read the full source: HN AI Agents
👀 Siehe auch

Senden Sie OpenClaw-Agenten als Meeting-Teilnehmer mit Sprache, Chat und Bildschirmfreigabe
Ein neues Skill ermöglicht es OpenClaw-Agenten, Google Meet, Teams und Zoom als vollwertige Teilnehmer mit Sprachfunktion (STT/TTS), Chat, Video-Avatar und Bildschirmfreigabe zu nutzen.

Loom: Eine lokale Ausführungsumgebung für komplexe KI-Aufgaben
Loom ist ein Open-Source-Lokales Ausführungs-Framework, das entwickelt wurde, um komplexe Aufgaben zu verwalten, indem es einen strukturierten Prozess mit etwa 50 Tools, einem benutzerdefinierten Paket-Plugin-System für wiederholbare Workflows sowie sowohl CLI- als auch MCP-Server-Schnittstellen bereitstellt.

Ctxpact: Kontext-Kompaktierungs-Proxy für lokale LLMs
Ctxpact ist ein OpenAI-kompatibler Proxy, der übergroße Eingaben für lokale LLMs mit 16k-Kontextfenstern komprimiert. Er verwendet eine 3-stufige Pipeline mit DCP, Zusammenfassungs- und Extraktionsstrategien. Benchmarks zeigen, dass 110k Token auf 12k komprimiert wurden, bei 8/8 Punkten im Leseverständnis.

Mit kostenlosen LLM-APIs und Tool-Calling erstellte Pokémon-Kampf-KI-Agenten
Ein System, das Llama 3, Qwen, Gemma über kostenlose API-Stufen nutzt, um autonom Pokémon-Showdown-Kämpfe mit strukturierten Tool-Aufrufen zu spielen. Unterstützt Mensch gegen KI und KI gegen KI Modi.