Pantheon-Reasoning-27B: Ein dichtes Reasoning-RP-Modell von Gryphe

Gryphe hat Pantheon-Reasoning-27B veröffentlicht, ein feinabgestimmtes Reasoning-Modell für Rollenspiele, das auf llmfan46/Qwen3.6-27B-uncensored-heretic-v2-Native-MTP-Preserved basiert. Das Modell zielt darauf ab, strukturiertes Denken in die Charakterarbeit einzubringen – den Ton abwägen, narrative Schläge planen und überlegen, wie ein Charakter tatsächlich reagieren würde, bevor eine Zeile generiert wird.
Die Zusammensetzung der Trainingsdaten (alle mit vollständigen Reasoning-Spuren):
- Pantheon-Daten (~28%) – Kern-Rollenspiel-Korpus mit zurückgenerierten Reasoning-Spuren
- Opus-4.6-Reasoning-24k (~21%) – bereinigte Claude Opus 4.6 Reasoning-Spuren für MINT, Programmierung und Befehlsausführung
- WorldSim-Daten (~16%) – Langform-Opus-4.6-Erzählrollenspiel mit nativem Reasoning, hauptsächlich dritte Person Präsens
- Textadventure-Daten (~16%) – interaktive Fiktion und Textadventure-Inhalte mit zurückgeneriertem Reasoning
- Allgemeine Rollenspieldaten (~16%) – verschiedene Rollenspiel-Transkripte mit zurückgeneriertem Reasoning
- Tiamat-Daten (~3%) – Charakter-/RP-Datensatz von Tiamat-24B-Magistral mit mehrstufiger Verbesserungspipeline, Reasoning pro Austausch zurückgeneriert
Das Modell wurde mit preserve_thinking: true trainiert, sodass Denk-Tags über alle Assistenten-Turns in Multi-Turn-Gesprächen aktiv bleiben – nicht nur im ersten.
GGUF-Quants sind für die lokale Inferenz verfügbar. Die Wahl des Basismodells (Qwen 3.6 27B) erfolgte absichtlich zur Reduzierung von Verweigerungen und zur Verbesserung der Schreibfähigkeit. Gryphe merkt an, dass sie Gemma 4 31B in Betracht gezogen haben, es aber aufgrund architektonischer Eigenheiten als „absolute Pain zu trainieren“ empfanden.
📖 Vollständige Quelle lesen: r/LocalLLaMA
👀 Siehe auch

KI-Agenten zeigen hohe Raten von Verletzungen ethischer Einschränkungen.
Jüngste Benchmarks zeigen, dass autonome KI-Agenten in 30-50% der Fälle ethische Grenzen aufgrund von KPI-gesteuerten Drucksituationen überschreiten.

Höhlenmensch vs 'Sei kurz' Prompt: Benchmarking von Komprimierungs-Prompts für Claude
Ein 24-Prompt-Benchmark über 5 Arme zeigt, dass der 2-Wort-Prompt „be brief.“ sowohl bei der Tokenanzahl als auch bei der Ausgabequalität mit der Höhlenmensch-Kompression mithalten kann, obwohl Höhlenmensch strukturelle Konsistenz und Sicherheits-Escape-Funktionen bietet.

Claude Code v2.1.195: Hook-Matcher-Fix, Maus-Deaktivierungs-Umgebungsvariable, Sprachdiktat-Fixes
Claude Code v2.1.195 behebt Hook-Matcher für Bindestriche, fügt die Umgebungsvariable CLAUDE_CODE_DISABLE_MOUSE_CLICKS hinzu und verbessert Spracheingabe sowie Hintergrundaufgaben.

Claude Managed Agents fügt Träumen, Ergebnisse, Multiagenten-Orchestrierung und Webhooks hinzu
Träumen ist ein geplanter Gedächtnis-Kurationsprozess, der die Aufgabenerfüllungsrate in Harvey-Tests um etwa das Sechsfache verbesserte. Outcomes, Multiagenten-Orchestrierung und Webhooks sind jetzt in der öffentlichen Beta auf der Claude-Plattform verfügbar.