Pantheon-Reasoning-27B: Um Modelo de RP de Raciocínio Denso da Gryphe

✍️ OpenClawRadar📅 Publicado: June 17, 2026🔗 Source
Pantheon-Reasoning-27B: Um Modelo de RP de Raciocínio Denso da Gryphe
Ad

Gryphe lançou o Pantheon-Reasoning-27B, um modelo de raciocínio ajustado para roleplay construído sobre llmfan46/Qwen3.6-27B-uncensored-heretic-v2-Native-MTP-Preserved. O modelo visa trazer raciocínio estruturado para o trabalho de personagens — ponderando tom, planejando batidas narrativas e considerando como um personagem realmente responderia antes de gerar uma linha.

A composição dos dados de treinamento (todos com rastros completos de raciocínio):

  • Dados Pantheon (~28%) — corpus central de roleplay com rastros de raciocínio gerados retroativamente
  • Opus-4.6-Reasoning-24k (~21%) — rastros de raciocínio limpos do Claude Opus 4.6 para STEM, codificação e instrução
  • Dados WorldSim (~16%) — roleplay narrativo longo do Opus 4.6 com raciocínio nativo, principalmente em terceira pessoa no presente
  • Dados de aventura de texto (~16%) — ficção interativa e conteúdo de aventura de texto com raciocínio gerado retroativamente
  • Dados gerais de roleplay (~16%) — transcrições variadas de roleplay com raciocínio gerado retroativamente
  • Dados Tiamat (~3%) — conjunto de dados de personagem/RP do Tiamat-24B-Magistral com pipeline de melhoria em várias etapas, raciocínio gerado retroativamente por troca

O modelo foi treinado com preserve_thinking: true, então as tags de pensamento permanecem ativas em todas as viradas do assistente em conversas de múltiplas trocas — não apenas na primeira.

Ad

Quants GGUF estão disponíveis para inferência local. A escolha do modelo base (Qwen 3.6 27B) foi intencional para redução de recusas e capacidade de escrita. Gryphe observa que considerou o Gemma 4 31B, mas o achou "um absoluto pesadelo para treinar" devido a peculiaridades arquiteturais.

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also