Pantheon-Reasoning-27B: Un modelo de RP de razonamiento denso de Gryphe

✍️ OpenClawRadar📅 Publicado: 17 de junio de 2026🔗 Source
Pantheon-Reasoning-27B: Un modelo de RP de razonamiento denso de Gryphe
Ad

Gryphe ha lanzado Pantheon-Reasoning-27B, un modelo de razonamiento ajustado para juegos de rol basado en llmfan46/Qwen3.6-27B-uncensored-heretic-v2-Native-MTP-Preserved. El modelo busca aportar razonamiento estructurado al trabajo de personajes: sopesar el tono, planificar los giros narrativos y considerar cómo respondería realmente un personaje antes de generar una línea.

La composición de los datos de entrenamiento (todos con trazas de razonamiento completas):

  • Datos de Pantheon (~28%) — corpus principal de rol con trazas de razonamiento generadas a posteriori
  • Opus-4.6-Reasoning-24k (~21%) — trazas de razonamiento limpias de Claude Opus 4.6 para STEM, programación y seguimiento de instrucciones
  • Datos de WorldSim (~16%) — juego de rol narrativo extenso de Opus 4.6 con razonamiento nativo, principalmente en tercera persona y tiempo presente
  • Datos de aventuras de texto (~16%) — ficción interactiva y contenido de aventuras de texto con razonamiento generado a posteriori
  • Datos generales de rol (~16%) — transcripciones variadas de rol con razonamiento generado a posteriori
  • Datos de Tiamat (~3%) — conjunto de datos de personajes/RP de Tiamat-24B-Magistral con un proceso de mejora de múltiples pasos, razonamiento generado a posteriori por intercambio

El modelo se entrenó con preserve_thinking: true, por lo que las etiquetas de pensamiento permanecen activas en todos los turnos del asistente en conversaciones de múltiples turnos, no solo en el primero.

Ad

Las cuantizaciones GGUF están disponibles para inferencia local. La elección del modelo base (Qwen 3.6 27B) fue intencionada para reducir el rechazo y mejorar la capacidad de escritura. Gryphe señala que consideraron Gemma 4 31B, pero descubrieron que era "un dolor absoluto de entrenar" debido a peculiaridades arquitectónicas.

📖 Lee la fuente completa: r/LocalLLaMA

Ad

👀 Ver también

Bench de caché KV de Qwen 3.6-35B-A3B: f16 vs q8_0 vs Turbo3 vs Turbo4 en M5 Max hasta 1M de contexto
Noticias

Bench de caché KV de Qwen 3.6-35B-A3B: f16 vs q8_0 vs Turbo3 vs Turbo4 en M5 Max hasta 1M de contexto

Los puntos de referencia del fork TurboQuant Metal de TheTom en M5 Max muestran que f16 y q8_0 se quedan sin memoria (OOM) más allá de 256K, mientras que turbo3 alcanza 1M a 6.5 tok/s de decodificación. La división de prefill y decodificación favorece a turbo3 para prefill y a turbo4 para decodificación en contextos largos.

OpenClawRadar
🦀
Noticias

OpenClaw v2026.9.4: Descubrimiento de plugins, aprendizaje guiado de habilidades, GPT Image 2.5

OpenClaw v2026.9.4 unifica en una sola búsqueda los plugins y las skills instalados y disponibles, añade un Skill Workshop dirigible que convierte conversaciones pasadas en skills reutilizables y suma compatibilidad con GPT Image 2.5 Flare y Sunburst.

OpenClawRadar
🦀
Noticias

Claude Code v2.1.234: Insignia de MR de GitLab, Continuación Automática, Endurecimiento de Seguridad

Claude Code v2.1.234 añade una insignia de MR de GitLab, continuación automática tras los límites de uso y protección contra fugas de credenciales NTLM al rechazar rutas de espacio de nombres NT de Windows.

OpenClawRadar
🦀
Noticias

El problema de descubrimiento de la IA: los usuarios no pueden ver lo que la herramienta puede hacer

Una indicación en blanco oculta las capacidades de la IA. Los usuarios no saben qué preguntar. Las plantillas y el contexto ayudan, pero el sistema mismo debe revelar las posibilidades.

OpenClawRadar