Pantheon-Reasoning-27B: Un modelo de RP de razonamiento denso de Gryphe

Gryphe ha lanzado Pantheon-Reasoning-27B, un modelo de razonamiento ajustado para juegos de rol basado en llmfan46/Qwen3.6-27B-uncensored-heretic-v2-Native-MTP-Preserved. El modelo busca aportar razonamiento estructurado al trabajo de personajes: sopesar el tono, planificar los giros narrativos y considerar cómo respondería realmente un personaje antes de generar una línea.
La composición de los datos de entrenamiento (todos con trazas de razonamiento completas):
- Datos de Pantheon (~28%) — corpus principal de rol con trazas de razonamiento generadas a posteriori
- Opus-4.6-Reasoning-24k (~21%) — trazas de razonamiento limpias de Claude Opus 4.6 para STEM, programación y seguimiento de instrucciones
- Datos de WorldSim (~16%) — juego de rol narrativo extenso de Opus 4.6 con razonamiento nativo, principalmente en tercera persona y tiempo presente
- Datos de aventuras de texto (~16%) — ficción interactiva y contenido de aventuras de texto con razonamiento generado a posteriori
- Datos generales de rol (~16%) — transcripciones variadas de rol con razonamiento generado a posteriori
- Datos de Tiamat (~3%) — conjunto de datos de personajes/RP de Tiamat-24B-Magistral con un proceso de mejora de múltiples pasos, razonamiento generado a posteriori por intercambio
El modelo se entrenó con preserve_thinking: true, por lo que las etiquetas de pensamiento permanecen activas en todos los turnos del asistente en conversaciones de múltiples turnos, no solo en el primero.
Las cuantizaciones GGUF están disponibles para inferencia local. La elección del modelo base (Qwen 3.6 27B) fue intencionada para reducir el rechazo y mejorar la capacidad de escritura. Gryphe señala que consideraron Gemma 4 31B, pero descubrieron que era "un dolor absoluto de entrenar" debido a peculiaridades arquitectónicas.
📖 Lee la fuente completa: r/LocalLLaMA
👀 Ver también

Informe de Anthropic sobre la Intensidad de la Adopción Global de IA
Los últimos datos de Anthropic revelan una adopción global de IA desigual, midiendo la intensidad de uso en lugar del total de usuarios. El informe muestra dónde la IA está integrada en flujos de trabajo como programación, investigación y toma de decisiones tanto en individuos como en empresas.

MiMo-V2.5-Pro Evaluado: Fuerte Razonamiento en Deducción Social, Buena Relación Calidad vs K2.6
MiMo-V2.5-Pro compite con Kimi K2.6 en partidas autónomas de Blood on the Clocktower, con una tasa de victorias desequilibrada del 88% como Equipo Bueno / 48% como Equipo Malvado, cuesta 0.99 $ por partida con 183.000 tokens de salida, y es práctico con partidas de 2 a 3 horas.

Anthropic elimina el código de Claude de la suscripción Pro para nuevos usuarios en prueba
Anthropic eliminó temporalmente el acceso a Claude Code de su plan de suscripción Pro de $20/mes para nuevos usuarios, cambiando las páginas de precios del sitio web y los documentos de soporte antes de revertir los cambios. La empresa lo describió como una 'pequeña prueba del 2% de las nuevas suscripciones de prosumidores'.

NVIDIA anuncia NemoClaw con funciones de seguridad OpenShell.
NVIDIA anunció NemoClaw en GTC, basándose en OpenClaw para añadir seguridad de nivel empresarial a través de OpenShell, que aplica barreras de privacidad y seguridad basadas en políticas para agentes de IA.