1.2B Modelo Local Vence a 1T Nubes en Póker: La Agresión Supera al Conocimiento en Formato Todo o Nada

Un desarrollador ejecutó 6 LLMs en 5 torneos de Texas Hold'em en una MacBook de 16GB usando un framework personalizado (Hive). La alineación: Liquid lfm2.5 (1.2B, LM Studio, ~5s/decisión), Qwen3 (1.7B, LM Studio, ~2.5 min), Claude Haiku 4.5, GPT-OSS (120B, Fireworks), MiniMax M2 (230B, Fireworks) y Kimi K2 (~1T, Fireworks). Los modelos locales se ejecutaron secuencialmente debido a las limitaciones de RAM.
Resultados
- Torneo 1: Qwen (1.7B local)
- Torneo 2: MiniMax (230B cloud)
- Torneo 3: Liquid (1.2B local)
- Torneo 4: Kimi (~1T cloud)
- Torneo 5: Liquid (1.2B local)
La ejecución 3 destacó la dinámica: Liquid jugó 6 manos con 19 subidas y 0 retiros, convirtiendo un stack inicial de $1M en $5.98M. Mientras tanto, GPT-OSS (120B) ejecutó 0 subidas y 5 retiros en 6 manos, quedándose ciego. El formato (25 manos, ciegas 5K/10K + ante 1K) es efectivamente de shove-or-fold, recompensando la agresividad sobre la habilidad teórica del póker.
Conclusión Clave
Liquid no reconoce las manos malas, por lo que sube todo. Contra oponentes que se retiran demasiado, esto genera dinero. El autor señala: "No afirmo que los modelos pequeños sean más inteligentes en el póker. En este formato específico, no saber cuándo retirarse es una ventaja." Los modelos más grandes 'entienden' el póker lo suficiente para retirarse con manos débiles, pero en un torneo de stack corto, la paciencia se castiga.
Próximos Pasos
Se planean torneos más largos (100+ manos, ciegas más bajas) donde la lectura de manos importa. El framework admite personajes personalizados (rasgos de personalidad, tolerancia al riesgo, miedos). Se aceptan solicitudes para Mistral, Llama, Gemma 3. El código y los JSON completos de resultados están en GitHub: https://github.com/chiruu12/Hive (hive-arena/ para el ejecutor, tournaments/results/ para los datos).
📖 Lee la fuente original: r/LocalLLaMA
👀 Ver también

Claude Code v2.1.73: Anulaciones de Modelo, Correcciones de Estabilidad y Mejoras de Rendimiento
Claude Code v2.1.73 agrega modelOverrides para IDs de proveedores personalizados, corrige bloqueos críticos y puntos muertos, resuelve degradaciones de modelos de subagentes y mejora la estabilidad del modo de voz. La versión aborda 18 problemas específicos, incluyendo solicitudes de permisos de comandos bash, corrupción de sesiones y fallos del sandbox de Linux.

inclusionAI lanza Ling-2.6-1T: Modelo de billón de parámetros con arquitectura híbrida, atención dispersa y pensamiento rápido
Ling-2.6-1T es un nuevo modelo de código abierto con un billón de parámetros que combina MLA y Atención Lineal para lograr eficiencia en contextos largos, utilizando Supresión de Redundancia de Procesos Contextuales para reducir cadenas de pensamiento verbosas. Alcanza el SOTA de código abierto en AIME26, SWE-bench Verified, BFCL-V4, TAU2-Bench e IFBench.

NTSB retira expediente después de que la IA recreara las voces de pilotos fallecidos a partir de espectrogramas
Usuarios reconstruyeron audio de cabina a partir de espectrogramas de la NTSB usando Codex y el algoritmo Griffin-Lim. La NTSB cerró temporalmente su registro público.

Cambios de configuración con Kimi 2.5 y Opus 4.6
Un usuario está evaluando el rendimiento de Kimi 2.5 en el manejo de varias tareas, centrándose especialmente en su capacidad para gestionar cambios de configuración.