1.2B Modelo Local Vence a 1T Nubes en Póker: La Agresión Supera al Conocimiento en Formato Todo o Nada

Un desarrollador ejecutó 6 LLMs en 5 torneos de Texas Hold'em en una MacBook de 16GB usando un framework personalizado (Hive). La alineación: Liquid lfm2.5 (1.2B, LM Studio, ~5s/decisión), Qwen3 (1.7B, LM Studio, ~2.5 min), Claude Haiku 4.5, GPT-OSS (120B, Fireworks), MiniMax M2 (230B, Fireworks) y Kimi K2 (~1T, Fireworks). Los modelos locales se ejecutaron secuencialmente debido a las limitaciones de RAM.
Resultados
- Torneo 1: Qwen (1.7B local)
- Torneo 2: MiniMax (230B cloud)
- Torneo 3: Liquid (1.2B local)
- Torneo 4: Kimi (~1T cloud)
- Torneo 5: Liquid (1.2B local)
La ejecución 3 destacó la dinámica: Liquid jugó 6 manos con 19 subidas y 0 retiros, convirtiendo un stack inicial de $1M en $5.98M. Mientras tanto, GPT-OSS (120B) ejecutó 0 subidas y 5 retiros en 6 manos, quedándose ciego. El formato (25 manos, ciegas 5K/10K + ante 1K) es efectivamente de shove-or-fold, recompensando la agresividad sobre la habilidad teórica del póker.
Conclusión Clave
Liquid no reconoce las manos malas, por lo que sube todo. Contra oponentes que se retiran demasiado, esto genera dinero. El autor señala: "No afirmo que los modelos pequeños sean más inteligentes en el póker. En este formato específico, no saber cuándo retirarse es una ventaja." Los modelos más grandes 'entienden' el póker lo suficiente para retirarse con manos débiles, pero en un torneo de stack corto, la paciencia se castiga.
Próximos Pasos
Se planean torneos más largos (100+ manos, ciegas más bajas) donde la lectura de manos importa. El framework admite personajes personalizados (rasgos de personalidad, tolerancia al riesgo, miedos). Se aceptan solicitudes para Mistral, Llama, Gemma 3. El código y los JSON completos de resultados están en GitHub: https://github.com/chiruu12/Hive (hive-arena/ para el ejecutor, tournaments/results/ para los datos).
📖 Lee la fuente original: r/LocalLLaMA
👀 Ver también

Claude Code v2.1.203: Lanzamiento de corrección de errores importante con recuperación de sesión en segundo plano y mejoras de rendimiento
Claude Code v2.1.203 corrige bloqueos del agente en segundo plano en macOS, recuperación de tokens caducados, problemas de herencia de PATH y reduce el tamaño del binario en 7 MB con ahorro de memoria de inicio.

El Mínimo de Cinco Asientos de Claude Crea una Brecha de Privacidad para los Profesionales Independientes
Las protecciones de privacidad del nivel empresarial de Anthropic requieren un mínimo de cinco asientos, lo que obliga a los profesionales independientes a pagar por asientos vacíos o usar planes de consumo con términos de privacidad inadecuados. Esta brecha contrasta con Google Workspace y los planes empresariales de OpenAI, que ofrecen privacidad de nivel empresarial con precios por asiento individual.

Merlin Research lanza el modelo Qwen3.5-4B-Safety-Thinking para razonamiento estructurado.
Merlin Research ha lanzado Qwen3.5-4B-Safety-Thinking, un modelo de razonamiento alineado con la seguridad de 4 mil millones de parámetros basado en Qwen3.5. El modelo está diseñado para un 'pensamiento' estructurado y la seguridad en escenarios del mundo real, incluidos los sistemas de agentes.

Los modelos Bonsai 1-bit Qwen de PrismML probados: 107 t/s de generación con 8 GB de VRAM.
Los modelos Bonsai de PrismML son versiones cuantizadas de 1 bit de Qwen3 8B, 4B y 1.7B que logran una generación de 107 tokens/segundo y un procesamiento de prompts de >1114 t/s en una RTX 4060 con 8GB de VRAM, con requisitos de memoria significativamente reducidos.