1,2B de modèle local bat 1T de clouds au poker : l'agression l'emporte sur la connaissance en format push-or-fold

✍️ OpenClawRadar📅 Publié: May 19, 2026🔗 Source
1,2B de modèle local bat 1T de clouds au poker : l'agression l'emporte sur la connaissance en format push-or-fold
Ad

Un développeur a fait jouer 6 LLM dans 5 tournois de Texas Hold'em sur un MacBook de 16 Go en utilisant un framework personnalisé (Hive). Les participants : Liquid lfm2.5 (1,2B, LM Studio, ~5s/décision), Qwen3 (1,7B, LM Studio, ~2,5 min), Claude Haiku 4.5, GPT-OSS (120B, Fireworks), MiniMax M2 (230B, Fireworks) et Kimi K2 (~1T, Fireworks). Les modèles locaux ont joué séquentiellement en raison des limites de RAM.

Résultats

  • Tournoi 1 : Qwen (1,7B local)
  • Tournoi 2 : MiniMax (230B cloud)
  • Tournoi 3 : Liquid (1,2B local)
  • Tournoi 4 : Kimi (~1T cloud)
  • Tournoi 5 : Liquid (1,2B local)

La partie 3 a illustré la dynamique : Liquid a joué 6 mains avec 19 relances et 0 abandons, transformant un tapis de départ de 1M$ en 5,98M$. Pendant ce temps, GPT-OSS (120B) a effectué 0 relances et 5 abandons en 6 mains, se faisant éliminer par les blinds. Le format (25 mains, blinds 5K/10K + ante 1K) est essentiellement un « tapis ou rien », récompensant l'agressivité plutôt que la compétence théorique au poker.

Ad

Point clé

Liquid ne reconnaît pas les mauvaises mains, donc il relance tout. Contre des adversaires qui se couchent trop souvent, cela rapporte gros. L'auteur note : « Je ne prétends pas que les petits modèles sont plus intelligents au poker. Dans ce format spécifique, ne pas savoir quand se coucher est un avantage. » Les modèles plus grands « comprennent » assez le poker pour se coucher sur des mains faibles, mais dans un tournoi à tapis court, la patience est punie.

Prochaines étapes

Prévoit des tournois plus longs (100+ mains, blinds plus basses) où la lecture des mains compte. Le framework prend en charge des personnalités personnalisées (traits de personnalité, tolérance au risque, peurs). Les demandes pour Mistral, Llama, Gemma 3 sont les bienvenues. Le code et les JSON complets des résultats sont sur GitHub : https://github.com/chiruu12/Hive (hive-arena/ pour l'exécuteur, tournaments/results/ pour les données).

📖 Lire la source complète : r/LocalLLaMA

Ad

👀 See Also

Réimplémentation de l'IA de la bibliothèque chardet soulève des questions de licence copyleft.
News

Réimplémentation de l'IA de la bibliothèque chardet soulève des questions de licence copyleft.

Dan Blanchard a utilisé Claude d'Anthropic pour réimplémenter la bibliothèque Python chardet à partir de zéro, en changeant la licence de LGPL à MIT. Le code résultant présente moins de 1,3 % de similarité avec les versions précédentes, suscitant un débat sur la question de savoir si la réimplémentation assistée par IA érode les protections copyleft.

OpenClawRadar
L'affinage de Phi-4-mini en n'entraînant que les paramètres de LayerNorm ne parvient pas à améliorer les performances.
News

L'affinage de Phi-4-mini en n'entraînant que les paramètres de LayerNorm ne parvient pas à améliorer les performances.

Un amateur a testé l'entraînement uniquement des valeurs γ de LayerNorm sur Phi-4-mini dans les domaines Python et médical avec différents taux d'apprentissage et formats de données. Les performances se sont légèrement dégradées sur tous les benchmarks par rapport à la ligne de base, l'auteur concluant que les transformers acheminent déjà l'information dynamiquement via l'attention.

OpenClawRadar
Changements fréquents de rupture d'OpenClaw : Procédures de mise à jour et problèmes actuels
News

Changements fréquents de rupture d'OpenClaw : Procédures de mise à jour et problèmes actuels

OpenClaw a publié 13 versions mineures en mars 2026 seulement, avec des changements cassants survenant toutes les 2-3 semaines. La source fournit des procédures de mise à jour spécifiques et détaille les problèmes actuels de la version 3.28, y compris les modifications d'authentification localhost et les régressions.

OpenClawRadar
OpenClaw lance BotsChat : un outil de chat natif qui révolutionne la communication entre agents.
News

OpenClaw lance BotsChat : un outil de chat natif qui révolutionne la communication entre agents.

OpenClaw présente BotsChat, un nouvel outil de discussion natif conçu pour améliorer la communication entre les agents d'IA de codage. Découvrez comment cet outil peut rationaliser vos processus d'automatisation.

OpenClawRadar