Modelo Local de 1,2B Supera Nuvens de 1T no Pôquer: Agressão Supera Conhecimento no Formato Shove-or-Fold

✍️ OpenClawRadar📅 Publicado: May 19, 2026🔗 Source
Modelo Local de 1,2B Supera Nuvens de 1T no Pôquer: Agressão Supera Conhecimento no Formato Shove-or-Fold
Ad

Um desenvolvedor executou 6 LLMs em 5 torneios de Texas Hold'em em um MacBook de 16GB usando uma estrutura personalizada (Hive). A escalação: Liquid lfm2.5 (1,2B, LM Studio, ~5s/decidir), Qwen3 (1,7B, LM Studio, ~2,5 min), Claude Haiku 4.5, GPT-OSS (120B, Fireworks), MiniMax M2 (230B, Fireworks) e Kimi K2 (~1T, Fireworks). Os locais rodaram sequencialmente devido aos limites de RAM.

Resultados

  • Torneio 1: Qwen (1,7B local)
  • Torneio 2: MiniMax (230B nuvem)
  • Torneio 3: Liquid (1,2B local)
  • Torneio 4: Kimi (~1T nuvem)
  • Torneio 5: Liquid (1,2B local)

A execução 3 destacou a dinâmica: Liquid jogou 6 mãos com 19 aumentos e 0 desistências, transformando uma pilha inicial de $1M em $5,98M. Enquanto isso, GPT-OSS (120B) executou 0 aumentos e 5 desistências em 6 mãos, sendo eliminado pelos blinds. O formato (25 mãos, blinds 5K/10K + ante 1K) é efetivamente de "all-in ou desistir", recompensando agressão sobre habilidade teórica de pôquer.

Ad

Insight Principal

Liquid não reconhece mãos ruins, então aumenta tudo. Contra oponentes que desistem com frequência, isso gera dinheiro. O autor observa: "Não estou afirmando que modelos pequenos são mais inteligentes no pôquer. Neste formato específico, não saber quando desistir é uma vantagem." Modelos maiores 'entendem' pôquer o suficiente para desistir de mãos fracas, mas em um torneio de stack curto, paciência é punida.

Próximos Passos

Os planos incluem torneios mais longos (100+ mãos, blinds menores) onde a leitura de mãos importa. A estrutura suporta personas personalizadas (traços de personalidade, tolerância a risco, medos). Pedidos por Mistral, Llama, Gemma 3 são bem-vindos. Código e JSONs completos dos resultados estão no GitHub: https://github.com/chiruu12/Hive (hive-arena/ para executor, tournaments/results/ para dados).

📖 Leia a fonte original: r/LocalLLaMA

Ad

👀 See Also

Claude Opus 4.7 sofre com aumento de erros — Atualização
News

Claude Opus 4.7 sofre com aumento de erros — Atualização

Uma atualização automática de status relata erros elevados no Claude Opus 4.7. Acompanhe o progresso na página do incidente e no megathread da comunidade.

OpenClawRadar
🦀
News

Claude AI abre PR mesclado para bug de magic-link enquanto desenvolvedor dorme

Um usuário do Reddit relata que o Claude AI corrigiu automaticamente um bug de magic-link em produção às 4:46 AM — a etapa trim/lowercase foi movida para antes da validação do email — PR mesclada sem alterações.

OpenClawRadar
Pesquisadores de Cambridge desenvolvem memristor de óxido de háfnio para chips de IA de baixo consumo energético
News

Pesquisadores de Cambridge desenvolvem memristor de óxido de háfnio para chips de IA de baixo consumo energético

Pesquisadores da Universidade de Cambridge criaram um memristor baseado em óxido de háfnio que comuta correntes um milhão de vezes menores do que dispositivos convencionais de óxido, potencialmente reduzindo o consumo de energia de hardware de IA em até 70%.

OpenClawRadar
Claude Code v2.1.81 adiciona sinalizador "bare" para scripts, corrige problemas de autenticação e modo de voz
News

Claude Code v2.1.81 adiciona sinalizador "bare" para scripts, corrige problemas de autenticação e modo de voz

Claude Code v2.1.81 introduz uma flag --bare para chamadas scriptadas -p que ignora hooks, LSP e sincronização de plugins, exigindo ANTHROPIC_API_KEY ou apiKeyHelper via --settings. A versão também corrige problemas de autenticação em múltiplas sessões simultâneas, tratamento de erros no modo de voz e adiciona permissão de retransmissão --channels.

OpenClawRadar