1.2B 로컬 모델, 1T 클라우드 모델을 포커에서 이기다: 올인 또는 폴드 형식에서 지식보다 공격성

한 개발자가 5개의 텍사스 홀덤 토너먼트에서 16GB MacBook으로 커스텀 프레임워크(Hive)를 사용해 6개의 LLM을 실행했습니다. 참가 모델: Liquid lfm2.5 (1.2B, LM Studio, ~5초/결정), Qwen3 (1.7B, LM Studio, ~2.5분), Claude Haiku 4.5, GPT-OSS (120B, Fireworks), MiniMax M2 (230B, Fireworks), Kimi K2 (~1T, Fireworks). 로컬 모델은 RAM 한계로 인해 순차적으로 실행되었습니다.
결과
- 토너먼트 1: Qwen (1.7B 로컬)
- 토너먼트 2: MiniMax (230B 클라우드)
- 토너먼트 3: Liquid (1.2B 로컬)
- 토너먼트 4: Kimi (~1T 클라우드)
- 토너먼트 5: Liquid (1.2B 로컬)
3라운드는 역동성을 잘 보여줍니다: Liquid는 6핸드에서 19번의 레이즈와 0번의 폴드를 수행하며, $1M의 시작 스택을 $5.98M으로 늘렸습니다. 반면 GPT-OSS (120B)는 6핸드에서 0번의 레이즈와 5번의 폴드를 기록하며 블라인드 아웃되었습니다. 이 형식(25핸드, 5K/10K 블라인드 + 1K 앤티)은 사실상 올인 또는 폴드만 가능한 구조로, 이론적인 포커 실력보다 공격성을 보상합니다.
핵심 인사이트
Liquid는 나쁜 핸드를 인식하지 못하기 때문에 모든 것을 레이즈합니다. 상대가 너무 자주 폴드하는 경우, 이는 큰 이익을 가져옵니다. 저자는 다음과 같이 언급합니다: "작은 모델이 포커에서 더 똑똑하다고 주장하는 것이 아닙니다. 이 특정 형식에서, 폴드할 때를 모르는 것이 장점입니다." 더 큰 모델은 약한 핸드를 폴드할 '이해'가 있지만, 숏스택 토너먼트에서는 인내가 불리하게 작용합니다.
다음 단계
핸드 리딩이 중요한 더 긴 토너먼트(100핸드 이상, 낮은 블라인드)를 계획 중입니다. 프레임워크는 커스텀 페르소나(성격 특성, 위험 감수성, 두려움)를 지원합니다. Mistral, Llama, Gemma 3에 대한 요청을 환영합니다. 코드와 전체 결과 JSON은 GitHub에 있습니다: https://github.com/chiruu12/Hive (hive-arena/는 러너용, tournaments/results/는 데이터용).
📖 전체 원문 읽기: r/LocalLLaMA
👀 See Also

Claude Code v2.1.191: /rewind, CPU 수정, MCP 신뢰성 개선
Claude Code v2.1.191이 추가한 /rewind로 대화 내역을 복원하고, 스트리밍 CPU 사용량을 37% 줄이며, 에이전트 재생 문제를 수정하고, MCP 재시도 및 오류 처리를 개선합니다.

클로드는 4월 4일부터 OpenClaw를 포함한 서드파티 하네스 사용을 제한합니다.
Anthropic는 4월 4일부터 Claude 구독 한도를 OpenClaw와 같은 서드파티 하네스와 함께 사용하는 것을 더 이상 허용하지 않으며, 이러한 사용에는 별도의 종량제 청구가 필요합니다. 사용자들은 월간 구독 가격과 동일한 일회성 크레딧을 받게 되며, 최대 30% 할인된 사용량 번들을 사전 구매할 수 있습니다.

클로드가 실시간 파이썬 코딩 챌린지에서 제미나이, 챗GPT, 그록을 능가합니다
한 개발자가 Claude, Gemini, ChatGPT, Grok을 대상으로 실시간 Python 코딩 토너먼트를 진행했습니다. AI가 생성한 봇들이 15×15 글자 격자판에서 단어를 찾는 경쟁을 펼쳤고, Claude가 압도적으로 승리했습니다.

AI热潮:从郁金香到代币——对AI炒作周期的批判性审视
션 헬비가 튤립 광기와 오늘날의 AI 붐 사이의 유사성을 그리며, AI의 진정한 지능, 투명성, 외부 효과에 의문을 제기합니다. 에너지 비용, 데이터 센터 확장, 데이터 주권의 필요성을 다룹니다.