1.2B 로컬 모델, 1T 클라우드 모델을 포커에서 이기다: 올인 또는 폴드 형식에서 지식보다 공격성

✍️ OpenClawRadar📅 게시일: May 19, 2026🔗 Source
1.2B 로컬 모델, 1T 클라우드 모델을 포커에서 이기다: 올인 또는 폴드 형식에서 지식보다 공격성
Ad

한 개발자가 5개의 텍사스 홀덤 토너먼트에서 16GB MacBook으로 커스텀 프레임워크(Hive)를 사용해 6개의 LLM을 실행했습니다. 참가 모델: Liquid lfm2.5 (1.2B, LM Studio, ~5초/결정), Qwen3 (1.7B, LM Studio, ~2.5분), Claude Haiku 4.5, GPT-OSS (120B, Fireworks), MiniMax M2 (230B, Fireworks), Kimi K2 (~1T, Fireworks). 로컬 모델은 RAM 한계로 인해 순차적으로 실행되었습니다.

결과

  • 토너먼트 1: Qwen (1.7B 로컬)
  • 토너먼트 2: MiniMax (230B 클라우드)
  • 토너먼트 3: Liquid (1.2B 로컬)
  • 토너먼트 4: Kimi (~1T 클라우드)
  • 토너먼트 5: Liquid (1.2B 로컬)

3라운드는 역동성을 잘 보여줍니다: Liquid는 6핸드에서 19번의 레이즈와 0번의 폴드를 수행하며, $1M의 시작 스택을 $5.98M으로 늘렸습니다. 반면 GPT-OSS (120B)는 6핸드에서 0번의 레이즈와 5번의 폴드를 기록하며 블라인드 아웃되었습니다. 이 형식(25핸드, 5K/10K 블라인드 + 1K 앤티)은 사실상 올인 또는 폴드만 가능한 구조로, 이론적인 포커 실력보다 공격성을 보상합니다.

Ad

핵심 인사이트

Liquid는 나쁜 핸드를 인식하지 못하기 때문에 모든 것을 레이즈합니다. 상대가 너무 자주 폴드하는 경우, 이는 큰 이익을 가져옵니다. 저자는 다음과 같이 언급합니다: "작은 모델이 포커에서 더 똑똑하다고 주장하는 것이 아닙니다. 이 특정 형식에서, 폴드할 때를 모르는 것이 장점입니다." 더 큰 모델은 약한 핸드를 폴드할 '이해'가 있지만, 숏스택 토너먼트에서는 인내가 불리하게 작용합니다.

다음 단계

핸드 리딩이 중요한 더 긴 토너먼트(100핸드 이상, 낮은 블라인드)를 계획 중입니다. 프레임워크는 커스텀 페르소나(성격 특성, 위험 감수성, 두려움)를 지원합니다. Mistral, Llama, Gemma 3에 대한 요청을 환영합니다. 코드와 전체 결과 JSON은 GitHub에 있습니다: https://github.com/chiruu12/Hive (hive-arena/는 러너용, tournaments/results/는 데이터용).

📖 전체 원문 읽기: r/LocalLLaMA

Ad

👀 See Also

Claude Code v2.1.191: /rewind, CPU 수정, MCP 신뢰성 개선
News

Claude Code v2.1.191: /rewind, CPU 수정, MCP 신뢰성 개선

Claude Code v2.1.191이 추가한 /rewind로 대화 내역을 복원하고, 스트리밍 CPU 사용량을 37% 줄이며, 에이전트 재생 문제를 수정하고, MCP 재시도 및 오류 처리를 개선합니다.

OpenClawRadar
클로드는 4월 4일부터 OpenClaw를 포함한 서드파티 하네스 사용을 제한합니다.
News

클로드는 4월 4일부터 OpenClaw를 포함한 서드파티 하네스 사용을 제한합니다.

Anthropic는 4월 4일부터 Claude 구독 한도를 OpenClaw와 같은 서드파티 하네스와 함께 사용하는 것을 더 이상 허용하지 않으며, 이러한 사용에는 별도의 종량제 청구가 필요합니다. 사용자들은 월간 구독 가격과 동일한 일회성 크레딧을 받게 되며, 최대 30% 할인된 사용량 번들을 사전 구매할 수 있습니다.

OpenClawRadar
클로드가 실시간 파이썬 코딩 챌린지에서 제미나이, 챗GPT, 그록을 능가합니다
News

클로드가 실시간 파이썬 코딩 챌린지에서 제미나이, 챗GPT, 그록을 능가합니다

한 개발자가 Claude, Gemini, ChatGPT, Grok을 대상으로 실시간 Python 코딩 토너먼트를 진행했습니다. AI가 생성한 봇들이 15×15 글자 격자판에서 단어를 찾는 경쟁을 펼쳤고, Claude가 압도적으로 승리했습니다.

OpenClawRadar
AI热潮:从郁金香到代币——对AI炒作周期的批判性审视
News

AI热潮:从郁金香到代币——对AI炒作周期的批判性审视

션 헬비가 튤립 광기와 오늘날의 AI 붐 사이의 유사성을 그리며, AI의 진정한 지능, 투명성, 외부 효과에 의문을 제기합니다. 에너지 비용, 데이터 센터 확장, 데이터 주권의 필요성을 다룹니다.

OpenClawRadar