1,2 млрд локальная модель превзошла 1 трлн облачных в покере: агрессия побеждает знания в формате "ол-ин или пас"

Разработчик запустил 6 LLM в 5 турнирах по Техасскому Холдему на MacBook с 16 ГБ ОЗУ, используя собственную платформу (Hive). Состав: Liquid lfm2.5 (1,2B, LM Studio, ~5 сек/ход), Qwen3 (1,7B, LM Studio, ~2,5 мин), Claude Haiku 4.5, GPT-OSS (120B, Fireworks), MiniMax M2 (230B, Fireworks) и Kimi K2 (~1T, Fireworks). Локальные модели запускались последовательно из-за ограничений ОЗУ.
Результаты
- Турнир 1: Qwen (1,7B локально)
- Турнир 2: MiniMax (230B облако)
- Турнир 3: Liquid (1,2B локально)
- Турнир 4: Kimi (~1T облако)
- Турнир 5: Liquid (1,2B локально)
Третий заход показал динамику: Liquid сыграл 6 раздач с 19 рейзами и 0 фолдов, превратив стартовый стек в $1 млн в $5,98 млн. Тем временем GPT-OSS (120B) выполнил 0 рейзов и 5 фолдов за 6 раздач, проиграв на блайндах. Формат (25 раздач, блайнды 5K/10K + анте 1K) по сути является шови или фолд, где агрессия вознаграждается больше, чем теоретическое мастерство покера.
Ключевая мысль
Liquid не распознаёт плохие руки, поэтому рейзит всё подряд. Против оппонентов, которые слишком часто сбрасывают, это приносит деньги. Автор отмечает: «Я не утверждаю, что маленькие модели умнее в покере. В этом конкретном формате незнание того, когда сбрасывать, является преимуществом». Крупные модели «понимают» покер настолько, чтобы сбрасывать слабые руки, но в турнире с короткими стеками терпение наказывается.
Что дальше
Планируются более длинные турниры (100+ раздач, низкие блайнды), где будет важно чтение рук. Платформа поддерживает пользовательские персонажи (черты личности, толерантность к риску, страхи). Принимаются запросы на Mistral, Llama, Gemma 3. Код и полные JSON-файлы с результатами на GitHub: https://github.com/chiruu12/Hive (папка hive-arena/ для запуска, tournaments/results/ для данных).
📖 Читать полный источник: r/LocalLLaMA
👀 Смотрите также
OpenClaw 2026.9.6 добавляет Claude Opus 5.5, GPT-6 Sol и Luna, Grok 4.7, а также восстановление после перезапуска
OpenClaw 2026.9.6 выпущен в составе 2 614 PR от 351 участника: добавлены модели Claude Opus 5.5, GPT-6 Sol и Luna, Grok 4.7, восстановление после перезапуска для незавершённых диалогов, 30-дневный отчёт об использовании и живые заметки со встреч.

Claude Code v2.1.198: Chrome GA, Уведомления агента, /dataviz и AWS Gateway
Anthropic выпустил Claude Code v2.1.198 с общедоступным Chrome-расширением, фоновыми уведомлениями агентов, новым навыком /dataviz и использованием Claude Platform на AWS в качестве резервного провайдера.

Qwen KV 缓存量化深度解析:PPL、KL散度与非对称K/V结果
Второй раунд тестов Qwen 3.6-35B-A3B с квантованием KV-кэша: перплексия, KL-дивергенция, асимметричные комбинации K/V и глубина контекста 64K на Apple M5 Max.

Антропик блокирует сторонние обёртки от ограничений подписки на Claude, но обходное решение доступно.
Anthropic ограничила доступ сторонних оболочек к лимитам подписки Claude, что может нарушить рабочие процессы, зависящие от этих инструментов. Пользователь Reddit сообщает о разработке обходного решения с открытым исходным кодом после того, как чуть не потерял месяцы тренировочных данных.