1,2B Lokales Modell schlägt 1T Clouds beim Poker: Aggression übertrumpft Wissen im Shove-or-Fold-Format

Ein Entwickler ließ 6 LLMs durch 5 Texas Hold'em-Turniere auf einem 16GB MacBook mit einem benutzerdefinierten Framework laufen (Hive). Die Aufstellung: Liquid lfm2.5 (1,2B, LM Studio, ~5s/Entscheidung), Qwen3 (1,7B, LM Studio, ~2,5 min), Claude Haiku 4.5, GPT-OSS (120B, Fireworks), MiniMax M2 (230B, Fireworks) und Kimi K2 (~1T, Fireworks). Lokale Modelle liefen aufgrund von RAM-Begrenzungen nacheinander.
Ergebnisse
- Turnier 1: Qwen (1,7B lokal)
- Turnier 2: MiniMax (230B Cloud)
- Turnier 3: Liquid (1,2B lokal)
- Turnier 4: Kimi (~1T Cloud)
- Turnier 5: Liquid (1,2B lokal)
Durchlauf 3 verdeutlichte die Dynamik: Liquid spielte 6 Hände mit 19 Erhöhungen und 0 Folds und verwandelte einen Startstack von 1 Mio. $ in 5,98 Mio. $. GPT-OSS (120B) führte hingegen 0 Erhöhungen und 5 Folds in 6 Händen aus und wurde durch die Blinds eliminiert. Das Format (25 Hände, 5K/10K Blinds + 1K Ante) ist effektiv ein Shove-or-Fold-Format, das Aggression über theoretisches Pokerkönnen belohnt.
Wichtige Erkenntnis
Liquid erkennt keine schlechten Hände und erhöht daher alles. Gegen Gegner, die zu oft folden, bringt das Geld. Der Autor merkt an: „Ich behaupte nicht, dass kleine Modelle klüger beim Pokern sind. In diesem speziellen Format ist es von Vorteil, nicht zu wissen, wann man folden sollte.“ Größere Modelle ‚verstehen‘ Poker genug, um schwache Hände zu folden, aber in einem Short-Stack-Turnier wird Geduld bestraft.
Was kommt als Nächstes
Geplant sind längere Turniere (100+ Hände, niedrigere Blinds), bei denen das Lesen von Händen wichtig ist. Das Framework unterstützt benutzerdefinierte Persönlichkeiten (Persönlichkeitsmerkmale, Risikobereitschaft, Ängste). Anfragen für Mistral, Llama, Gemma 3 sind willkommen. Code und vollständige Ergebnis-JSONs sind auf GitHub: https://github.com/chiruu12/Hive (hive-arena/ für den Runner, tournaments/results/ für die Daten).
📖 Lies die vollständige Quelle: r/LocalLLaMA
👀 Siehe auch

OpenClaw v2026.7.1: Überarbeitung der Steuerungs-Benutzeroberfläche, Einführung, mobile Apps, GPT-5.6, Tencent Hy3, Meta Muse Spark 1.1
OpenClaw v2026.7.1 bringt eine große Überarbeitung der Control-Benutzeroberfläche, einen neu gestalteten Onboarding-Prozess, aktualisierte iOS/Android/macOS-Apps, GPT-5.6-Kompatibilität, Unterstützung für Tencent Hy3 und Meta Muse Spark 1.1 sowie verbesserte Codex- und Coding-Agent-Workflows.

Anthropic API-Abrechnungsfehler: Sonnet-Modell zu Opus-Preisen abgerechnet
Ein Nutzer entdeckte, dass die Anthropic API das claude-sonnet-4-6-Modell fälschlicherweise zu Opus-Preisen abrechnet, obwohl die korrekte Modellzeichenfolge zurückgegeben wird. Der Fehler wurde durch die Analyse von Rohdatenereignissen identifiziert, die eine Kostenabweichung zeigten.

Claude Certified Architect Foundations (CCA-F) Prüfung: 985/1000 Punkte erreicht — Studienleitfaden & Übungstest
Ein Reddit-Nutzer teilt seine Erfahrungen mit 985/1000 Punkten in der neuen Claude Certified Architect Foundations (CCA-F)-Prüfung. Enthält praktische Einblicke in Prompt Engineering, Kontextfenster und Human-in-the-Loop-Workflows sowie Links zu Schulungskursen, Cookbook und einem kostenlosen Mock-Exam.
Claude Code v2.1.278 setzt den Auto-Modus standardmäßig auf den serverseitigen Klassifikator
Claude Code v2.1.278 setzt den Auto-Modus standardmäßig auf den serverseitigen Klassifikator für API-, Enterprise-, Bedrock-, Vertex-, Foundry- und Gateway-Nutzer. Klassifikator-Overhead wird nicht mehr berechnet, und /status zeigt jetzt an, welcher Klassifikator ausgeführt wird.