1,2B Lokales Modell schlägt 1T Clouds beim Poker: Aggression übertrumpft Wissen im Shove-or-Fold-Format

Ein Entwickler ließ 6 LLMs durch 5 Texas Hold'em-Turniere auf einem 16GB MacBook mit einem benutzerdefinierten Framework laufen (Hive). Die Aufstellung: Liquid lfm2.5 (1,2B, LM Studio, ~5s/Entscheidung), Qwen3 (1,7B, LM Studio, ~2,5 min), Claude Haiku 4.5, GPT-OSS (120B, Fireworks), MiniMax M2 (230B, Fireworks) und Kimi K2 (~1T, Fireworks). Lokale Modelle liefen aufgrund von RAM-Begrenzungen nacheinander.
Ergebnisse
- Turnier 1: Qwen (1,7B lokal)
- Turnier 2: MiniMax (230B Cloud)
- Turnier 3: Liquid (1,2B lokal)
- Turnier 4: Kimi (~1T Cloud)
- Turnier 5: Liquid (1,2B lokal)
Durchlauf 3 verdeutlichte die Dynamik: Liquid spielte 6 Hände mit 19 Erhöhungen und 0 Folds und verwandelte einen Startstack von 1 Mio. $ in 5,98 Mio. $. GPT-OSS (120B) führte hingegen 0 Erhöhungen und 5 Folds in 6 Händen aus und wurde durch die Blinds eliminiert. Das Format (25 Hände, 5K/10K Blinds + 1K Ante) ist effektiv ein Shove-or-Fold-Format, das Aggression über theoretisches Pokerkönnen belohnt.
Wichtige Erkenntnis
Liquid erkennt keine schlechten Hände und erhöht daher alles. Gegen Gegner, die zu oft folden, bringt das Geld. Der Autor merkt an: „Ich behaupte nicht, dass kleine Modelle klüger beim Pokern sind. In diesem speziellen Format ist es von Vorteil, nicht zu wissen, wann man folden sollte.“ Größere Modelle ‚verstehen‘ Poker genug, um schwache Hände zu folden, aber in einem Short-Stack-Turnier wird Geduld bestraft.
Was kommt als Nächstes
Geplant sind längere Turniere (100+ Hände, niedrigere Blinds), bei denen das Lesen von Händen wichtig ist. Das Framework unterstützt benutzerdefinierte Persönlichkeiten (Persönlichkeitsmerkmale, Risikobereitschaft, Ängste). Anfragen für Mistral, Llama, Gemma 3 sind willkommen. Code und vollständige Ergebnis-JSONs sind auf GitHub: https://github.com/chiruu12/Hive (hive-arena/ für den Runner, tournaments/results/ für die Daten).
📖 Lies die vollständige Quelle: r/LocalLLaMA
👀 Siehe auch

Projekt-Gesundheitscheck: Bus-Faktor und Commit-Aktivität in den Claw/Assistant-Repos
Ein Reddit-Nutzer hat Commit-Daten von großen Claw/Assistant-Projekten gescrapt und festgestellt, dass viele einen Busfaktor von 1 haben – das bedeutet, dass ein einzelner Autor für über 50 % der Commits verantwortlich ist. Einige Projekte zeigen drastische Rückgänge der Aktivität im April.

Gefährlich Code überspringen: Wenn LLMs schneller Code schreiben, als du ihn lesen kannst
Was, wenn wir aufhören, LLM-generierten Code zu reviewen, und ihn stattdessen wie Maschinencode behandeln? Verlagern wir die Sorgfalt auf Spezifikationen und Tests.

Claude-Code v2.1.78: Plugin-Status, Streaming-Antworten und kritische Fehlerbehebungen
Claude-Code v2.1.78 fügt Plugin-Persistenzzustand mit ${CLAUDE_PLUGIN_DATA} hinzu, ermöglicht zeilenweises Antwort-Streaming und behebt API-Fehler-Schleifen, Berechtigungsumgehungsprobleme und Sandbox-Sicherheitswarnungen.

Hacker News KI-Diskussion verlagert sich von Demos hin zu Fokussierung auf Werkzeuge
Jüngste Diskussionen auf Hacker News über KI bewegen sich von Einmal-Demos hin zu dauerhaften Werkzeugen wie Preisverfolgung, Verifizierung, Gedächtnis, Bewertung und Workflow-Integration. Dies signalisiert einen Wandel hin zur Operationalisierung, bei dem Communities aufhören, Neuigkeits-orientierte Beiträge zu belohnen.