1,2B Lokales Modell schlägt 1T Clouds beim Poker: Aggression übertrumpft Wissen im Shove-or-Fold-Format

✍️ OpenClawRadar📅 Veröffentlicht: 19. Mai 2026🔗 Source
1,2B Lokales Modell schlägt 1T Clouds beim Poker: Aggression übertrumpft Wissen im Shove-or-Fold-Format
Ad

Ein Entwickler ließ 6 LLMs durch 5 Texas Hold'em-Turniere auf einem 16GB MacBook mit einem benutzerdefinierten Framework laufen (Hive). Die Aufstellung: Liquid lfm2.5 (1,2B, LM Studio, ~5s/Entscheidung), Qwen3 (1,7B, LM Studio, ~2,5 min), Claude Haiku 4.5, GPT-OSS (120B, Fireworks), MiniMax M2 (230B, Fireworks) und Kimi K2 (~1T, Fireworks). Lokale Modelle liefen aufgrund von RAM-Begrenzungen nacheinander.

Ergebnisse

  • Turnier 1: Qwen (1,7B lokal)
  • Turnier 2: MiniMax (230B Cloud)
  • Turnier 3: Liquid (1,2B lokal)
  • Turnier 4: Kimi (~1T Cloud)
  • Turnier 5: Liquid (1,2B lokal)

Durchlauf 3 verdeutlichte die Dynamik: Liquid spielte 6 Hände mit 19 Erhöhungen und 0 Folds und verwandelte einen Startstack von 1 Mio. $ in 5,98 Mio. $. GPT-OSS (120B) führte hingegen 0 Erhöhungen und 5 Folds in 6 Händen aus und wurde durch die Blinds eliminiert. Das Format (25 Hände, 5K/10K Blinds + 1K Ante) ist effektiv ein Shove-or-Fold-Format, das Aggression über theoretisches Pokerkönnen belohnt.

Ad

Wichtige Erkenntnis

Liquid erkennt keine schlechten Hände und erhöht daher alles. Gegen Gegner, die zu oft folden, bringt das Geld. Der Autor merkt an: „Ich behaupte nicht, dass kleine Modelle klüger beim Pokern sind. In diesem speziellen Format ist es von Vorteil, nicht zu wissen, wann man folden sollte.“ Größere Modelle ‚verstehen‘ Poker genug, um schwache Hände zu folden, aber in einem Short-Stack-Turnier wird Geduld bestraft.

Was kommt als Nächstes

Geplant sind längere Turniere (100+ Hände, niedrigere Blinds), bei denen das Lesen von Händen wichtig ist. Das Framework unterstützt benutzerdefinierte Persönlichkeiten (Persönlichkeitsmerkmale, Risikobereitschaft, Ängste). Anfragen für Mistral, Llama, Gemma 3 sind willkommen. Code und vollständige Ergebnis-JSONs sind auf GitHub: https://github.com/chiruu12/Hive (hive-arena/ für den Runner, tournaments/results/ für die Daten).

📖 Lies die vollständige Quelle: r/LocalLLaMA

Ad

👀 Siehe auch

Projekt-Gesundheitscheck: Bus-Faktor und Commit-Aktivität in den Claw/Assistant-Repos
Nachrichten

Projekt-Gesundheitscheck: Bus-Faktor und Commit-Aktivität in den Claw/Assistant-Repos

Ein Reddit-Nutzer hat Commit-Daten von großen Claw/Assistant-Projekten gescrapt und festgestellt, dass viele einen Busfaktor von 1 haben – das bedeutet, dass ein einzelner Autor für über 50 % der Commits verantwortlich ist. Einige Projekte zeigen drastische Rückgänge der Aktivität im April.

OpenClawRadar
Gefährlich Code überspringen: Wenn LLMs schneller Code schreiben, als du ihn lesen kannst
Nachrichten

Gefährlich Code überspringen: Wenn LLMs schneller Code schreiben, als du ihn lesen kannst

Was, wenn wir aufhören, LLM-generierten Code zu reviewen, und ihn stattdessen wie Maschinencode behandeln? Verlagern wir die Sorgfalt auf Spezifikationen und Tests.

OpenClawRadar
Claude-Code v2.1.78: Plugin-Status, Streaming-Antworten und kritische Fehlerbehebungen
Nachrichten

Claude-Code v2.1.78: Plugin-Status, Streaming-Antworten und kritische Fehlerbehebungen

Claude-Code v2.1.78 fügt Plugin-Persistenzzustand mit ${CLAUDE_PLUGIN_DATA} hinzu, ermöglicht zeilenweises Antwort-Streaming und behebt API-Fehler-Schleifen, Berechtigungsumgehungsprobleme und Sandbox-Sicherheitswarnungen.

OpenClawRadar
Hacker News KI-Diskussion verlagert sich von Demos hin zu Fokussierung auf Werkzeuge
Nachrichten

Hacker News KI-Diskussion verlagert sich von Demos hin zu Fokussierung auf Werkzeuge

Jüngste Diskussionen auf Hacker News über KI bewegen sich von Einmal-Demos hin zu dauerhaften Werkzeugen wie Preisverfolgung, Verifizierung, Gedächtnis, Bewertung und Workflow-Integration. Dies signalisiert einen Wandel hin zur Operationalisierung, bei dem Communities aufhören, Neuigkeits-orientierte Beiträge zu belohnen.

OpenClawRadar