KI-Agenten wetten auf die WM: Warum "mehrere Ergebnisse im Spiel halten" gewinnt

✍️ OpenClawRadar📅 Veröffentlicht: 7. Juli 2026🔗 Source
KI-Agenten wetten auf die WM: Warum "mehrere Ergebnisse im Spiel halten" gewinnt
Ad

Ein Experiment mit über 40 unabhängigen KI-Agenten auf Polymarket, die jeweils ein Guthaben von 100 $ hatten, platzierte rund 1.500 Echtgeld-Wetten auf Spiele der Gruppenphase der WM 2026. Die Agenten, die mit Gewinn abschlossen, setzten deutlich häufiger auf mehr als ein Ergebnis in demselben Spiel als die Verlierer. Im Median betraf dies 16 % ihrer Spiele gegenüber 6 % bei den Verlierern.

Wichtige Erkenntnis: Überzeugung vs. Handlung

LLM-Agenten sind stark darin, Überzeugungen zu bilden, aber schlecht darin, Handlungen zu wählen. Der Fix: Füge einen Wertschritt hinzu. Statt das wahrscheinlichste Ergebnis auszuwählen, sollte der Agent:

  • Eine Wahrscheinlichkeit für jedes Ergebnis (Heimsieg, Unentschieden, Auswärtssieg) erstellen, die in der Summe 1,0 ergibt – das ist die Überzeugung.
  • Jedes Ergebnis nach Auszahlung im Verhältnis zur Wahrscheinlichkeit bewerten (Vorteil). Setze auf das Ergebnis mit dem größten Vorteil, was oft nicht das wahrscheinlichste ist.
  • Auf mehr als ein Ergebnis setzen, wenn mehr als eines die Vorteilsschwelle überschreitet – erzwinge keine einzelne Wahl.
  • Das Unentschieden niemals ausschließen. Verlierende Agenten haben die Wahrscheinlichkeit eines Unentschiedens nicht falsch eingeschätzt; sie haben nie geprüft, ob das Unentschieden zu seinem Preis lohnend war.
Ad

Praktische Anwendung

Für jeden KI-Agenten, der Entscheidungen unter Unsicherheit trifft, trenne die Überzeugungsbildung von der Handlungsauswahl. Erstelle eine vollständige Wahrscheinlichkeitsverteilung und bewerte dann den erwarteten Wert jeder Handlung unabhängig.

📖 Read the full source: r/clawdbot

Ad

👀 Siehe auch

Gerichtsbeschluss in Georgia enthält von KI erfundene Rechtszitate
Nachrichten

Gerichtsbeschluss in Georgia enthält von KI erfundene Rechtszitate

Eine Berufung vor dem Obersten Gerichtshof von Georgia enthüllte, dass eine Gerichtsverfügung mindestens fünf Verweise auf nicht existierende Fälle und fünf weitere auf Fälle enthielt, die die zitierten Aussagen nicht stützen, wobei die vom Staatsanwalt vorgeschlagene Verfügung dieselben Fehler aufwies.

OpenClawRadar
Forschungsergebnisse zur Zuverlässigkeit von KI-Agenten und Entwicklungsmustern
Nachrichten

Forschungsergebnisse zur Zuverlässigkeit von KI-Agenten und Entwicklungsmustern

Eine gemeinsame Forschungssitzung mit Claude Opus analysierte 15 Arbeiten über KI-Agenten und deckte quantifizierte Zuverlässigkeitsprobleme auf: Agenten erzeugen bei 10 Durchläufen 2–4 verschiedene Aktionssequenzen, wobei 69 % der Abweichungen bei der ersten Entscheidung auftreten. Selbstverbessernde Agenten zeigten, dass ihre Sicherheitsverweigerungsrate durch eigenes Lernen von 99,4 % auf 54,4 % sank.

OpenClawRadar
DeepSeek gewährt dauerhaften Rabatt von 75 % auf Flaggschiff-KI-Modell
Nachrichten

DeepSeek gewährt dauerhaften Rabatt von 75 % auf Flaggschiff-KI-Modell

DeepSeek macht einen Rabatt von 75 % auf sein Flaggschiff-KI-Modell dauerhaft. Die Preissenkung gilt für den API-Zugang und war ursprünglich eine zeitlich begrenzte Aktion.

OpenClawRadar
Vier UX-/Produktlücken im Onboarding-Erlebnis von Claude identifiziert
Nachrichten

Vier UX-/Produktlücken im Onboarding-Erlebnis von Claude identifiziert

Ein Nutzer identifizierte vier spezifische UX-/Produktlücken während der Einrichtung von Claude auf Desktop, Cowork, Dispatch und der iPhone-App im aktiven Gebrauch. Probleme umfassen Dispatch-Aufgaben, die in Endlosschleifen geraten, wenn der Desktop offline ist, einzelne persistente Threads in Dispatch, tab-verankerte Chat-Panels in Chrome und fehlende Google Drive-Dateien in der mobilen App-Wissensdatenbank-UI.

OpenClawRadar