Opus 4.6 überragend in Forschung, Gemini 3.1 Pro besser in Vorhersage-Benchmark

✍️ OpenClawRadar📅 Veröffentlicht: 7. Mai 2026🔗 Source
Opus 4.6 überragend in Forschung, Gemini 3.1 Pro besser in Vorhersage-Benchmark
Ad

Ein Reddit-Nutzer veröffentlichte Ergebnisse eines Benchmarks, der vier Spitzenmodelle – Claude Opus 4.6, GPT-5.4, Gemini 3.1 Pro und Grok 4.20 – an 1.417 binären Prognosefragen von Oktober bis Dezember 2025 verglich. Die zentrale Neuerung ist die Aufteilung der Leistung in zwei Evaluationsbedingungen: agentisch (jedes Modell führt eigene Web-Recherche mit Tools durch) und festgelegte Beweise (alle Modelle erhalten das gleiche ~12.000 Zeichen umfassende Recherche-Dossier, erstellt nach der Standardisierungsmethodik von Bosse et al. 2026).

Zentrale Ergebnisse

  • Opus 4.6 schneidet in der agentischen Bedingung deutlich besser ab: Es ist besser darin, herauszufinden, wonach gesucht werden sollte, zu entscheiden, welche Seiten gelesen werden, und relevante Details zu extrahieren. Wenn die Recherche jedoch entfernt wird, verschwindet sein Vorteil.
  • Gemini 3.1 Pro liefert ein schärferes Urteil bei festen Beweisen – es gewichtet Informationen bei Prognoseaufgaben genauer. Seine Kalibrierung verbessert sich sogar, wenn das standardisierte Dossier gegeben wird, während Opus' Kalibrierung stark abfällt.
  • GPT-5.4 und Grok 4.20 änderten sich kaum zwischen den Bedingungen, was darauf hindeutet, dass ihre Leistung weniger von der Suchstrategie abhängt.
  • Die Rangfolge zwischen Opus und Gemini kehrte sich zwischen den Bedingungen um, was der Poster als Argument dafür anführt, dass die Evaluierung nicht kaputt oder verzerrt ist (eine verzerrte Evaluierung würde wahrscheinlich alle Modelle in die gleiche Richtung verschieben).
Ad

Interpretation

Die Asymmetrie in der Kalibrierung – Opus' Kalibrierung sinkt, wenn die Suche entfernt wird, während die von Gemini steigt – deutet darauf hin, dass Opus möglicherweise seine Suchspur als Gerüst für die Wahrscheinlichkeitszuweisung nutzt. Mit anderen Worten: Der Akt der Durchführung der Suchschleife selbst leistet einen Teil der epistemischen Arbeit, unabhängig von den zutage geförderten Informationen. Dies ist ein neuartiger Befund, der Auswirkungen darauf haben könnte, wie wir KI-Forschungsagenten evaluieren und entwerfen.

Einschränkungen und Ressourcen

Die Dossiers mit festgelegten Beweisen werden selbst von LM erstellt, sodass der Test möglicherweise eher misst, wie gut jedes Modell eine bestimmte standardisierte Version der Beweise interpretiert, als abstraktes Urteilsvermögen. Der Poster weist dies als Einschränkung hin, argumentiert jedoch, dass das unterschiedliche Verhalten der Modelle die Bedenken verringert.

Vollständige Kalibrierungswerte, Verfeinerungswerte und eine analyse nach Bedingungen sind verfügbar unter: futuresearch.ai/opus-research-gemini-judgment. Der Benchmark und die Bestenliste befinden sich unter: evals.futuresearch.ai.

Nach Kenntnis des Posters ist dies die erste direkte Evaluierung von Spitzenmodellen, die die Leistung in Forschungs- vs. Urteilsphasen zerlegt. Sie laden zu Replikationen in anderen Bereichen ein.

📖 Lesen Sie die vollständige Quelle: r/ClaudeAI

Ad

👀 Siehe auch

Qwen3.5-27B-FP8-Leistungsbenchmarks mit OpenClaw-Agenten
Nachrichten

Qwen3.5-27B-FP8-Leistungsbenchmarks mit OpenClaw-Agenten

Tests zeigen, dass Qwen3.5-27B-FP8 sechs OpenClaw-Agenten gleichzeitig ausführen kann, wobei der Durchsatz auf 120 Token/Sekunde skaliert. Das SGLang-Framework mit Prefix-Caching reduziert das Prefill von 100K Kontext von 10 Sekunden auf 200ms.

OpenClawRadar
Entwickler sucht Architekturberatung für das Bereitstellen von Embed-, Rerank- und Zero-Shot-Modellen auf 8 GB VRAM
Nachrichten

Entwickler sucht Architekturberatung für das Bereitstellen von Embed-, Rerank- und Zero-Shot-Modellen auf 8 GB VRAM

Ein Entwickler, der einen einheitlichen Wissensgraphen/RAG-Dienst für einen lokalen Coding-Agenten aufbaut, kämpft mit Speicherbeschränkungen bei 8 GB VRAM und 16 GB System-RAM und erlebt OOM-Fehler, Latenzspitzen und Linux-Kernel-Kills, wenn drei Transformer-Modelle gleichzeitig bedient werden.

OpenClawRadar
CEOs berichten in aktueller Studie über minimale Auswirkungen von KI auf Produktivität und Beschäftigung
Nachrichten

CEOs berichten in aktueller Studie über minimale Auswirkungen von KI auf Produktivität und Beschäftigung

Eine Studie mit 6.000 Führungskräften ergab, dass 90 % in drei Jahren keine Auswirkungen von KI auf Beschäftigung oder Produktivität feststellten, bei einer durchschnittlichen KI-Nutzung von 1,5 Stunden pro Woche. Ökonomen vergleichen dies mit Solows Produktivitätsparadoxon aus der IT-Ära der 1980er Jahre.

OpenClawRadar
Vorkonfigurierte OpenClaw-Agenten: Einrichtung Unternehmen vs. Plattform-Bedrohung
Nachrichten

Vorkonfigurierte OpenClaw-Agenten: Einrichtung Unternehmen vs. Plattform-Bedrohung

Ein Erfahrungsbericht nach 10+ Kunden zeigt: Vorkonfigurierte OpenClaw-Agenten sind eher Install-plus-Management als der Verkauf digitaler Mitarbeiter. Die Einrichtung ist eine einmalige Gebühr; die Plattform wird sie irgendwann schlucken.

OpenClawRadar