Claude vs GPT-4o: Gleicher Doppelpendel-Prompt, unterschiedliche Koordinatenkonventionen

Ein Reddit-Nutzer ließ denselben Doppelpendel-Prompt durch Claude und GPT-4o nebeneinander laufen, wobei ein gemeinsamer Host-Renderer verwendet wurde, und sah innerhalb von Sekunden zwei völlig unterschiedliche physikalische Systeme. Die Ursache: Jedes Modell wählte eine andere Konvention zur Messung von Theta.
Claude maß theta von der oberen Vertikalen (theta=0 = Arm zeigt senkrecht nach oben), während GPT-4o von der unteren Vertikalen maß (theta=0 = Arm hängt senkrecht nach unten). Der Host-Renderer in public/workers/simulator-host.js liest einfach info.theta1 und info.theta2 und zeichnet die Arme entsprechend – ohne kosmetische Unterschiede. Die visuelle Abweichung ist also eine echte physikalische Abweichung.
Beide Konventionen sind technisch gültig. Die meisten klassischen Mechanik-Lehrbücher verwenden Theta von der unteren Vertikalen, weil der Gleichgewichtspunkt bei theta=0 für Kleinwinkelnäherungen liegt. Aber Theta von der oberen Vertikalen ist ebenfalls in vielen Referenzen üblich. Claude hielt konsequent an seiner Konvention in Bewegungsgleichungen, Anfangsbedingungen und Integration (Runge Kutta) fest. GPT-4o verwendete stillschweigend die andere Konvention – es kommentierte seine Wahl nicht.
Der Nutzer arbeitete an Physics Bench, einem Open-Source-Seitenvergleichs-Benchmark, bei dem jedes Modell denselben Generierungsvertrag erhält: function createSimulator(...) in lib/prompt.ts. Der Host besitzt die gesamte Darstellung; Modelle implementieren nur step, getInfo und reset. Modelle greifen nie auf draw zu. Daher ist jede visuelle Abweichung zwischen den Panels garantiert auf einen echten Unterschied in der Simulationslogik zurückzuführen, nicht auf Darstellungsentscheidungen.
Ein Unit-Test der Mathematik hätte dies nicht aufgedeckt. Beide Modelle erzeugen korrekte Physik für ihre gewählten Konventionen. Man sieht die Abweichung erst, wenn man sie nebeneinander mit demselben Zeichnungscode darstellt. Dies unterstreicht die Bedeutung, Koordinatenkonventionen in Prompts explizit anzugeben, wenn die Ausgabe von einem festen Renderer verarbeitet wird.
Siehe den vollständigen Reddit-Thread für Code-Ausschnitte und Details zum Conversation Inspector.
📖 Read the full source: r/ClaudeAI
👀 Siehe auch

Wenn RLVR kleinen feinabgestimmten Modellen hilft: Eine Analyse mit 12 Datensätzen
Ein kontrolliertes Experiment testete das Hinzufügen von RLVR-Verstärkungslernen auf 1,7-Milliarden-Parameter-Modelle, die mit SFT feinabgestimmt wurden. Die Ergebnisse zeigen, dass Textgenerierungsaufgaben im Durchschnitt um +2,0 Prozentpunkte verbessert wurden, während strukturierte Aufgaben um -0,7 Prozentpunkte zurückgingen.

Claude Daily Digest: Start der /dream-Funktion, Kritik an Nutzungsbeschränkungen und Barrierefreiheits-Tool
Anthropic hat die /dream-Funktion für Claudes Auto-Memory-System ausgeliefert, während die Community sich über Nutzungslimits beschwert und ein tauber Entwickler ein Terminal-Blitzbenachrichtigungs-Plugin für Claude Code gebaut hat.

Anthropics neues Claude-Abonnement-Guthaben: Agent SDK und claude -p erhalten ab 15. Juni getrennte gedeckelte Pools
Ab dem 15. Juni erhalten Claude-Abonnenten ein separates monatliches Guthaben für die Nutzung des Agent SDK und von claude -p: 200 $/Monat für Max 20x, 100 $ für Max 5x, 20 $ für Pro. Die Nutzung stoppt, wenn das Guthaben aufgebraucht ist, es sei denn, es wird eine zusätzliche Abrechnung aktiviert. Die interaktive Nutzung von Claude Code und Chat bleibt im Abonnement-Pool.

Claude Pro-Benutzer dokumentieren chronische Schnittstellen- und Workflow-Probleme
Ein langjähriger Claude Pro-Abonnent beschreibt fünf anhaltende Probleme: Dateizerstörung bei Korrekturen, fehlende Versionsverwaltung, Gedächtnisverlust nach Kontextkomprimierung, inkonsistente Entscheidungsfindung und ignorierte Benutzereinstellungen. Der Nutzer berichtet, dass diese Probleme trotz expliziter Anweisungen im Einstellungsbereich von Claude auftreten.