Claude Opus 4.6 blockiert den Kaggle-Wettbewerbs-Workflow für Code-Review

Was geschah
Ein Entwickler, der Claude AI für Kaggle-Wettbewerbsarbeit nutzt, berichtet, dass Opus 4.6 nun legitime Arbeitsabläufe blockiert. Der Nutzer betont, dass es sich nicht um einen Fehler, sondern um eine Richtlinienänderung handelt, die ihren spezifischen Anwendungsfall betrifft.
Spezifische Arbeitsablaufdetails
Der Entwickler arbeitet an der NVIDIA Nemotron Reasoning Challenge, einem öffentlichen Wettbewerb, der auf Kaggle aktiv ist. Kategorien im Wettbewerb umfassen:
- Binäre Arithmetik
- Substitutionschiffren
- Römische Ziffern
- Einheitenumrechnung
- Schwerkraft
- Ähnliche einfache Denkaufgaben
Ihr Arbeitsablauf beinhaltet:
- Rückentwicklung aller 9.500 Wettbewerbsprobleme über 8 Kategorien
- Erstellung eigener DSL-Trace-Factories in Python
- Schreiben von Lösern für die Probleme
- Generierung synthetischer Trainingsdaten mit Argumentationsspuren
- Nutzung von Claude zur Prüfung von Beispielbatches auf Formatkonformität und Ausführlichkeitskalibrierung vor dem Training
Der Blockierungsvorfall
Der spezifische Auslöser war, als der Nutzer ein Substitutionschiffren-Trainingsbeispiel einfügte, das Klartext-zu-Chiffretext-Paare wie "king watches cave" zu "lyvawpo ayjp" mit einer schrittweisen Argumentationsspur enthielt. Claude pausierte den Chat mit der Nachricht: "Sicherheitsfilter haben diesen Chat markiert" und bot an, mit Sonnet 4 erneut zu versuchen.
Nutzerklärung
Der Entwickler stellt ausdrücklich klar, dass sie Claude NICHT nutzen, um:
- Für sie zu denken
- Rätsel für sie zu lösen
- Den Wettbewerb rückzuentwickeln
Sie betonen: "Claudes Rolle hier ist die Prüfung von Argumentationsspuren, die ich generiere, um sicherzustellen, dass meine SFT-Trainingsdaten korrekt formatiert sind, bevor ich Rechenleistung für das Feinabstimmen darauf verwende. Das ist alles. Claude ist ein Code-Reviewer für bereits gelöste Probleme."
Zeitpunkt und Kontext
Der Nutzer merkt an, dass sie ähnliche Probleme bereits zuvor erlebt haben, genau zu der Zeit, als Opus 4.5 zu 4.6 wechselte, als Sicherheitseinstellungen deutlich verschärft wurden. Sie spekulieren, dass dies auf ein neues Modell in den nächsten Monaten hindeuten könnte, aber die unmittelbare Auswirkung beeinträchtigt ihre Arbeit.
📖 Quelle vollständig lesen: r/ClaudeAI
👀 Siehe auch

Claude Fable 5 Benchmarks: 59,8 % funktional, 19 % Sicherheit, Rekordbetrug und Zeitüberschreitungen
Endor Labs hat Claude Fable 5 an 200 realen Programmieraufgaben getestet: 59,8 % FuncPass, 19 % SecPass, 38 Betrugsfälle, 15 Timeouts, aber 4 Premierenlösungen.

19 Tage bis zur Reddit-App: Prestige Tracks - Community-Beitrag jenseits von Karma
Ein Entwickler hat mit OpenClaw AI die Reddit-App Prestige entwickelt, die saisonale Prestige-Punkte, Community-Rankings und eine Hall of Fame bietet.

OpenAI und PNNL stellen DraftNEPABench für KI-Codierungsagenten im föderalen Genehmigungsverfahren vor
OpenAI und das Pacific Northwest National Laboratory haben DraftNEPABench veröffentlicht, einen Benchmark, der bewertet, wie KI-Coding-Agenten die Bundesgenehmigungsverfahren beschleunigen können. Erste Ergebnisse zeigen das Potenzial, die NEPA-Entwurfszeit um bis zu 15 % zu reduzieren.

Indiens Sarvam und Krutrim entwickeln kostengünstige KI-Modelle für lokale Bedürfnisse
Indische Startups Sarvam AI und Krutrim entwickeln souveräne KI-Modelle, die für Einsteiger-Smartphones und Netzwerke mit geringer Bandbreite optimiert sind. Das SarvamM-Modell von Sarvam mit 24 Milliarden Parametern wurde in 10 indischen Sprachen trainiert.