AWS Bedrock eliminiert still und leise das Claude Opus 4.7-Kontingent: Eine Warnung für produktive KI-Workflows

Ein Hacker News-Nutzer berichtet, dass sein Zugriff auf das Claude Opus 4.7-Modell auf Amazon Bedrock plötzlich entzogen wurde, wobei das TPM-Kontingent stillschweigend auf 0 gesetzt wurde. Der Nutzer, der das Modell für Produktions-Workflows im Einsatz bei Regierungskunden benötigt, stieß auf Drosselungsfehler, bevor er eine Erklärung vom AWS-Support erhielt.
Laut der Support-Antwort geschah der Kontingentabfall aufgrund eines „aktuellen Systemupdates“, das die Zugriffskontrollen basierend auf Faktoren wie regionalen Gegebenheiten, Zahlungshistorie und Nutzungsmustern anpasste. Die Kontingente wurden ab dem 1. Mai 2026 auf 0 gesetzt, und AWS stellt klar, dass eine Wiederherstellung „nicht garantiert werden kann“. Die empfohlene Problemumgehung: Migration zu Claude Opus 4.6, für das der Nutzer Kontingente von 10.000 Anfragen/Minute und 3.000.000 Token/Minute in us-east-1 (mit Cross-Region- und globalen Varianten) hat. Die Support-Nachricht weist darauf hin, dass Opus 4.6 „als effektiver Ersatz mit minimalen Code-Änderungen dienen kann“.
HN-Kommentatoren zeigen sich frustriert. Nutzer DetroitThrow bezeichnet dies als „wahnsinnig für ein Unternehmen, so etwas mit zahlenden Kunden und Produktions-Workflows zu machen“ und empfiehlt, zu Google AI oder direktem Anthropic-Zugang zu wechseln. Sie merken an, dass Bedrock eine Geschichte willkürlicher Drosselung hat, und verweisen auf Quinnypigs frühere Berichterstattung über Enterprise-Support-Überraschungen. Der ursprüngliche Poster bestätigt, dass er „nicht einmal eine einzige Anfrage stellen kann“.
Dieser Vorfall unterstreicht das Risiko, AWS Bedrock für die Produktions-KI-Inferenz zu nutzen, insbesondere bei hochmodernen Modellen, bei denen der Zugriff ohne Vorwarnung entzogen werden kann. Entwickler, die geschäftskritische Workloads auf Bedrock betreiben, sollten über Multi-Provider-Fallbacks oder direkte API-Verträge mit Modellanbietern wie Anthropic nachdenken.
📖 Read the full source: HN AI Agents
👀 Siehe auch

Claude Skills vs. MCP: Eine praktische Grenzfrage für Entwickler
Ein Entwickler stellt die Frage, wo der Mehrwert von MCP entscheidend wird gegenüber Claude Skills, nachdem die Skills-Veröffentlichung die Integration von Werkzeugen erschwert hat, und merkt an, dass gut strukturierte Anweisungen oft ausreichen, ohne Protokollgrenzen zu benötigen.

Windows 11 2026 Update: Taskleisten-Neupositionierung, reduzierte Copilot-Funktion, Verbesserungen am Datei-Explorer
Microsoft führt 2026 Windows 11-Updates ein, die die Taskleistenpositionierung wiederherstellen, Copilot-Überladung in Kern-Apps reduzieren und die Datei-Explorer-Leistung basierend auf Nutzerfeedback verbessern.

Reddit-Post kritisiert virtuelle CEO-Agenten-Workflows, befürwortet kompetenzbasierten Ansatz
Ein Reddit-Beitrag auf r/openclaw kritisiert die Erstellung von KI-Agenten mit Berufsbezeichnungen wie 'Backend-Entwickler' oder 'Growth Hacker' als unnötigen Overhead und schlägt stattdessen vor, Fähigkeiten als wiederverwendbare Skills zu bündeln, die bei Bedarf abgerufen werden können.

Qwen3.5-122B auf Blackwell SM120: fp8-KV-Cache-Korruptionsproblem und Leistungsbefunde
Tests von Qwen3.5-122B auf 8x RTX PRO 6000 Blackwell-Hardware ergaben, dass der fp8_e4m3-KV-Cache stillschweigend fehlerhafte Ausgaben ohne Fehlermeldungen erzeugt, sodass stattdessen ein bf16-KV-Cache erforderlich ist. Die MTP-Optimierung brachte eine 2,75-fache Beschleunigung bei Einzelanfragen, während DeltaNet-Einschränkungen andere Optimierungen blockierten.