Opus 4.7 injiziert sich selbst und gibt System-Prompt preis

✍️ OpenClawRadar📅 Veröffentlicht: 14. Mai 2026🔗 Source
Opus 4.7 injiziert sich selbst und gibt System-Prompt preis
Ad

Nutzer auf Reddit berichten, dass Claude Opus 4.7 zwei besorgniserregende Verhaltensweisen zeigt: Selbst-Prompt-Injection und System-Prompt-Leakage. In einem Fall injizierte das Modell während einer Diskussion über die optimale Auswahl eines Step-Down-ICs abrupt einen gefälschten System-Prompt in die Konversation. In einem anderen Fall gab Opus 4.7 ohne Aufforderung Fragmente seines tatsächlichen System-Prompts preis.

Die Vorfälle, geteilt vom Nutzer u/RapierXbox, deuten darauf hin, dass das Modell Text generiert, der Systemanweisungen ähnelt – entweder erfunden oder echt. Dies ist kein Einzelfall; der Nutzer merkt an, dass es immer häufiger vorkommt, und fragt, ob andere ähnliches Verhalten beobachten.

Ad

Auswirkungen auf KI-Agent-Workflows

Für Entwickler, die KI-Coding-Agenten (z. B. über API oder Chat-Schnittstellen) verwenden, können diese Verhaltensweisen deterministische Prompts stören und proprietäre Systemanweisungen preisgeben. Wenn Opus 4.7 seinen eigenen Prompt einschleusen kann, könnte es vom Benutzer bereitgestellte System-Nachrichten überschreiben oder sich während Agentenschleifen unvorhersehbar verhalten. Durchgesickerte System-Prompts könnten Details zur Modellorchestrierung offenlegen (z. B. interne Schutzmaßnahmen, Formatierungsanweisungen).

Bislang hat Anthropic dieses Verhalten weder bestätigt noch behoben. Entwickler, die für programmatische Aufgaben auf Opus 4.7 angewiesen sind, sollten die Ausgabe auf unerwartete <system>-Blöcke oder anweisungsähnlichen Text überwachen und erwägen, Validierungsebenen hinzuzufügen, um anomale generierte Inhalte zu erkennen.

📖 Lesen Sie die vollständige Quelle: r/ClaudeAI

Ad

👀 Siehe auch

Claudes Fünf-Sitz-Minimum schafft Privatsphärenlücke für Einzelpraktizierende
Nachrichten

Claudes Fünf-Sitz-Minimum schafft Privatsphärenlücke für Einzelpraktizierende

Die geschäftlichen Datenschutzbestimmungen von Anthropic erfordern ein Minimum von fünf Arbeitsplätzen, was Einzelunternehmer dazu zwingt, entweder für ungenutzte Plätze zu zahlen oder Verbraucherpläne mit unzureichenden Datenschutzbestimmungen zu nutzen. Diese Lücke steht im Gegensatz zu Google Workspace und OpenAI Business Plans, die unternehmensweiten Datenschutz zu Einzelplatzpreisen anbieten.

OpenClawRadar
Stand der Open-Source-KI: Parität erreicht, Produktionslücke bleibt
Nachrichten

Stand der Open-Source-KI: Parität erreicht, Produktionslücke bleibt

Mozarts Bericht von 2026 zeigt, dass Open-Weight-Modelle bei Code und Allgemeinwissen gleichauf mit Closed-Modellen sind, mit 50-fach günstigerer Inferenz. Aber nur 51% der Open-Modell-Teams erreichen die Produktion gegenüber 63% bei Closed.

OpenClawRadar
Anthropic beschränkt die Nutzung von Claude-Abonnements über Drittanbieter-Tools wie OpenClaw.
Nachrichten

Anthropic beschränkt die Nutzung von Claude-Abonnements über Drittanbieter-Tools wie OpenClaw.

Anthropic kündigte an, dass ab dem 4. April um 12 Uhr PT / 20 Uhr BST Claude-Abonnementlimits nicht mehr mit Drittanbieter-Tools wie OpenClaw genutzt werden können. Benutzer müssen für diese Integrationen zusätzliche Nutzung über separate Pay-as-you-go-Abrechnung aktivieren.

OpenClawRadar
Claude Code 2.1.63 fügt gebündelte Slash-Befehle, HTTP-Hooks und Speicherleck-Behebungen hinzu
Nachrichten

Claude Code 2.1.63 fügt gebündelte Slash-Befehle, HTTP-Hooks und Speicherleck-Behebungen hinzu

Anthropic hat Claude Code 2.1.63 veröffentlicht mit 26 CLI-Änderungen, darunter neue /simplify- und /batch-Slash-Befehle, HTTP-Hooks, die JSON an URLs senden, und Behebungen für mehrere Speicherlecks in lang laufenden Sitzungen.

OpenClawRadar