Claude Code's Read Tool reduziert Bilder stillschweigend und verursacht Halluzinationen

Ein Reddit-Benutzer berichtet, dass das read-Tool von Claude Code Bilder stillschweigend herunterskaliert, bevor sie an das Modell weitergegeben werden. Als der Benutzer 4.7 Retina-Screenshots über Claude Code an Claude Opus 4.7 sendete und das Modell bat, den Text daraus zu extrahieren, gab das Modell eine vage Zusammenfassung zurück, dass es „nicht jeden Wert vollständig lesen“ könne. Der Text war auf dem Monitor des Benutzers in voller Auflösung deutlich lesbar.
Bei der Untersuchung stellte der Benutzer fest, dass das read-Tool Bilder herunterskaliert, bevor das Modell sie verarbeitet. Das Modell sieht eine verkleinerte Kopie, nicht den ursprünglichen Screenshot. Das Tool liefert Ergebnisse, die von denen eines gelesenen Textdokuments nicht zu unterscheiden sind – es gibt keine Warnung, dass das Bild neu abgetastet wurde. Das bedeutet, dass Entwickler, die sich darauf verlassen, mit Claude Code UI-Texte, Fehlermeldungen oder andere Bildschirminhalte aus Screenshots zu extrahieren, möglicherweise selbstbewusste, aber ungenaue Antworten auf Basis unscharfer Eingaben erhalten.
Der Benutzer äußerte die Sorge, dass viele frühere Screenshot-basierte Interaktionen infolgedessen Halluzinationen produziert haben könnten. Der Beitrag hat in der r/ClaudeAI-Community eine breite Diskussion ausgelöst.
📖 Lesen Sie die vollständige Quelle: r/ClaudeAI
👀 Siehe auch

DIY OpenClaw-Alternative mit Claude-Code im Headless-Modus
Ein Entwickler hat einen Python-Server erstellt, der Anfragen an Claude Code im Headless-Modus sendet, mit Telegram-Bot-Zugriff, Hammerspoon-Automatisierung und lokaler Markdown-Dateispeicherung für Aufgaben, Zeitpläne und Notizen.

4-Fenster iTerm2-Einrichtung für Claude Code CLI trennt KI-Rollen
Ein Entwickler hat ein vierteiliges iTerm2-Terminal-Setup speziell für Claude Code CLI erstellt, um Kontextverschiebung und Selbstbewertungsverzerrung zu adressieren. Jeder Bereich ist auf eine spezifische Rolle mit dedizierten Modellen und Berechtigungen festgelegt.

SkyClaw führt verschlüsselte Chat-basierte API-Schlüssel-Einrichtung für KI-Agenten ein
SkyClaw implementiert die AES-256-GCM-verschlüsselte Schlüsselaufnahme über Chat, indem Schlüsselbefehle auf Systemebene abgefangen werden, sodass das LLM niemals API-Schlüssel sieht, und Einmalschlüsselverschlüsselung verwendet wird, sodass Messaging-Plattformen nur Chiffretext sehen.

civStation: Open-Source VLM-Harness für die natürliche Sprachsteuerung von Civilization VI
civStation ist ein Open-Source-Computer-Use-Stack, der Sprach- und natürliche Sprachsteuerung von Civilization VI ermöglicht und strategische Befehle auf hoher Ebene durch einen VLM-basierten Beobachtungs- und Ausführungszyklus in UI-Aktionen übersetzt.