Ontario-Prüfbericht: 60% der KI-Schreibsysteme verwechseln Medikamente, 85% übersehen psychische Details

Das Amt des Rechnungsprüfers von Ontario hat 20 zugelassene KI-Notizschreibsysteme überprüft, die von Ärzten und Krankenpflegern verwendet werden. Dabei wurden simulierte Arzt-Patienten-Aufnahmen erstellt, um die Genauigkeit zu bewerten. Die Ergebnisse sind erschütternd:
- 12 von 20 Systemen fügten falsche Arzneimittelinformationen in die Patientenakten ein.
- 9 von 20 fabrizierten Informationen – z. B. „keine Knoten gefunden“ oder „Patient ängstlich“ – die nie besprochen wurden.
- 17 von 20 übersahen wichtige Details zur psychischen Gesundheit aus der Aufnahme.
- 6 von 20 ließen psychische Gesundheitsprobleme ganz oder teilweise aus.
Der Prüfungsbericht kritisierte auch die Bewertungsmethodik. Die Genauigkeit medizinischer Aufzeichnungen machte nur 4% der Gesamtpunktzahl aus, während eine lokale Präsenz in Ontario mit 30% zu Buche schlug. Kontrollen zu Voreingenommenheit, Bedrohungs-/Risiko-/Datenschutzbewertungen und SOC-2-Typ-2-Konformität trugen jeweils nur 2–4% bei. Wie der Bericht feststellt, könnte eine solche Gewichtung „dazu führen, dass Anbieter ausgewählt werden, deren KI-Tools ungenaue oder verzerrte Krankenakten produzieren.“
Obwohl OntarioMD die manuelle Überprüfung von KI-Notizen empfohlen hat, stellte die Prüfung fest, dass in keinem zugelassenen System eine obligatorische Bestätigungsfunktion vorhanden ist. Ontario’s Gesundheitsministerium gab an, dass über 5.000 Ärzte diese Tools verwenden und keine Patientenschäden gemeldet wurden.
📖 Lesen Sie die vollständige Quelle: HN AI Agents
👀 Siehe auch

Claude Code v2.1.187: Korrekturen der strukturierten Ausgabe, Sandbox-Sicherheit und Einschränkungen des Organisationsmodells
Claude Code v2.1.187 fügt die Einstellung sandbox.credentials, Organisations-Modellbeschränkungen sowie Fehlerbehebungen für strukturierte Ausgabeschleifen, Remote-MCP-Hänger und Tiefenverfolgung von Unteragenten hinzu.

Claude Opus 4.7 lässt in Logik und Konversation nach, berichten Nutzer
Opus 4.7 führt einen neuen Tokenizer ein, der 30-50% mehr kostet, weist Meta-Erzählung, Positionsinstabilität und Planung ohne Ausführung auf – und ist damit für technische Zusammenarbeit schlechter als 4.6.

KI-Agent verursachte AWS-Rechnung von 6.531 USD durch Scannen des DN42-Netzwerks
Ein KI-Agent, der versuchte, das DN42-Hobbynetzwerk zu scannen, verursachte AWS-Ausgangskosten in Höhe von 6.531,30 $. Der Betreiber schaltete ihn nach 24 Stunden ab.

Claude für Word Add-in: Beweise in Analytics API gefunden
Die Analyse-API von Anthropic liefert jetzt Metriken für Claude für Word neben den bestehenden Add-Ins für Excel und PowerPoint, was darauf hindeutet, dass die Word-Integration in Entwicklung ist. Die API zeigt Null-Nutzungszahlen für Word, was darauf schließen lässt, dass sie noch nicht öffentlich verfügbar ist.