Онтарио, аудит: 60% систем ИИ для записи путают лекарства, 85% упускают детали психического здоровья

Управление Генерального аудитора Онтарио проверило 20 одобренных систем AI Scribe, используемых врачами и медсестрами, смоделировав записи приемов для оценки точности. Результаты оказались удручающими:
- 12 из 20 систем вставили неверную информацию о лекарствах в заметки пациентов.
- 9 из 20 сгенерировали вымышленную информацию — например, утверждения «массы не обнаружены» или «пациент встревожен», — которая никогда не обсуждалась.
- 17 из 20 пропустили ключевые детали о психическом здоровье из записи.
- 6 из 20 полностью или частично опустили проблемы психического здоровья.
Аудит также раскритиковал методологию оценки. Точность медицинских заметок составляла лишь 4% от общего балла, в то время как наличие офиса в Онтарио давало 30%. Контроль предвзятости, оценка угроз/рисков/конфиденциальности и соответствие SOC 2 Type 2 оценивались лишь в 2–4% каждый. Как отмечается в отчете, такие веса «могут привести к отбору поставщиков, чьи ИИ-инструменты могут создавать неточные или предвзятые медицинские записи».
Хотя OntarioMD рекомендовала ручную проверку ИИ-заметок, аудит отметил отсутствие обязательной функции подтверждения в любой одобренной системе. Министерство здравоохранения Онтарио сообщило, что более 5000 врачей используют эти инструменты, и не зафиксировано случаев вреда пациентам.
📖 Источник: HN AI Agents
👀 Смотрите также

Два исследовательских проекта ставят под сомнение имитационное обучение для веб-агентов
Два исследовательских проекта демонстрируют ограничения обучения веб-агентов исключительно на имитации: 'Browser in the Loop' использует обучение с подкреплением с моделью на 8 миллиардов параметров для повышения успешности отправки форм, в то время как 'Concentrate or Collapse' показывает, что стандартное обучение с подкреплением не работает с диффузионными языковыми моделями, требуя оптимизации на уровне последовательностей.

Claude Code v2.1.86: Заголовки сессий, исправления памяти и оптимизация токенов
Claude Code v2.1.86 добавляет заголовки X-Claude-Code-Session-Id для агрегации прокси, исправляет рост потребления памяти в длинных сессиях и снижает накладные расходы на токены при упоминании файлов с помощью @. В выпуске устранены 18 конкретных проблем, включая повреждение конфигурации в Windows и копирование URL OAuth.

Hy3 LLM возглавляет рейтинг OpenRouter: самая дешевая модель или нечто иное?
Hy3 preview, открытая LLM от Tencent, взлетела на вершину рейтинга OpenRouter по использованию токенов, обогнав Claude и DeepSeek V4 Flash. Цена — $0.066/1M входных токенов, это самая дешевая крупная модель, но бенчмарки показывают качество значительно ниже лидеров.

Spotify внедряет значки «верификации» для обозначения живых артистов в противовес сгенерированным ИИ
Spotify добавляет зеленый значок «Подтверждено Spotify» к профилям артистов, соответствующих критериям, таким как привязанные аккаунты в соцсетях, даты концертов или мерч, чтобы отличить живых музыкантов от ИИ-сгенерированных.