Auditoria de Ontário: 60% dos sistemas de IA para transcrição confundem medicamentos, 85% perdem detalhes de saúde mental

O Gabinete do Auditor Geral de Ontário auditou 20 sistemas de IA para anotações médicas aprovados, usados por médicos e enfermeiros, simulando gravações de consultas para avaliar a precisão. Os resultados são contundentes:
- 12 de 20 sistemas inseriram informações incorretas sobre medicamentos nas anotações dos pacientes.
- 9 de 20 fabricaram informações — por exemplo, afirmando "nenhuma massa encontrada" ou "paciente ansioso" — que nunca foram discutidas.
- 17 de 20 perderam detalhes importantes de saúde mental da gravação.
- 6 de 20 omitiram total ou parcialmente questões de saúde mental.
A auditoria também criticou a metodologia de pontuação da avaliação. A precisão das anotações médicas representou apenas 4% da pontuação total, enquanto ter presença local em Ontário contribuiu com 30%. Controles de viés, avaliações de ameaça/risco/privacidade e conformidade com SOC 2 Tipo 2 contaram apenas 2–4% cada. Como o relatório afirma, tais ponderações "podem resultar na seleção de fornecedores cujas ferramentas de IA podem produzir registros médicos imprecisos ou tendenciosos".
Embora a OntarioMD tenha recomendado revisão manual das anotações de IA, a auditoria observou que nenhum recurso de atestado obrigatório está presente em qualquer sistema aprovado. O Ministério da Saúde de Ontário afirmou que mais de 5.000 médicos usam essas ferramentas sem nenhum dano ao paciente reportado.
📖 Leia a fonte completa: HN AI Agents
👀 See Also

Claude Opus 4.6 esforço=baixo parâmetro causa comportamento de agente preguiçoso
Ao usar effort=low com o Claude Opus 4.6, os agentes fizeram menos chamadas de ferramentas, foram menos minuciosos na verificação cruzada e ignoraram partes dos prompts do sistema sobre pesquisa na web. Mudar para effort=medium resolveu os problemas.

Por que não vou ler ficção escrita por LLMs: Perfis estatísticos e o problema da escrita mediana
Chris McCormick explica por que ele evita ficção escrita por LLMs, argumentando que seu perfil estatístico é muito próximo da mediana, empurrando a mente dos leitores em direção ao estatisticamente normal, em vez do criativamente único.

Resultados da Pesquisa sobre Confiabilidade e Padrões de Desenvolvimento de Agentes de IA
Uma sessão colaborativa de pesquisa com o Claude Opus analisou 15 artigos sobre agentes de IA, revelando problemas de confiabilidade quantificados: os agentes produzem 2 a 4 sequências de ações diferentes em 10 execuções, com 69% da divergência ocorrendo na primeira decisão. Agentes de autoaperfeiçoamento mostraram taxas de recusa de segurança caindo de 99,4% para 54,4% por meio de seu próprio aprendizado.

Telus implementa conversão de sotaque em tempo real em agentes de call center via Tomato.ai
A Telus está usando o sistema de fala-para-fala da Tomato.ai para alterar os sotaques de agentes offshore em tempo real, gerando reações negativas sobre transparência e direitos dos trabalhadores.