SREs de IA Resolvem Incidentes de Rotina, Mas Engenheiros Perdem o Contato com Seus Sistemas

✍️ OpenClawRadar📅 Publicado: September 6, 2026🔗 Source
Ad

Sylvain Kalache — SRE no LinkedIn em 2012 — reflete sobre seu protótipo inicial para um sistema de autocorreção e vê sua realização nas ferramentas atuais de resposta a incidentes impulsionadas por IA. Mas, em uma nova postagem no blog, ele alerta que esses "SREs de IA" estão corroendo a experiência prática que os engenheiros precisam para lidar com falhas verdadeiramente novas.

As ironias da automação

Kalache destaca as "Ironias da Automação", um conceito do artigo de 1983 de Lisanne Bainbridge. A automação remove oportunidades de prática rotineira, deixando os humanos responsáveis por situações anormais. Esse paradoxo se aplica diretamente à resposta a incidentes:

  • As ferramentas de IA lidam com alertas, formulam hipóteses, consultam telemetria e até implementam correções — reduzindo a necessidade de intervenção humana em incidentes de rotina.
  • Mas esses incidentes de rotina são exatamente onde os engenheiros constroem intuição sobre como seus sistemas se comportam e falham.
  • Quando ocorre um incidente ambíguo e de alta gravidade que a automação não consegue resolver, espera-se que os respondedores intervenham com menos prática do que teriam tido anteriormente.
Ad

Aviação como modelo para treinamento em falhas raras

Kalache aponta a aviação como precedente. Motores de turbina modernos sofrem menos de uma parada em voo por 100.000 horas de voo do motor — raro o suficiente para que um piloto nunca enfrente isso na vida real. No entanto, os pilotos devem responder corretamente quando isso acontece. Por exemplo, o acidente do Voo 235 da TransAsia Airways ocorreu apenas 117 segundos após o primeiro aviso, depois que a tripulação identificou erroneamente uma falha no motor.

Para se preparar, os pilotos de companhias aéreas passam por treinamento recorrente em simulador a cada seis meses, de acordo com as regras da FAA, incluindo cenários de falha de motor. Kalache sugere que engenheiros de software precisam de "simuladores de incidente" semelhantes para ensaiar falhas raras e complexas.

Simuladores e IA como treinadores

O atual empregador de Kalache, a Rootly, fez parceria com a Uptime Labs para construir exatamente isso: simulações realistas de incidentes. Os engenheiros assumem o papel de comandante de incidente durante uma simulação de interrupção de comércio eletrônico, usando ferramentas de observabilidade e coordenando com partes interessadas alimentadas por LLM no Slack. Isso fornece prática segura para:

  • Dar sentido a informações incompletas
  • Comunicar-se claramente
  • Coordenar os respondentes
  • Executar a resposta real

A IA também pode ser usada como treinadora — explicando seus passos e evidências — mas Kalache adverte que assistir não substitui fazer. "Você pode aprender algumas coisas assistindo Serena Williams jogar", escreve ele, "mas só aprende tênis entrando na quadra."

📖 Leia a fonte completa: HN AI Agents

Ad

👀 See Also

Agentes de IA precisam de primitivas de reversão, não apenas de autonomia
News

Agentes de IA precisam de primitivas de reversão, não apenas de autonomia

Um desenvolvedor argumenta que frameworks de agentes devem adotar conceitos de banco de dados como ACID, sagas e ações compensatórias para lidar com falhas parciais, em vez de depender de LLMs para "resolver o problema".

OpenClawRadar
A Wikipédia Proíbe Conteúdo Gerado por IA, Permite Uso Limitado de IA com Revisão Humana
News

A Wikipédia Proíbe Conteúdo Gerado por IA, Permite Uso Limitado de IA com Revisão Humana

A Wikipédia proibiu oficialmente seus 260.000 editores de usar IA como o ChatGPT para escrever artigos, citando preocupações com precisão e confiabilidade. Os editores ainda podem usar IA para tradução e revisão de texto com aprovação humana.

OpenClawRadar
Dois novos modelos aparecem no OpenRouter, possivelmente variantes do DeepSeek V4
News

Dois novos modelos aparecem no OpenRouter, possivelmente variantes do DeepSeek V4

Dois novos modelos chamados healer-alpha e hunter-alpha apareceram no OpenRouter, com especificações correspondentes aos detalhes vazados sobre o DeepSeek V4. Testes iniciais mostram que ambos os modelos têm bom desempenho em cenários de roleplay, sem filtragem de mensagens e com geração de tokens mais rápida do que o GLM 5.0.

OpenClawRadar
Claude Code v2.1.162 Lança Informações de Espera de Sessão, Correção de Timeout MCP e Reformulação da Visão de Agentes
News

Claude Code v2.1.162 Lança Informações de Espera de Sessão, Correção de Timeout MCP e Reformulação da Visão de Agentes

Claude Code v2.1.162 adiciona `waitingFor` à saída `--json`, corrige o bug de timeout do MCP abaixo de 1000ms, melhora a renderização do terminal para a visualização de agentes e muito mais. Detalhes internos.

OpenClawRadar