Los SRE de IA resuelven incidentes rutinarios, pero los ingenieros pierden contacto con sus sistemas

✍️ OpenClawRadar📅 Publicado: 6 de septiembre de 2026🔗 Source
Ad

Sylvain Kalache — SRE en LinkedIn en 2012 — reflexiona sobre su primer prototipo de sistema autocurable y ve su realización en las herramientas actuales de respuesta a incidentes impulsadas por IA. Pero en una nueva entrada de blog, advierte que estos "SRE de IA" están erosionando la experiencia práctica que los ingenieros necesitan para manejar fallos verdaderamente novedosos.

Las ironías de la automatización

Kalache destaca las "Ironías de la Automatización", un concepto del artículo de Lisanne Bainbridge de 1983. La automatización elimina las oportunidades de práctica rutinaria mientras deja a los humanos responsables de situaciones anormales. Esta paradoja se aplica directamente a la respuesta a incidentes:

  • Las herramientas de IA manejan alertas, formulan hipótesis, consultan telemetría e incluso implementan correcciones, reduciendo la necesidad de intervención humana en incidentes rutinarios.
  • Pero esos incidentes rutinarios son exactamente donde los ingenieros construyen intuición sobre cómo se comportan y fallan sus sistemas.
  • Cuando surge un incidente ambiguo y de alta gravedad que la automatización no puede resolver, se espera que los respondedores intervengan con menos práctica de la que habrían tenido anteriormente.
Ad

Aviación como modelo para entrenar fallos raros

Kalache señala la aviación como precedente. Los motores de turbina modernos experimentan menos de una parada en vuelo por cada 100,000 horas de vuelo de motor; lo suficientemente raro como para que un piloto quizás nunca lo enfrente en la vida real. Sin embargo, los pilotos deben responder correctamente cuando ocurre. Por ejemplo, el accidente del vuelo 235 de TransAsia Airways ocurrió solo 117 segundos después de la primera advertencia, después de que la tripulación identificara mal una falla de motor.

Para prepararse, los pilotos de aerolíneas se someten a entrenamiento recurrente en simulador cada seis meses según las reglas de la FAA, incluyendo escenarios de falla de motor. Kalache sugiere que los ingenieros de software necesitan "simuladores de incidentes" similares para ensayar fallos raros y complejos.

Simuladores e IA como entrenadores

El empleador actual de Kalache, Rootly, se asoció con Uptime Labs para construir exactamente eso: simulaciones realistas de incidentes. Los ingenieros asumen el rol de comandante de incidentes durante una interrupción de comercio electrónico simulada, usando herramientas de observabilidad y coordinándose con partes interesadas impulsadas por LLM en Slack. Esto proporciona práctica segura para:

  • Dar sentido a información incompleta
  • Comunicarse claramente
  • Coordinar respondedores
  • Ejecutar la respuesta real

La IA también se puede utilizar como entrenadora, explicando sus pasos y evidencia, pero Kalache advierte que observar no reemplazará al hacer. "Puedes aprender algunas cosas viendo jugar a Serena Williams", escribe, "pero solo aprendes tenis entrando a la cancha".

📖 Lee la fuente completa: HN AI Agents

Ad

👀 Ver también