Los SRE de IA resuelven incidentes rutinarios, pero los ingenieros pierden contacto con sus sistemas
Sylvain Kalache — SRE en LinkedIn en 2012 — reflexiona sobre su primer prototipo de sistema autocurable y ve su realización en las herramientas actuales de respuesta a incidentes impulsadas por IA. Pero en una nueva entrada de blog, advierte que estos "SRE de IA" están erosionando la experiencia práctica que los ingenieros necesitan para manejar fallos verdaderamente novedosos.
Las ironías de la automatización
Kalache destaca las "Ironías de la Automatización", un concepto del artículo de Lisanne Bainbridge de 1983. La automatización elimina las oportunidades de práctica rutinaria mientras deja a los humanos responsables de situaciones anormales. Esta paradoja se aplica directamente a la respuesta a incidentes:
- Las herramientas de IA manejan alertas, formulan hipótesis, consultan telemetría e incluso implementan correcciones, reduciendo la necesidad de intervención humana en incidentes rutinarios.
- Pero esos incidentes rutinarios son exactamente donde los ingenieros construyen intuición sobre cómo se comportan y fallan sus sistemas.
- Cuando surge un incidente ambiguo y de alta gravedad que la automatización no puede resolver, se espera que los respondedores intervengan con menos práctica de la que habrían tenido anteriormente.
Aviación como modelo para entrenar fallos raros
Kalache señala la aviación como precedente. Los motores de turbina modernos experimentan menos de una parada en vuelo por cada 100,000 horas de vuelo de motor; lo suficientemente raro como para que un piloto quizás nunca lo enfrente en la vida real. Sin embargo, los pilotos deben responder correctamente cuando ocurre. Por ejemplo, el accidente del vuelo 235 de TransAsia Airways ocurrió solo 117 segundos después de la primera advertencia, después de que la tripulación identificara mal una falla de motor.
Para prepararse, los pilotos de aerolíneas se someten a entrenamiento recurrente en simulador cada seis meses según las reglas de la FAA, incluyendo escenarios de falla de motor. Kalache sugiere que los ingenieros de software necesitan "simuladores de incidentes" similares para ensayar fallos raros y complejos.
Simuladores e IA como entrenadores
El empleador actual de Kalache, Rootly, se asoció con Uptime Labs para construir exactamente eso: simulaciones realistas de incidentes. Los ingenieros asumen el rol de comandante de incidentes durante una interrupción de comercio electrónico simulada, usando herramientas de observabilidad y coordinándose con partes interesadas impulsadas por LLM en Slack. Esto proporciona práctica segura para:
- Dar sentido a información incompleta
- Comunicarse claramente
- Coordinar respondedores
- Ejecutar la respuesta real
La IA también se puede utilizar como entrenadora, explicando sus pasos y evidencia, pero Kalache advierte que observar no reemplazará al hacer. "Puedes aprender algunas cosas viendo jugar a Serena Williams", escribe, "pero solo aprendes tenis entrando a la cancha".
📖 Lee la fuente completa: HN AI Agents
👀 Ver también

Explorando qué archivos están incluidos en la ventana de contexto de un chat de Telegram.
Únete a nosotros mientras profundizamos en la comprensión de qué archivos forman parte de la ventana de contexto de un chat de Telegram, mejorando tu conocimiento operativo.

OpenClaw 2026.4.29 roto – Degradar a 2026.2.6
OpenClaw versión 2026.4.29 está rota con errores aleatorios, CLI lenta, respuestas duplicadas. Vuelve a la versión 2026.2.6 para solucionarlo.

Costos por Hora en el Mundo Real para Equipos de Agentes de IA de Larga Duración
Un desarrollador comparte los costos reales por hora para equipos de agentes de IA que ejecutan sesiones de más de 5 horas con acceso completo a Linux, navegador y herramientas. Los agentes de programación cuestan $10-$60/hora, los agentes de marketing $10-$30/hora y los agentes de back-office $5-$15/hora.

Lanzamiento de OpenClaw 2026.3.2: Secretos de Producción, Herramienta PDF y Configuraciones Más Seguras por Defecto
OpenClaw 2026.3.2 introduce un sistema de secretos listo para producción con comportamiento de fallo rápido, una herramienta nativa de PDF con soporte para modelos de Anthropic y Google, y configuraciones más seguras que restringen el acceso a herramientas para nuevas instalaciones.