Pruebas y QA automatizadas con IA: una nueva era para las pruebas de software

Antirez, creador de Redis, describe un método práctico para usar agentes LLM y automatizar el QA y las pruebas. El enfoque: crear un archivo markdown que instruye a un agente de IA para que actúe como ingeniero de QA, realizando pruebas manuales en una nueva versión.
Cómo funciona
El archivo markdown incluye:
- Instrucciones para revisar los nuevos commits desde la última versión.
- Tareas específicas de QA, como pruebas de inferencia distribuida o comprobaciones de regresión de velocidad.
- Endpoints SSH, claves y rutas para pruebas de integración.
El agente inspecciona los cambios e identifica lo que podría verse afectado, luego ejecuta una pasada de QA especializada enfocada en regresiones.
Ejemplo: Motor de inferencia DwarfStar
Para DwarfStar, un motor de inferencia LLM de pesos abiertos, antirez usa este archivo para:
- Prueba de inferencia distribuida: Se ejecuta en dos MacBooks, verificando la coherencia de la salida y el soporte de archivos GGUF en ambas máquinas.
- Comprobación de regresión de velocidad: No es necesario especificar velocidades anteriores; el agente aprende dinámicamente del código base.
- Verificación de integración: Cubre configuraciones complejas que son difíciles de automatizar tradicionalmente.
Ejemplo: Redis Arrays
Para Redis Arrays, el agente construye una aplicación grande basada en arreglos de Redis, configura replicación de producción con persistencia, simula días de uso con muchos usuarios y señala anomalías.
QA psicológico
El agente también revisa las funciones en cuanto a claridad y documentación: identifica características que parecen sorprendentes, no documentadas o descuidadas desde la perspectiva del usuario. Esto detecta problemas de UX que el QA manual normalmente omite.
📖 Lee la fuente completa: HN AI Agents
👀 Ver también

La negación como instrucción es débil: en su lugar, describe explícitamente el comportamiento deseado
Un análisis de Reddit muestra que decirle a Claude "no seas extenso" o "no moralices" apenas funciona. En su lugar, usa instrucciones positivas como "responde en 1-2 oraciones" o "dame una respuesta directa, trata las advertencias como opcionales". Además, terminar con "¡gracias!" suaviza el tono.

Códigos de indicaciones de Claude reprobados: L99 más nítido, OODA más estrecho, ARTEFACTOS desvanecidos y 3 nuevos códigos para usar
Una repetición de 6 meses de los códigos de prompt L99, OODA y ARTIFACTS en Claude muestra que L99 es más preciso en Sonnet 4.6/Opus 4.7, OODA falla en prompts estratégicos, ARTIFACTS es innecesario para código, y tres nuevos códigos (/skeptic, /blindspots, /decompose) merecen uso diario. No apiles más de 2 códigos.

Corrigiendo la estupidez de los agentes de IA: Un árbol de contexto compartido por repositorio
La razón por la que los empleados de IA parecen torpes no es el modelo, sino la falta de contexto compartido. La solución de un desarrollador: un repositorio de árbol de contexto con nodos jerárquicos en markdown, mantenido automáticamente por el agente.

Cómo deshabilitar la ventana de contexto de 1M de Claude Code para reducir el uso de tokens
Los usuarios de Anthropic pueden deshabilitar la ventana de contexto de 1M en Claude Code agregando variables de entorno a settings.json, lo que puede reducir el consumo inesperado de tokens. La fuente proporciona dos opciones de configuración: deshabilitar completamente el contexto de 1M o limitar la ventana de compactación automática.