Dos meses con Spec-Kit de GitHub y Claude Code: Lo que funciona, lo que no

✍️ OpenClawRadar📅 Publicado: 15 de mayo de 2026🔗 Source
Dos meses con Spec-Kit de GitHub y Claude Code: Lo que funciona, lo que no
Ad

Después de dos meses usando spec-kit de GitHub para desarrollo basado en especificaciones (SDD) con Claude Code como agente principal, un desarrollador en r/LocalLLaMA informa sobre lo que funciona y lo que no. El kit, disponible en github.com/github/spec-kit, impone un flujo de trabajo de cinco fases: Constitución, Especificación, Plan, Tareas, Implementación. La idea central: la especificación, no el prompt, es la fuente de verdad.

Lo que realmente funciona

  • Independiente del agente: La misma especificación funciona con Claude Code, Cursor, Codex, Gemini CLI, Copilot. El autor generó código con Claude Code, luego pasó la especificación a Cursor para refactorizar pruebas sin problemas.
  • Puntos de control estrictos entre fases: La fase de Plan muestra la arquitectura propuesta completa antes de escribir cualquier código, detectando malas decisiones a un costo de arreglo de 5 minutos en lugar de 5 horas.
  • Archivo de constitución como filtro de calidad: Defines reglas inviolables de antemano: cobertura mínima de pruebas, listas blancas de dependencias, presupuestos de rendimiento, rigurosidad de tipos. El agente falla su propia validación si intenta violarlas.
  • Determinismo mejorado: Re-ejecutar la fase de implementación produce resultados más consistentes que el prompting puro, ya que el agente no está llenando 30 decisiones implícitas.
Ad

Lo que molesta

  • La desviación es real: Ediciones manuales de código sin actualizar la especificación causan desincronización rápida. spec-kit tiene herramientas pero son tempranas.
  • Sobrecarga para cambios pequeños: Correcciones de errores <50 LOC o características triviales se sienten ceremoniales. La regla del autor: solo SDD completo para nuevos módulos o características que toquen 200+ LOC.
  • Migración heredada dolorosa: Adaptar SDD a una base de código de 30k LOC lleva meses.
  • La calidad depende del agente: Claude Code (Sonnet/Opus 4.6+) lo maneja bien; los modelos más pequeños generan planes que compilan pero carecen de razonamiento arquitectónico.

Configuración práctica

  • Instalación: uv tool install --from git+https://github.com/github/spec-kit.git specify-cli. Solo el repositorio oficial es seguro — PyPI tiene typosquatters.
  • Agente principal: Claude Code, con validación cruzada en Cursor y Gemini CLI.
  • Persistencia local: SQLite (fácil de especificar/validar, sin dependencia en la nube).
  • Plantilla de constitución reutilizable: tipado estricto, cobertura de pytest >80%, lista blanca de dependencias explícita, sin servicios en la nube a menos que sea requerido.

Preguntas abiertas

  • ¿Pueden los modelos locales (Qwen, DeepSeek-Coder, GLM, Llama) manejar Plan e Implementación de manera competente? El autor encontró que los modelos pequeños siguen el formato pero el razonamiento arquitectónico falla.
  • ¿Funciona el SDD multi-agente? Especificación por un modelo, implementación por otro, auditoría por un tercero — teóricamente mejor, pero no mediblemente mejor que un solo agente en la práctica.

📖 Leer la fuente completa: r/LocalLLaMA

Ad

👀 Ver también

Dos Herramientas MCP para Claude Code: Validación de Ideas y Memoria del Agente de Trading
Herramientas

Dos Herramientas MCP para Claude Code: Validación de Ideas y Memoria del Agente de Trading

Un desarrollador creó dos herramientas MCP para Claude Code: idea-reality-mcp verifica GitHub y Hacker News antes de programar para evitar duplicados, mientras que tradememory-protocol proporciona memoria para agentes de IA de trading para almacenar operaciones con contexto y rastrear el rendimiento de estrategias. Ambas son de código abierto y están disponibles en PyPI.

OpenClawRadar
Logira: Auditoría en Tiempo de Ejecución eBPF para Ejecuciones de Agentes de IA
Herramientas

Logira: Auditoría en Tiempo de Ejecución eBPF para Ejecuciones de Agentes de IA

Logira es una herramienta de línea de comandos (CLI) para Linux de solo observación que registra eventos de ejecución, archivos y red mediante eBPF durante la ejecución de agentes de IA, con almacenamiento local por ejecución en JSONL y SQLite y reglas de detección integradas para acceso a credenciales, cambios de persistencia y patrones sospechosos.

OpenClawRadar
Panel de control web de código abierto rastrea el uso de tokens de Claude para flujos de trabajo remotos.
Herramientas

Panel de control web de código abierto rastrea el uso de tokens de Claude para flujos de trabajo remotos.

Un desarrollador creó react-ai-token-monitor, un panel de control web ligero que analiza archivos de proyectos locales de Claude en tiempo real para calcular costos, mostrar desgloses de modelos y rastrear patrones de uso. La herramienta reveló un consumo de tokens de Claude por valor de $4,808 en marzo de 2026 en un plan Max 20x.

OpenClawRadar
BrowserKing: Extensión de Código Abierto para Chrome para Control del Navegador mediante Claude y Otros Modelos
Herramientas

BrowserKing: Extensión de Código Abierto para Chrome para Control del Navegador mediante Claude y Otros Modelos

BrowserKing es una extensión gratuita y de código abierto para Chrome que permite a Claude y más de 15 modelos ver y controlar tu navegador desde un panel lateral. Toma capturas de pantalla, las envía al modelo y luego actúa según las decisiones para hacer clic en botones, llenar formularios, desplazarse y navegar por pestañas.

OpenClawRadar