Zwei Monate mit GitHub Spec-Kit und Claude Code: Was funktioniert, was nicht

Nach zwei Monaten Nutzung von GitHubs Spec-Kit für Spec-Driven Development (SDD) mit Claude Code als primärem Agenten berichtet ein Entwickler auf r/LocalLLaMA, was funktioniert und was nicht. Das Toolkit, verfügbar unter github.com/github/spec-kit, erzwingt einen Fünf-Phasen-Workflow: Constitution, Specify, Plan, Tasks, Implement. Die Kernidee: Die Spezifikation, nicht der Prompt, ist die Quelle der Wahrheit.
Was wirklich gut ist
- Agenten-unabhängig: Dieselbe Spezifikation funktioniert mit Claude Code, Cursor, Codex, Gemini CLI, Copilot. Der Autor generierte Code mit Claude Code und übergab die Spezifikation dann nahtlos an Cursor zum Test-Refactoring.
- Harte Checkpoints zwischen Phasen: Die Plan-Phase zeigt die vollständige vorgeschlagene Architektur, bevor Code geschrieben wird, und fängt schlechte Entscheidungen zu Kosten einer 5-Minuten-Korrektur statt 5 Stunden.
- Constitution-Datei als Qualitätskontrolle: Sie legen unveränderliche Regeln vorab fest – Testabdeckungs-Mindestwerte, Abhängigkeits-Whitelists, Performance-Budgets, Typsicherheit. Der Agent scheitert an seiner eigenen Validierung, wenn er versucht, diese zu verletzen.
- Verbesserte Determiniertheit: Das erneute Ausführen der Implementierungsphase liefert konsistentere Ergebnisse als rohes Prompting, da der Agent nicht 30 implizite Entscheidungen selbst treffen muss.
Was nervt
- Drift ist real: Manuelle Code-Änderungen ohne Aktualisierung der Spezifikation führen schnell zu Desynchronisation. spec-kit hat Werkzeuge, aber sie sind früh.
- Aufwand für kleine Änderungen: Bugfixes <50 LOC oder triviale Funktionen wirken zeremoniell. Die Regel des Autors: Nur volles SDD für neue Module oder Funktionen, die 200+ LOC betreffen.
- Legacy-Migration schmerzhaft: Nachträgliches Einführen von SDD in eine Codebasis mit 30k LOC dauert Monate.
- Qualität hängt vom Agenten ab: Claude Code (Sonnet/Opus 4.6+) handhabt es gut; kleinere Modelle generieren Pläne, die kompilieren, aber denen architektonisches Denken fehlt.
Praktische Einrichtung
- Installation:
uv tool install --from git+https://github.com/github/spec-kit.git specify-cli. Nur das offizielle Repository ist sicher – PyPI hat Typosquatter. - Primärer Agent: Claude Code, mit Kreuzvalidierung auf Cursor und Gemini CLI.
- Lokale Persistenz: SQLite (einfach zu spezifizieren/validieren, keine Cloud-Abhängigkeit).
- Wiederverwendbare Constitution-Vorlage: strenge Typisierung, pytest-Abdeckung >80%, explizite Abhängigkeits-Whitelist, keine Cloud-Dienste außer erforderlich.
Offene Fragen
- Können lokale Modelle (Qwen, DeepSeek-Coder, GLM, Llama) Plan und Implement kompetent bewältigen? Der Autor fand, dass kleine Modelle das Format einhalten, aber das architektonische Denken versagt.
- Funktioniert Multi-Agent-SDD? Spezifikation durch ein Modell, Implementierung durch ein anderes, Prüfung durch ein drittes – theoretisch besser, aber in der Praxis nicht messbar besser als Einzel-Agent.
📖 Vollständige Quelle lesen: r/LocalLLaMA
👀 Siehe auch

Tycono: Open-Source KI-Agenten-Framework mit Organigramm und autonomen Verbesserungsschleifen
Tycono ist ein Open-Source-Framework, in dem Sie KI-Agentenrollen in YAML (CTO, Ingenieur, QA usw.) definieren und sie zusammenarbeiten lassen, wobei sie einer Organisationsstruktur mit autonomen Verbesserungsschleifen folgen. Das System lief über Nacht 17 Runden für eine Pixel-Laufspielaufgabe und erzeugte dabei 6.796 Codezeilen über 43 Commits.

Logira: Echtzeitüberwachung von eBPF für KI-Agenten-Ausführungen
Logira ist ein reines Beobachtungstool für die Linux-Kommandozeile, das über eBPF während KI-Agenten-Läufen Exec-, Datei- und Netzwerkereignisse aufzeichnet, mit lokaler Speicherung pro Lauf in JSONL und SQLite sowie integrierten Erkennungsregeln für Zugriffe auf Anmeldedaten, Persistenzänderungen und verdächtige Muster.

Kubeez MCP Server verbindet Claude mit über 70 KI-Medienmodellen
Kubeez hat einen MCP-Server veröffentlicht, der Claude mit über 70 KI-Modellen für Bild-, Video-, Musik- und Sprachgenerierung verbindet. Der Server unterstützt OAuth-Authentifizierung und bietet asynchrone Generierung, wobei Claude den Status abfragt und CDN-URLs zurückgibt.

Jobly: Vertragsmarktplatz mit KI-gestützter Streitbeilegung und Community-Abstimmung
Jobly ist ein Vertragsmarktplatz, der mit Next.js 14, TypeScript und Supabase erstellt wurde. Er verfügt über ein Treuhandsystem mit 10 % Anbieterkautionen auf Vorschläge und einen Streitbeilegungsprozess, der mit einer KI-Bewertung durch Claude beginnt und dann Berufungen an eine Community-Stimmabgabe ermöglicht.