Два месяца с Spec-Kit от GitHub и Claude Code: что работает, что нет

✍️ OpenClawRadar📅 Опубликовано: 15 мая 2026 г.🔗 Source
Два месяца с Spec-Kit от GitHub и Claude Code: что работает, что нет
Ad

После двух месяцев использования GitHub spec-kit для Spec-Driven Development (SDD) с Claude Code в качестве основного агента разработчик на r/LocalLLaMA рассказывает, что работает, а что нет. Инструментарий, доступный по адресу github.com/github/spec-kit, реализует пятифазовый рабочий процесс: Constitution, Specify, Plan, Tasks, Implement. Основная идея: спецификация, а не промпт, является источником истины.

Что действительно хорошо

  • Агент-независимость: Одна и та же спецификация работает с Claude Code, Cursor, Codex, Gemini CLI, Copilot. Автор сгенерировал код с Claude Code, затем передал спецификацию в Cursor для рефакторинга тестов без каких-либо проблем.
  • Жесткие контрольные точки между фазами: Фаза Plan показывает полную предполагаемую архитектуру до того, как написан хотя бы один фрагмент кода, что позволяет выявлять плохие решения ценой 5-минутного исправления вместо 5 часов.
  • Файл Constitution как шлюз качества: Вы заранее определяете нерушимые правила — минимальное покрытие тестами, разрешенный список зависимостей, бюджеты производительности, строгость типизации. Агент не проходит собственную валидацию, если пытается их нарушить.
  • Улучшенная детерминированность: Повторный запуск фазы Implement дает более согласованный вывод, чем сырые промпты, поскольку агенту не нужно самостоятельно принимать 30 неявных решений.
Ad

Что раздражает

  • Рассинхрон реален: Ручное редактирование кода без обновления спецификации приводит к быстрой десинхронизации. В spec-kit есть инструментарий, но он сыроват.
  • Накладные расходы для небольших изменений: Исправления ошибок <50 строк или тривиальные фичи кажутся излишне церемониальными. Правило автора: полный SDD только для новых модулей или функций, затрагивающих 200+ строк кода.
  • Миграция легаси болезненна: Встраивание SDD в существующую кодовую базу из 30 тыс. строк может занять месяцы.
  • Качество зависит от агента: Claude Code (Sonnet/Opus 4.6+) справляется хорошо; маленькие модели генерируют планы, которые компилируются, но лишены архитектурного мышления.

Практическая настройка

  • Установка: uv tool install --from git+https://github.com/github/spec-kit.git specify-cli. Только официальный репозиторий безопасен — на PyPI есть тайпсквоттеры.
  • Основной агент: Claude Code с перекрестной валидацией на Cursor и Gemini CLI.
  • Локальное хранение: SQLite (легко специфицировать и валидировать, нет зависимости от облака).
  • Шаблон Constitution: строгая типизация, покрытие pytest >80%, явный разрешенный список зависимостей, никаких облачных сервисов без необходимости.

Открытые вопросы

  • Могут ли локальные модели (Qwen, DeepSeek-Coder, GLM, Llama) компетентно выполнять Plan и Implement? Автор обнаружил, что маленькие модели следуют формату, но архитектурное мышление не работает.
  • Работает ли мультиагентный SDD? Спецификация одной моделью, реализация другой, аудит третьей — теоретически лучше, но на практике не измеримо лучше, чем с одним агентом.

📖 Читать полный источник: r/LocalLLaMA

Ad

👀 Смотрите также

Сделай Дело: Мета-система промптов для ИИ-агентов в программировании
Инструменты

Сделай Дело: Мета-система промптов для ИИ-агентов в программировании

Get Shit Done — это система мета-промптов, инженерии контекста и разработки на основе спецификаций, которая работает с Claude Code, OpenCode, Gemini CLI, Codex, Copilot и Antigravity. Она решает проблему «гниения контекста» за счёт структурированных промптов и рабочих процессов проверки.

OpenClawRadar
Сборка локального сервера LLM за $6.4K: Анализ TCO в сравнении с затратами на API
Инструменты

Сборка локального сервера LLM за $6.4K: Анализ TCO в сравнении с затратами на API

Разработчик публикует детальный анализ совокупной стоимости владения локальным сервером с 4x MI100, работающим под управлением llama.cpp, в сравнении с API-аналогами, включая тарифы OpenAI и Z.AI для программирования.

OpenClawRadar
Gemini 3.1 Pro в мультиагентных системах: высокое качество проектирования, 20% частота сбоев при вызове инструментов.
Инструменты

Gemini 3.1 Pro в мультиагентных системах: высокое качество проектирования, 20% частота сбоев при вызове инструментов.

Разработчики Bobr, генератора презентаций на основе ИИ с мультиагентной архитектурой, сообщают, что Gemini 3.1 Pro создаёт впечатляющий дизайн, но страдает от ~20% сбоев при вызове инструментов и повреждения текста в рабочих конвейерах.

OpenClawRadar
80-строчный скрипт на Python использует Claude для автогенерации предложений внутренних ссылок, сокращая время линковки с 2 часов до 8 минут
Инструменты

80-строчный скрипт на Python использует Claude для автогенерации предложений внутренних ссылок, сокращая время линковки с 2 часов до 8 минут

Пользователь Reddit написал 80-строчный скрипт на Python, который передает черновик статьи и карту сайта в Claude и возвращает релевантные цели внутренних ссылок с предложенным анкорным текстом — сокращая время ручного проставления ссылок с 2 часов до 8 минут на статью.

OpenClawRadar