Автоисследование с Claude Code в рабочей кодовой базе: 60 экспериментов, 3 изменения сохранены

Эксперимент по автоисследованию на рабочей кодовой базе
Разработчик протестировал подход автоисследования Карпати на реальной производственной системе с использованием Claude Code, запустив 60 итераций в двух раундах, находясь вдали от компьютера. Целью была гибридная поисковая система, построенная на Django, pgvector и Cohere embeddings.
Ключевые результаты и выводы
Из 60 итераций только 3 изменения были сохранены, а 57 — отменены. Общее улучшение оценки было незначительным (+0,03), но полученные знания оказались важными:
- Сопоставление заголовков как сигнал поиска оказалось отрицательным, что было продемонстрировано всего за 2 итерации
- Увеличение пула кандидатов не дало эффекта — проблема была в ранжировании, а не в полноте охвата
- Ручная адаптивная взвешивание действительно работало — её удаление привело к ухудшениям
- Корректировка формул демпфирования ключевых слов почти не влияла на оценки
- Раунд 2, нацеленный на метаданные Haiku, не дал улучшений, потому что веса ранжирования из Раунда 1 были совместно оптимизированы под вывод исходного промпта
- Обнаружена ошибка кэширования Redis: ключи были привязаны к хэшу запроса, а не к хэшу промпта, что могло остаться незамеченным в продакшене
Практические выводы
Главное понимание заключалось в том, что автоисследование помогает определить, где находится потолок, а не просто найти улучшения. Наличие 60 точек данных, говорящих «Вы можете прекратить настройку этого», дает конкретные доказательства вместо интуиции. Разработчик отмечает, что этот подход сэкономил время на ручные эксперименты с оптимизациями, которые не окупились бы.
Полный отчёт доступен по ссылке на блог, а открытый навык автоисследования Claude Code — на GitHub. Разработчик интересуется, пробовал ли кто-то это на немаркетинговых кодовых базах и какие метрики они используют.
📖 Read the full source: r/ClaudeAI
👀 Смотрите также

3 реальных препятствия после нескольких недель тестирования OpenClaw для автоматизации бизнеса
Пользователь Reddit сообщает о трех блокерах после нескольких недель работы OpenClaw на Windows 11 с Claude Haiku 4.5 + DeepSeek: выполнение в фоновом режиме скрывает действия агентов, интеграции с CRM ломаются при передаче, а оркестратор запрашивает ручное выполнение вместо работы с данными.

Сравнение пользователей: Claude и Gemini для разработки приложений под Android
Разработчик протестировал как Claude, так и Gemini для создания приложения-контроллера игр на внешнем экране Samsung Fold. Claude предоставил рабочие альтернативы, полную zip-папку для Android Studio и прозрачные объяснения, в то время как Gemini выдал нерабочий код, предлагал нерелевантные видео и требовал ручного создания файлов.

SkiTomorrow.ai: Движок для принятия решений о горнолыжных поездках, созданный с помощью Claude Code
SkiTomorrow.ai — это бесплатный веб-инструмент, который оценивает 234 горнолыжных курорта по всему миру на основе актуальных прогнозов снега, расстояния до них и стоимости, а затем предоставляет персонализированные рейтинги. Разработчик создал его полностью с помощью Claude Code и поделился конкретными инсайтами о рабочем процессе.

Создание агентной исследовательской системы с помощью Claude Code: практическая реализация
Разработчик рассказывает, как с помощью Claude Code создал шесть специализированных агентов для построения живой карты из более чем 250 реальных внедрений ИИ, используя паттерн оркестрации с участием человека.