Автоисследование с Claude Code в рабочей кодовой базе: 60 экспериментов, 3 изменения сохранены

Эксперимент по автоисследованию на рабочей кодовой базе
Разработчик протестировал подход автоисследования Карпати на реальной производственной системе с использованием Claude Code, запустив 60 итераций в двух раундах, находясь вдали от компьютера. Целью была гибридная поисковая система, построенная на Django, pgvector и Cohere embeddings.
Ключевые результаты и выводы
Из 60 итераций только 3 изменения были сохранены, а 57 — отменены. Общее улучшение оценки было незначительным (+0,03), но полученные знания оказались важными:
- Сопоставление заголовков как сигнал поиска оказалось отрицательным, что было продемонстрировано всего за 2 итерации
- Увеличение пула кандидатов не дало эффекта — проблема была в ранжировании, а не в полноте охвата
- Ручная адаптивная взвешивание действительно работало — её удаление привело к ухудшениям
- Корректировка формул демпфирования ключевых слов почти не влияла на оценки
- Раунд 2, нацеленный на метаданные Haiku, не дал улучшений, потому что веса ранжирования из Раунда 1 были совместно оптимизированы под вывод исходного промпта
- Обнаружена ошибка кэширования Redis: ключи были привязаны к хэшу запроса, а не к хэшу промпта, что могло остаться незамеченным в продакшене
Практические выводы
Главное понимание заключалось в том, что автоисследование помогает определить, где находится потолок, а не просто найти улучшения. Наличие 60 точек данных, говорящих «Вы можете прекратить настройку этого», дает конкретные доказательства вместо интуиции. Разработчик отмечает, что этот подход сэкономил время на ручные эксперименты с оптимизациями, которые не окупились бы.
Полный отчёт доступен по ссылке на блог, а открытый навык автоисследования Claude Code — на GitHub. Разработчик интересуется, пробовал ли кто-то это на немаркетинговых кодовых базах и какие метрики они используют.
📖 Read the full source: r/ClaudeAI
👀 Смотрите также
OpenClaw Agent сломался на 65% контекста: 683k токенов, ноль чтений кэша на Ollama/GLM
23-часовой прогон агента OpenClaw в Discord на GLM 5.3 Flash через Ollama Cloud сломался на 683 тыс. токенов — 65% от настроенного окна в 1 млн — без ошибки переполнения, без таймаута и с cacheRead=0 на каждом затронутом ходу.

Конвейер агента OpenClaw, использованный для написания и публикации трех романов с ИИ за неделю.
Разработчик использовал OpenClaw для создания четырёх-агентного рабочего процесса, который написал, отредактировал и опубликовал три полноценных романа на Amazon KDP за семь дней. Конвейер включал специализированных агентов для написания, редактирования, маркетинга и оркестрации.

Агент ИИ, управляющий полным циклом электронной коммерции: внутренний отчет
Искусственный интеллект ведет полноценный бизнес в сфере электронной коммерции, занимаясь дизайном, программированием, маркетингом и операционной деятельностью. Источник дает честную оценку, включая то, что не работает.

Автономный агент OpenClaw ведет круглосуточную холодную рассылку с использованием API-ключей
Разработчик предоставил агенту OpenClaw полный доступ на чтение и запись для проведения холодных рассылок в течение 24 часов без вмешательства человека. В настройке использовались OpenClaw для автономного анализа, Zapier MCP для интеграций, Brave Search API для исследований и Gemini/OpenRouter для работы с большими контекстами.