Автоисследование с Claude Code в рабочей кодовой базе: 60 экспериментов, 3 изменения сохранены

✍️ OpenClawRadar📅 Опубликовано: 24 марта 2026 г.🔗 Source
Автоисследование с Claude Code в рабочей кодовой базе: 60 экспериментов, 3 изменения сохранены
Ad

Эксперимент по автоисследованию на рабочей кодовой базе

Разработчик протестировал подход автоисследования Карпати на реальной производственной системе с использованием Claude Code, запустив 60 итераций в двух раундах, находясь вдали от компьютера. Целью была гибридная поисковая система, построенная на Django, pgvector и Cohere embeddings.

Ключевые результаты и выводы

Из 60 итераций только 3 изменения были сохранены, а 57 — отменены. Общее улучшение оценки было незначительным (+0,03), но полученные знания оказались важными:

  • Сопоставление заголовков как сигнал поиска оказалось отрицательным, что было продемонстрировано всего за 2 итерации
  • Увеличение пула кандидатов не дало эффекта — проблема была в ранжировании, а не в полноте охвата
  • Ручная адаптивная взвешивание действительно работало — её удаление привело к ухудшениям
  • Корректировка формул демпфирования ключевых слов почти не влияла на оценки
  • Раунд 2, нацеленный на метаданные Haiku, не дал улучшений, потому что веса ранжирования из Раунда 1 были совместно оптимизированы под вывод исходного промпта
  • Обнаружена ошибка кэширования Redis: ключи были привязаны к хэшу запроса, а не к хэшу промпта, что могло остаться незамеченным в продакшене
Ad

Практические выводы

Главное понимание заключалось в том, что автоисследование помогает определить, где находится потолок, а не просто найти улучшения. Наличие 60 точек данных, говорящих «Вы можете прекратить настройку этого», дает конкретные доказательства вместо интуиции. Разработчик отмечает, что этот подход сэкономил время на ручные эксперименты с оптимизациями, которые не окупились бы.

Полный отчёт доступен по ссылке на блог, а открытый навык автоисследования Claude Code — на GitHub. Разработчик интересуется, пробовал ли кто-то это на немаркетинговых кодовых базах и какие метрики они используют.

📖 Read the full source: r/ClaudeAI

Ad

👀 Смотрите также

🦀
Кейсы

OpenClaw Agent сломался на 65% контекста: 683k токенов, ноль чтений кэша на Ollama/GLM

23-часовой прогон агента OpenClaw в Discord на GLM 5.3 Flash через Ollama Cloud сломался на 683 тыс. токенов — 65% от настроенного окна в 1 млн — без ошибки переполнения, без таймаута и с cacheRead=0 на каждом затронутом ходу.

OpenClawRadar
Конвейер агента OpenClaw, использованный для написания и публикации трех романов с ИИ за неделю.
Кейсы

Конвейер агента OpenClaw, использованный для написания и публикации трех романов с ИИ за неделю.

Разработчик использовал OpenClaw для создания четырёх-агентного рабочего процесса, который написал, отредактировал и опубликовал три полноценных романа на Amazon KDP за семь дней. Конвейер включал специализированных агентов для написания, редактирования, маркетинга и оркестрации.

OpenClawRadar
Агент ИИ, управляющий полным циклом электронной коммерции: внутренний отчет
Кейсы

Агент ИИ, управляющий полным циклом электронной коммерции: внутренний отчет

Искусственный интеллект ведет полноценный бизнес в сфере электронной коммерции, занимаясь дизайном, программированием, маркетингом и операционной деятельностью. Источник дает честную оценку, включая то, что не работает.

OpenClawRadar
Автономный агент OpenClaw ведет круглосуточную холодную рассылку с использованием API-ключей
Кейсы

Автономный агент OpenClaw ведет круглосуточную холодную рассылку с использованием API-ключей

Разработчик предоставил агенту OpenClaw полный доступ на чтение и запись для проведения холодных рассылок в течение 24 часов без вмешательства человека. В настройке использовались OpenClaw для автономного анализа, Zapier MCP для интеграций, Brave Search API для исследований и Gemini/OpenRouter для работы с большими контекстами.

OpenClawRadar