Валидация паттерна саморазвивающихся навыков: результаты 5-раундового эксперимента

Экспериментальная установка и результаты
Разработчик провёл 5-раундный эксперимент для проверки шаблона проектирования Self-Evolving Skill для Claude Code, который был представлен ранее. Эксперимент использовал базу данных MySQL с 29 таблицами и 590 МБ данных из системы управления умным зданием.
Раунды следовали такой прогрессии: исследование структуры → запросы данных → обнаружение правил → сложное исследование → повторная проверка.
Ключевые выводы
- Уровень отклонения Five-Gate: 63,6% — большинство взаимодействий не привело к изменению знаний
- Инкрементальная сходимость: +75 → +46 → +12 → +21 → +1
- Самоисправление Gate 2: Шаблон обнаружил и исправил 2 ошибочных правила, которые Skill записал в предыдущих раундах
- Раунд 5: Ноль шагов исследования, прямое повторное использование шаблона
- Точность: 100% — ни одно ошибочное знание не сохранилось в процессе
Неожиданным выводом стало то, что проблемы использования инструментов были зафиксированы как ценный побочный продукт — вопросы, которые разработчик не планировал, но которые были выявлены Five Gates.
У разработчика продолжается второй эксперимент на более крупной базе данных телекоммуникационных биллингов. Полные данные с различимыми снимками по раундам доступны на GitHub.
📖 Read the full source: r/ClaudeAI
👀 Смотрите также

Spectr: MCP, который пишет спецификации приложений на основе записей экрана для пиксельно точных клонов Claude
Spectr — это MCP-сервер, CLI и навык для Claude Code, который принимает .mp4/.mov запись экрана iOS-приложения и генерирует spec.md с семью разделами: hex-коды, вес шрифта, отступы, переходы и навигационный граф — устраняя необходимость в 30-минутном ручном написании спецификации для каждого экрана.

EsoLang-Bench: Бенчмарк для программирования с использованием эзотерических языков для проверки логики языковых моделей
Исследователи создали EsoLang-Bench, кодирующий бенчмарк, использующий эзотерические языки программирования, такие как Brainfuck и Whitespace, чтобы проверить, могут ли LLM рассуждать или просто сопоставлять шаблоны. Лучший результат среди GPT-5.2, O4-mini, Gemini, Qwen и Kimi составил 11,2%.

Клодекс: Каталог для отслеживания производных проектов и форков OpenClaw
Clawdex — это каталог, в котором перечислены 18 проектов, связанных с OpenClaw, распределённых по трём уровням, с данными о звёздах, языке программирования и тегах категорий. Проект работает на основе pull request'ов: участники должны форкнуть репозиторий, добавить YAML-файл в /src/data/projects/ и открыть pull request.

motif MCP предоставляет Claude Code возможность просмотра видео для воспроизведения ошибок интерфейса
motif — это MCP-сервер, который позволяет Claude Code просматривать записи экрана с UI-багами, используя покадровый анализ Gemini 2.5 Flash для возврата визуальных описаний, первопричин и диффов. Для настройки нужен ключ Gemini API и две строки в mcp.json.