Найти цепь LLM: Дублируйте 3 слоя для улучшения логики без обучения

Инструментарий llm-circuit-finder реализует и расширяет метод RYS Дэвида Нга для обнаружения и использования 'рассуждающих цепей', скрытых внутри трансформерных моделей. Ключевое открытие: определённые непрерывные блоки слоёв действуют как неделимые когнитивные единицы. Их дублирование в прямом проходе — те же веса, без обучения, без слияния — делает модели измеримо умнее в определённых способностях.
Ключевые результаты
Devstral-Small-2-24B с однократным дублированием слоёв 12, 13, 14:
- BBH Логический вывод: 0,22 → 0,76 (+245%)
- GSM8K (строгий): 0,48 → 0,64 (+33%)
- MBPP (генерация кода): 0,72 → 0,78 (+8%)
- Среднее улучшение: +8% по всем метрикам без ухудшения
Qwen2.5-Coder-32B с однократным дублированием слоёв 7, 8, 9:
- Тест на рассуждение (причинность + логика + навигация): 76,5% → 94,1% (+23%)
Как это работает
Трансформеры организуются во время обучения в функциональные цепи — многослойные обрабатывающие единицы, выполняющие полные когнитивные операции. Эти цепи неделимы: дублирование одного слоя почти ничего не даёт, но дублирование правильного блока из 3-4 слоёв даёт модели второй проход через её конвейер рассуждений.
У разных моделей цепи находятся в разных местах:
- Devstral-24B (40 слоёв): рассуждающая цепь на слоях 12-14
- Qwen2.5-32B (64 слоёв): рассуждающая цепь на слоях 7-9
Границы чёткие. Сдвиньте блок на один слой в любом направлении, и улучшение исчезнет или обратится вспять.
Разные схемы дублирования создают разные режимы
Те же веса на диске, та же VRAM для базовой модели, просто разная маршрутизация:
- Двойной проход 13-16: Математика ↑↑, EQ ↑
- Тройной проход 13-16: Математика ↑, EQ ↑↑
- Чередование 13,13,14,14,15,15,16: Математика ↑↑↑, EQ ↓ (чистый математический режим)
- Четверной проход 13-16: Математика —, EQ ↑↑ (режим EQ, математика нейтральна)
Быстрый старт
Найдите цепи в вашей модели:
pip install gguf requests tqdm
python sweep.py \
--model /path/to/model.gguf \
--llama-server /path/to/llama-server \
--tmpdir /dev/shm/rys \
--results pass.jsonl \
--block-sizes 3 4 5 \
--stride 1 \
--start-min 10 --start-max 20 \
--skip-baseline \
--port 8099 \
--server-args --device Vulkan1,Vulkan2
Примените известную цепь:
# Дублирование слоёв 12-14 в Devstral
python layer_path.py model.gguf improved.gguf \
-p " 0..14,12,13,14,15..39 " -v
Дублирование слоёв 7-9 в Qwen2.5-32B
python layer_path.py model.gguf improved.gguf
-p " 0..9,7,8,9,10..63 " -v
Пример тройного прохода
python layer_path.py model.gguf experiment.gguf
-p " 0..16,13,14,15,16,13,14,15,16,17..39 " -v
Проверьте с помощью установленных тестов:
# Запустите сервер с изменённой моделью
llama-server -m improved.gguf --port 8089 -ngl 99 --device Vulkan1,Vulkan2
# Запустите lm-evaluation-harness
Весь процесс обнаружения — сканирование, открытие, проверка — был выполнен на двух потребительских GPU AMD (RX 7900 XT + RX 6950 XT) за один вечер.
📖 Read the full source: HN LLM Tools
👀 Смотрите также

Пользователь Reddit экспериментирует с агентами программирования, обучающимися на ошибках, чтобы прервать циклы повторных попыток.
Разработчик на r/LocalLLaMA описывает эксперименты с кодирующими агентами, которые учатся на ошибках, сохраняя упрощённые корневые причины и сопоставляя исправления, сокращая повторяющиеся циклы ошибок.

Разработчик создает ИИ-фреймворк с 17 биологическими принципами, используя Claude Code.
Разработчик создал AI-фреймворк под названием Cognitive Sparks, реализовав 17 биологических принципов, таких как пороговое срабатывание и геббовская пластичность, на основе книги 1999 года 'Sparks of Genius'. Весь проект — 22 документа по дизайну и 3300 строк кода — был создан за один день с помощью Claude Code, без кода, написанного человеком.

Ежемесячный план Alibaba стоимостью $10 предоставляет пользователям OpenClaw расширенный доступ к множеству ИИ-моделей.
За 10 долларов в месяц план от Alibaba предоставляет доступ к моделям Qwen3.5-Plus, Kimi-K2.5, GLM-5 и MiniMax-M2.5 с квотами в 1200 запросов за 5 часов, 9000 в неделю и 18 000 в месяц.

Прокси-сервер ClawCut выпущен на GitHub для оптимизации OpenClaw под небольшие языковые модели.
ClawCut — это экспериментальный прокси, который манипулирует, внедряет JSON-вызовы и удаляет лишние JSON-данные из OpenClaw, чтобы снизить когнитивную нагрузку на небольшие модели (7B-8B), работающие на ограниченном оборудовании.