Использование локальной LLM в качестве суб-агента Claude для кодирования с целью сокращения использования контекста

Разработчик на r/LocalLLaMA демонстрирует, как использовать Claude Code для делегирования задач локальной LLM, работающей через LM Studio, уменьшая использование контекста Claude за счёт хранения содержимого файлов локально.
Как это работает
Система использует небольшой Python-скрипт (около 120 строк, только стандартная библиотека), который запускает цикл агента:
- Вы передаёте Claude описание задачи без содержимого файлов
- Скрипт отправляет его на конечную точку
/v1/chat/completionsLM Studio с определениями инструментовread_fileиlist_dir - Локальная модель сама вызывает эти инструменты для чтения нужных файлов
- Цикл продолжается до получения окончательного ответа
- Claude видит только результат, а не содержимое файлов
Пример использования
python3 agent_lm.py --dir /path/to/project "summarize solar-system.html"
# [turn 1] → read_file({'path': 'solar-system.html'})
# [turn 2] → Этот HTML-файл создаёт интерактивную анимированную солнечную систему...
Содержимое файла попадает в контекст локальной модели (протестировано с Qwen3.5 35B 4-bit через MLX на Apple Silicon), а не в контекст Claude.
Для чего это полезно
- Суммаризация и объяснение кода
- Поиск ошибок
- Создание шаблонов / первых набросков
- Трансформация и перевод текста (протестировано с ивритом)
- Логические задачи и рассуждения (используйте флаг
--thinkдля сложных проблем)
Для чего это не подходит
- Задачи, требующие полного контекста Claude, такие как понимание взаимосвязей между несколькими файлами
- Задачи, требующие истории текущего разговора
- Всё, где критически важна точность
Автор описывает это как "ассистента уровня хайку, а не замену".
Настройка
- LM Studio работает локально с включённым API-сервером
- Один Python-скрипт для цикла агента, один для простых запросов только с промптами
- Оба подключены к глобальному
~/.claude/CLAUDE.md, чтобы Claude Code знал, когда предлагать делегирование - Не требуется сервер MCP, зависимости pip или инфраструктура плагинов
- Рекомендация: добавьте
{%- set enable_thinking = false %}в начало шаблона jinja — для большинства задач это экономит время и токены без потери качества
Автор отмечает, что Claude помог написать пост, но под наблюдением и с исправлениями, и готов поделиться скриптами, если будет интерес.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

Сравнение четырех управляемых хостинг-провайдеров OpenClaw на 2026 год
Разработчик протестировал четыре провайдера управляемого хостинга OpenClaw в течение двух месяцев, оценив их по времени настройки, времени безотказной работы, надежности интеграций, маршрутизации моделей, стоимости и обработке многоэтапных задач. LobsterTank стоит $2/месяц с базовым контейнерным хостингом, KiwiClaw — $39/месяц с лучшей поддержкой, xCloud — $24/месяц с хорошим аптаймом, а RunLobster — $49/месяц с обширной интеграцией инструментов и фиксированной ценой.

Файловая система памяти Claude Code: Практичная альтернатива векторным базам данных
Claude Code реализует файловую систему памяти, используя файлы .md с метаданными во frontmatter и индексный файл MEMORY.md, избегая векторных баз данных и конвейеров эмбеддингов за счет сканирования файлов, создания манифестов и использования небольшой модели для выбора релевантных воспоминаний.

Система антител: внешний сторожевой таймер для агентов OpenClaw
Система Antibody — это система мониторинга с открытым исходным кодом, которая работает на отдельной машине и отслеживает агентов OpenClaw через SSH, реализуя многоуровневые реакции от обнаружения до восстановления сервиса. Она спроектирована так, чтобы переживать сбои, которые выводят из строя основного агента.

Пользовательский бэкенд llama.cpp переносит матричное умножение LLM на NPU AMD XDNA2 в процессорах Ryzen AI MAX 385
Разработчик создал пользовательский бэкенд llama.cpp, который отправляет операции GEMM напрямую на NPU AMD XDNA2 в Ryzen AI MAX 385 (Strix Halo), достигая скорости декодирования 43,7 t/s при энергопотреблении 0,947 Дж/токен с моделью Meta-Llama-3.1-8B-Instruct Q4_K_M. Путь декодирования через NPU экономит около 10 Вт по сравнению с использованием только Vulkan, при этом сохраняя ту же пропускную способность декодирования.