Использование локальной LLM в качестве суб-агента Claude для кодирования с целью сокращения использования контекста

Разработчик на r/LocalLLaMA демонстрирует, как использовать Claude Code для делегирования задач локальной LLM, работающей через LM Studio, уменьшая использование контекста Claude за счёт хранения содержимого файлов локально.
Как это работает
Система использует небольшой Python-скрипт (около 120 строк, только стандартная библиотека), который запускает цикл агента:
- Вы передаёте Claude описание задачи без содержимого файлов
- Скрипт отправляет его на конечную точку
/v1/chat/completionsLM Studio с определениями инструментовread_fileиlist_dir - Локальная модель сама вызывает эти инструменты для чтения нужных файлов
- Цикл продолжается до получения окончательного ответа
- Claude видит только результат, а не содержимое файлов
Пример использования
python3 agent_lm.py --dir /path/to/project "summarize solar-system.html"
# [turn 1] → read_file({'path': 'solar-system.html'})
# [turn 2] → Этот HTML-файл создаёт интерактивную анимированную солнечную систему...
Содержимое файла попадает в контекст локальной модели (протестировано с Qwen3.5 35B 4-bit через MLX на Apple Silicon), а не в контекст Claude.
Для чего это полезно
- Суммаризация и объяснение кода
- Поиск ошибок
- Создание шаблонов / первых набросков
- Трансформация и перевод текста (протестировано с ивритом)
- Логические задачи и рассуждения (используйте флаг
--thinkдля сложных проблем)
Для чего это не подходит
- Задачи, требующие полного контекста Claude, такие как понимание взаимосвязей между несколькими файлами
- Задачи, требующие истории текущего разговора
- Всё, где критически важна точность
Автор описывает это как "ассистента уровня хайку, а не замену".
Настройка
- LM Studio работает локально с включённым API-сервером
- Один Python-скрипт для цикла агента, один для простых запросов только с промптами
- Оба подключены к глобальному
~/.claude/CLAUDE.md, чтобы Claude Code знал, когда предлагать делегирование - Не требуется сервер MCP, зависимости pip или инфраструктура плагинов
- Рекомендация: добавьте
{%- set enable_thinking = false %}в начало шаблона jinja — для большинства задач это экономит время и токены без потери качества
Автор отмечает, что Claude помог написать пост, но под наблюдением и с исправлениями, и готов поделиться скриптами, если будет интерес.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

Система памяти с открытым исходным кодом для LLM-агентов демонстрирует высокие результаты в тестах.
Постоянная система памяти для Claude Code и OpenClaw обеспечивает LLM-агентам непрерывность контекста между сессиями, достигая 90,8% на бенчмарке LoCoMo и 89,1% на LongMemEval. Архитектура на основе адаптеров работает с любой фреймворк-системой для агентов.

Изучение sandbox-exec в macOS для безопасного выполнения приложений
sandbox-exec — это утилита командной строки в macOS, позволяющая приложениям работать в ограниченной среде. Узнайте, как ее использовать с пользовательскими профилями песочницы.

Запрос функции для Claude Desktop: Хук запуска сессии для автоматической инициализации
Разработчик, создающий системы постоянного контекста для Claude Desktop, выявляет проблему: поле "Пользовательские настройки" вводит инструкции только при отправке первого сообщения пользователем, что требует ручного запуска для инициализации. Он предлагает добавить поле "При запуске сессии", которое будет выполняться автоматически при открытии нового диалога.

Сообщение другим сессиям Claude Code: межсессионный обмен сообщениями
Claude Code v2.1.224+ позволяет Клоду отправлять сообщения между вашими сессиями, чтобы координировать параллельную работу, делиться находками и предупреждать о критических изменениях без копирования и вставки.