Разработчик делится гибридным рабочим процессом в AI-кодинге: Claude для планирования, локальные модели для выполнения.

Гибридный рабочий процесс ИИ-кодирования снижает облачные расходы
Разработчик на r/LocalLLaMA поделился подробным рабочим процессом, который сочетает облачные и локальные модели ИИ для снижения стоимости токенов при сохранении качества кода. Этот подход решает проблему осознания того, что многие задачи по кодированию не требуют дорогих облачных моделей.
Архитектура рабочего процесса
Система следует логике «Рассуждай в облаке, выполняй локально»:
- Планировщик (Claude 3.5 Sonnet): Получает задачу и генерирует точный файл
task_context.md, содержащий инструкции, пути к файлам и логику. Это стоит примерно 300–500 токенов. - Кодер (Локальный Qwen2.5-Coder 30B через Ollama): Принимает спецификацию и фактическое содержимое файла для написания кода. Работает локально с нулевой стоимостью.
- Валидатор: Простой Bash-скрипт запускает
tsc --noEmitилиmypyдля проверки типов. - Рецензент (Локальный Qwen2.5-Coder 7B): Работает параллельно, чтобы проверить на наличие очевидных логических ошибок.
- Автоисправление: Если сборка не удалась, журнал ошибок возвращается локальному кодеру на 2–3 итерации.
Детали реализации
Весь конвейер обёрнут в набор Bash-скриптов, использующих только jq и curl для связи с API Ollama. Система автоматически определяет языковые стандарты (TypeScript, Python, C++ и т.д.) на основе вывода планировщика и не требует тяжёлых сред выполнения Python/Node.
Разработчик отмечает, что локальные модели (даже 30B) часто не справляются со сложными архитектурными рассуждениями, но удивительно хорошо выполняют задачи, когда им дают кристально ясные спецификации.
Результаты и экономия
В недавнем проекте на TypeScript с изменением 12 файлов:
- Использование Claude было ограничено только начальной фазой планирования
- Локальные модели обработали всё остальное: написание 12 файлов, линтинг и рецензирование
- Общая экономия: примерно 85% сокращение токенов по сравнению с выполнением всего внутри Claude Code CLI
Разработчик сделал скрипты доступными в репозитории под названием ai-orchestrator на GitHub (имя пользователя: Mybono) для тех, кто интересуется деталями реализации.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

TRELLIS.2 Image-to-3D адаптирован для нативной работы на Apple Silicon.
Разработчик портировал 4-миллиардную параметрическую модель TRELLIS.2 от Microsoft для преобразования изображений в 3D, чтобы она работала нативно на Apple Silicon через PyTorch MPS, заменив операции, специфичные для CUDA, на чисто PyTorch-альтернативы. Порт генерирует меши с ~400K вершин из одиночных фотографий примерно за 3,5 минуты на M4 Pro с 24 ГБ памяти.

agentcache: Библиотека Python для кэширования префиксов в мультиагентных LLM
agentcache — это библиотека Python, которая позволяет многозадачным LLM-фреймворкам совместно использовать кэшированные префиксы промптов, достигая до 76% попаданий в кэш и сокращая время вывода более чем вдвое в тестах с GPT-4o-mini.

Сравнение 8 моделей ИИ для программирования на примере реализации реальной функции на TypeScript
Разработчик протестировал 8 моделей ИИ для программирования на задаче реализации команды /rename в проекте Telegram-бота на TypeScript с открытым исходным кодом, оценивая их по стоимости, времени выполнения, корректности и техническому качеству. GPT-5.4 показал наивысший результат по корректности реализации, а GLM 5 предложил наилучшее соотношение цены и производительности.

Открытый SDK для AI-работы с знаниями
ClioAI выпустил <strong>kw-sdk</strong>, открытый набор инструментов для разработки программного обеспечения, предназначенный для структурирования работы ИИ-агентов в областях знаний, таких как исследование, анализ, стратегия и написание текстов. В отличие от традиционных кодовых фреймворков, которые имеют естественные сигналы верификации через тестирование, работа с знаниями требует структурированных подходов для проверки и оценки задач.