Пи-кодирующий агент с Qwen 35B Q2: Использование файловой системы как внешней памяти и обеспечение контекстных ограничений

Пользователь Reddit поделился своим подходом к агентному кодингу с локальными LLM, построенным на Pi coding agent с Qwen 35B (квант Q2_K_XL через LM Studio). Ключевая идея: рассматривать LLM как процессор логики, а не как базу данных контекста. Реализация применяет строгие ограничения на уровне API — модель не может их обойти.
Ключевые ограничения, налагаемые системой
- Лимит записи/редактирования: Отклоняет любой вывод длиннее 100 строк. Модель должна сначала написать скелет, затем заполнять по одному разделу за раз. Если она пытается выгрузить полный файл, вызов блокируется с инструкцией разделить работу.
- Лимит блока размышлений: Если рассуждения модели превышают 2000 символов, она получает корректировку — записать выводы на диск и двигаться дальше.
- Мониторинг контекста: При 65% использования контекста модели предписывается записать своё состояние в файлы. При 80% всё останавливается — модель записывает свой 'мозг' на диск, пока ещё связно.
- Постоянный вывод: Если модель даёт длинный ответ без записи файла, ей поручается сохранить результаты в файл шага. Ничто не остаётся только в контексте.
Структура внешней памяти
Система использует каталоги .think/ и .plan/ как внешнюю память модели. Каждый шаг, решение и вывод записываются в файл. При сжатии контекста модель читает свои собственные заметки. Цель сессии сохраняется отдельно в _purpose.md и повторно внедряется после сжатия контекста, сохраняя изначальную задачу.
Дистилляция знаний
Команда /distill обходит кодовую базу, строит граф импорта, топологически сортирует файлы и заставляет модель резюмировать их по одному за раз в базу знаний. Манифест разбивается на страницы по 50 файлов, чтобы не расходовать весь контекст. Пользователи могут помещать файлы вроде svelte5-gotchas.md или astro-gotchas.md в папку знаний; отдельный вызов LLM выбирает, какие из них релевантны текущей задаче, и только их содержимое внедряется в основной разговор.
Реальный результат
Пользователь попросил модель создать игру-симулятор полёта на Three.js. Первая попытка выдать 652 строки за один вызов была отклонена защитой. Модель перепланировала, написала скелет, а затем заполняла функции по одной правке за раз. Итогом стала рабочая игра с 3D-моделью самолёта, препятствиями, HUD, миникартой и экранами начала/конца игры — всё на Q2 кванте.
Полная настройка работает на квантовании Q2_K_XL как минимальном; пользователь отмечает, что Q4 или Q8 должны дать лучшие результаты. Код доступен на GitHub: github.com/Kodrack/Pi-forge.
📖 Читать полный источник: r/LocalLLaMA
👀 Смотрите также

Термрендер: 6-кратно эффективная по токенам ASCII-визуализация интерфейса для Claude
Termrender — это инструмент с открытым исходным кодом на Python, который генерирует ASCII-визуализации интерфейсов с эффективностью использования токенов в 6 раз выше по сравнению с исходным выводом Claude. Он создаёт диаграммы и панели, используя минимальное количество токенов для более быстрой генерации и редактирования.

Memento v1.0: Локальная постоянная память для AI-агентов программирования
Memento v1.0 — это полностью локальный слой памяти для AI-агентов программирования, который запускает эмбеддинги, хранение и поиск на вашем компьютере без зависимостей от облачных сервисов. Использует эмбеддинги all-MiniLM-L6-v2, индексацию HNSW и поддерживает несколько IDE с 17 инструментами MCP.

Фреймворк с открытым исходным кодом для мультиагентных систем, извлечённый из утечки кода Claude.
Разработчик извлек систему оркестрации мультиагентов из утекшего исходного кода Claude Code и перестроил ее в модель-независимый фреймворк с открытым исходным кодом под лицензией MIT. Фреймворк на TypeScript объемом 8 000 строк включает планирование задач, меж-агентное взаимодействие и встроенные инструменты.

W2A — открытый протокол для агентских сенсоров: предоставление локальным агентам восприятия в реальном времени
W2A (World2Agent) — это открытый протокол, стандартизирующий уровень восприятия для AI-агентов: возможность самостоятельного хостинга, TS SDK, лицензия Apache 2.0. Он позволяет агентам получать сигналы от датчиков в реальном времени без одноразовых скриптов.