Руководство: Запуск GitHub Copilot с локальной LLM на Windows через сервер Lemonade

Разработчик опубликовал пошаговое руководство по настройке GitHub Copilot для использования локальной большой языковой модели (LLM) на компьютере с Windows, в частности на Framework Desktop. Это руководство было создано потому, что автор не смог найти существующих простых инструкций для такой настройки.
Основной метод заключается в использовании Lemonade Server — инструмента, который выступает в роли локального прокси-сервера. Он перехватывает запросы от расширения GitHub Copilot в вашем редакторе кода (например, VS Code) и перенаправляет их на локально запущенную LLM вместо отправки на облачные серверы GitHub. Это позволяет получать приватные автономные подсказки по коду без зависимости от внешних API.
Такая настройка актуальна для разработчиков, которые хотят использовать функцию автодополнения GitHub Copilot, но требуют конфиденциальности, имеют опасения по поводу безопасности данных, хотят избежать расходов на API или предпочитают использовать определённую модель с открытым исходным кодом, которую они сами дообучили. Локальная LLM должна быть установлена и запущена отдельно, например, с помощью таких инструментов, как Ollama, LM Studio или text-generation-webui.
В исходном посте на Reddit есть ссылка на полное подробное руководство на личном сайте автора.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

Анализ паттернов производственной инженерии Claude Code на основе реверс-инжиниринга исходного кода
Разработчик провёл обратную инженерию примерно 500 000 строк исходного кода Claude Code на TypeScript, превратив их в техническое руководство из 19 глав, которое документирует паттерны продакшн-инженерии, возникающие под реальной нагрузкой, с реальными деньгами и реальными противниками.

5 распространенных ошибок настройки OpenClaw и как их исправить
Практические решения пяти самых распространенных ошибок при настройке OpenClaw: отсутствие постоянной памяти, отсутствие исходящего доступа, перегруженный системный промпт, отсутствие поведения при ошибке и использование только одной модели.

Qwen3.5-397B MoE работает на 14 ГБ ОЗУ с помощью постраничной загрузки экспертов на M1 Ultra
Движок Paged MoE держит в памяти только 20 экспертов, а остальные подгружает с SSD, запуская модель 397B размером 209GB на Mac Studio с 64GB памяти, достигая 1,59 ток/с и пикового использования RAM 14GB. Включает бенчмарки меньших моделей.

Исправление замедления OpenClaw в длительных сессиях: contextInjection continuation-skip для кэша llama.cpp
Реальное исправление для OpenClaw, которое со временем замедляется: установите contextInjection в continuation-skip, чтобы сохранить кэш промптов llama.cpp и сократить оценку промпта с 130 с до 1,3 с.