Запуск Google Gemma 4 26B-A4B локально с помощью LM Studio 0.4.0 в режиме командной строки (Headless CLI)

✍️ OpenClawRadar📅 Опубликовано: 15 апреля 2026 г.🔗 Source
Запуск Google Gemma 4 26B-A4B локально с помощью LM Studio 0.4.0 в режиме командной строки (Headless CLI)
Ad

Что добавляет LM Studio 0.4.0 для локального ИИ

LM Studio 0.4.0 кардинально меняет архитектуру, выделяя основной механизм вывода в llmster — автономный сервер. Это позволяет полностью запускать LM Studio из командной строки с помощью нового интерфейса lms, устраняя необходимость в графическом интерфейсе. Обновление делает его пригодным для использования на серверах без графического интерфейса, в CI/CD-пайплайнах, SSH-сессиях или для разработчиков, ориентированных на терминал.

Ключевые возможности в версии 0.4.0

  • Демон llmster: Фоновая служба, управляющая загрузкой моделей и выводом без настольного приложения
  • Интерфейс командной строки lms: Полноценный интерфейс командной строки для загрузки, запуска, общения и обслуживания моделей
  • Параллельная обработка запросов: Непрерывное пакетирование вместо последовательной очереди, позволяющее одновременно обрабатывать несколько запросов к одной модели
  • Сохраняющий состояние REST API: Новый эндпоинт /v1/chat, сохраняющий историю диалога между запросами
  • Интеграция MCP: Поддержка локального протокола контекста моделей с управлением доступом по ключам разрешений
Ad

Почему Gemma 4 26B-A4B подходит для локального использования

Google Gemma 4 26B-A4B использует архитектуру смеси экспертов со 128 экспертами плюс 1 общим экспертом, но активирует только 8 экспертов (3,8 млрд параметров) на каждый токен. Это означает, что она хорошо работает на оборудовании, которое не справилось бы с плотной 26-миллиардной моделью. На 14-дюймовом MacBook Pro M4 Pro с 48 ГБ унифицированной памяти она комфортно размещается и генерирует 51 токен/сек.

Модель набирает 82,6% на MMLU Pro и 88,3% на AIME 2026, что близко к плотному 31-миллиардному варианту (85,2% и 89,2%), при этом работает значительно быстрее. Она достигает рейтинга Эло ~1441, конкурируя с такими моделями, как Qwen 3.5 397B-A17B (~1450 Эло), которые требуют 100-600 млрд общих параметров.

Ключевые возможности включают максимальный контекст 256K, поддержку зрения для анализа скриншотов и диаграмм, встроенный вызов функций/инструментов и рассуждения с настраиваемыми режимами мышления.

Практическая настройка

В статье подробно описывается установка интерфейса командной строки lms и настройка Gemma 4 26B-A4B для локального вывода, который можно использовать с Claude Code. Автор отмечает значительное замедление при использовании внутри Claude Code по своему опыту.

📖 Read the full source: HN AI Agents

Ad

👀 Смотрите также

Rift CLI: Управление рабочими деревьями Git для параллельных рабочих процессов AI-агентов
Инструменты

Rift CLI: Управление рабочими деревьями Git для параллельных рабочих процессов AI-агентов

Rift — это инструмент командной строки, который создает изолированные рабочие деревья Git и ветки для одновременного запуска нескольких ИИ-агентов для программирования, таких как Claude Code, в одном репозитории. Он включает хуки жизненного цикла, детерминированное сопоставление портов и поддержку рабочего пространства для нескольких редакторов.

OpenClawRadar
ClawControl v1.7.1 исправляет проблемы ежедневного использования в клиенте OpenClaw.
Инструменты

ClawControl v1.7.1 исправляет проблемы ежедневного использования в клиенте OpenClaw.

ClawControl v1.7.1 — это клиент с открытым исходным кодом для OpenClaw, доступный на Windows, Mac, Linux, iOS и Android. Этот выпуск сосредоточен на исправлении проблем типа «почему оно так делает?», с которыми сталкиваются при ежедневном использовании OpenClaw.

OpenClawRadar
Панель управления кода Клода отслеживает более 19 миллионов AI-сгенерированных коммитов на GitHub
Инструменты

Панель управления кода Клода отслеживает более 19 миллионов AI-сгенерированных коммитов на GitHub

Разработчик создал дашборд, отслеживающий более 19 миллионов коммитов, сгенерированных Claude Code в публичных репозиториях GitHub, где TypeScript (35,3%), Python (19,2%) и JavaScript (10,3%) являются самыми популярными языками. Система использует Next.js с Recharts и PostgreSQL, а также ETL-пайплайн, который обходит ограничения по частоте запросов API GitHub.

OpenClawRadar
Анализ Codeflash: 118 проблем с производительностью обнаружено в двух Pull Request'ах, написанных с помощью Claude Code
Инструменты

Анализ Codeflash: 118 проблем с производительностью обнаружено в двух Pull Request'ах, написанных с помощью Claude Code

Codeflash измерил производительность двух основных функций, созданных с помощью Claude Code, и обнаружил 118 функций, работающих до 446 раз медленнее, чем необходимо. Анализ выявил шаблоны неэффективных алгоритмов, избыточных вычислений, отсутствия кэширования и неоптимальных структур данных.

OpenClawRadar