OmniCoder-9B демонстрирует высокую производительность для агентного кодирования на системах с 8 ГБ видеопамяти.

Результаты тестирования производительности OmniCoder-9B с OpenCode
Пользователь на r/LocalLLaMA сообщил о тестировании OmniCoder-9B, дообученной версии Qwen3.5-9B, обученной на трейсах Opus, и обнаружил, что она хорошо справляется с агентными задачами программирования на системах с ограниченным объёмом видеопамяти. Модель доступна на Hugging Face по адресу Tesslate/OmniCoder-9B.
Техническая настройка и конфигурация
Пользователь запустил квантование Q4_K_M GGUF с помощью ik_llama следующей командой:
ik_llama.cpp\build\bin\Release\llama-server.exe -m models/Tesslate/OmniCoder-9B-GGUF/omnicoder-9b-q4_k_m.gguf -ngl 999 -fa 1 -b 2048 -ub 512 -t 8 -c 100000 -ctk f16 -ctv q4_0 --temp 0.4 --top-p 0.95 --top-k 20 --presence-penalty 0.0 --jinja --ctx-checkpoints 0
С такой конфигурацией была достигнута скорость примерно 40 токенов в секунду. Пользователь отметил, что квантование Q5_KS с длиной контекста 64 000 обеспечивает схожую скорость.
Конфигурация OpenCode
Конфигурация OpenCode, использованная для тестирования:
"local": { "models": { "/models/Tesslate/OmniCoder-9B-GGUF/omnicoder-9b-q4_k_m.gguf": { "interleaved": { "field": "reasoning_content" }, "limit": { "context": 100000, "output": 32000 }, "name": "omnicoder-9b-q4_k_m", "reasoning": true, "temperature": true, "tool_call": true } }, "npm": "@ai-sdk/openai-compatible", "options": { "baseURL": "http://localhost:8080/v1" } }Пользователь упомянул о возможной ошибке, вызывающей полную переобработку промпта, которую он исследует.
Контекст и сравнение
Тестирование было мотивировано опасениями по поводу ограничений квот и изменений цен в коммерческих инструментах ИИ для программирования. Пользователь конкретно упомянул наличие 8 ГБ видеопамяти, что обычно ограничивает возможность запуска производительных моделей с открытым исходным кодом на хорошей скорости для агентного программирования. Он отметил, что хотя MOE-модели могут предлагать лучшую производительность, их скорость значительно ниже.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

Подход к самоулучшению памяти в локальных ИИ-агентах
Разработчик делится своим подходом к постоянной памяти для локальных ИИ-агентов, используя файлы markdown в качестве источника истины, оценку эпизодов на основе правил уверенности и эскалацию доверия на основе паттернов одобрения.

JavaClaw Beta: Java-ориентированный ИИ-ассистент, созданный на основе Spring AI и JobRunr
Команда JobRunr выпустила бета-версию JavaClaw — Java-версию OpenClaw, которая работает локально с поддержкой многоканальности, выбором LLM и фоновой обработкой задач через JobRunr. Построена на Spring Boot 4, Spring AI и Spring Modulith.

Hermes Agent v0.6.0 предлагает улучшенную поддержку локальных моделей с парсерами вызовов инструментов для каждой модели.
Hermes Agent v0.6.0 от Nous Research предоставляет парсеры вызовов инструментов для каждой модели, которые корректно обрабатывают вызовы инструментов на моделях класса 30B, поддерживает Ollama, vLLM и sglang из коробки, а также включает шесть серверных терминалов, включая Modal и Daytona для бессерверного развертывания.

n8n-mcp-lite: Сервер MCP сокращает использование токенов на 80% для Claude при работе с n8n-воркфлоу
Новый сервер Model Context Protocol с открытым исходным кодом под названием n8n-mcp-lite помогает Клоду анализировать рабочие процессы автоматизации n8n, сокращая использование токенов примерно на 80%. Инструмент решает проблему высокой токенной нагрузки визуальных нод-автоматизаций, предоставляя целевое сканирование рабочих процессов и точечные обновления.