O OmniCoder-9B ajustado demonstra um desempenho robusto para codificação autônoma em sistemas com 8GB de VRAM.

Resultados de desempenho do teste do OmniCoder-9B com OpenCode
Um usuário no r/LocalLLaMA relatou testar o OmniCoder-9B, um ajuste fino do Qwen3.5-9B treinado em traços do Opus, e descobriu que ele teve um bom desempenho em tarefas de codificação agentica em sistemas com VRAM limitada. O modelo está disponível no Hugging Face em Tesslate/OmniCoder-9B.
Configuração e configuração técnica
O usuário executou a quantização Q4_K_M GGUF usando ik_llama com o seguinte comando:
ik_llama.cpp\build\bin\Release\llama-server.exe -m models/Tesslate/OmniCoder-9B-GGUF/omnicoder-9b-q4_k_m.gguf -ngl 999 -fa 1 -b 2048 -ub 512 -t 8 -c 100000 -ctk f16 -ctv q4_0 --temp 0.4 --top-p 0.95 --top-k 20 --presence-penalty 0.0 --jinja --ctx-checkpoints 0
Eles alcançaram aproximadamente 40 tokens por segundo com essa configuração. O usuário observou que a quantização Q5_KS com comprimento de contexto de 64.000 oferece velocidades semelhantes.
Configuração do OpenCode
A configuração do OpenCode usada para o teste:
"local": { "models": { "/models/Tesslate/OmniCoder-9B-GGUF/omnicoder-9b-q4_k_m.gguf": { "interleaved": { "field": "reasoning_content" }, "limit": { "context": 100000, "output": 32000 }, "name": "omnicoder-9b-q4_k_m", "reasoning": true, "temperature": true, "tool_call": true } }, "npm": "@ai-sdk/openai-compatible", "options": { "baseURL": "http://localhost:8080/v1" } }O usuário mencionou um possível bug que causa o reprocessamento completo do prompt, que eles estão investigando.
Contexto e comparação
O teste foi motivado por preocupações com restrições de cota e mudanças de preços em ferramentas comerciais de IA para codificação. O usuário mencionou especificamente ter 8GB de VRAM, o que normalmente limita a capacidade de executar modelos de código aberto capazes em boas velocidades para codificação agentica. Eles observaram que, embora os modelos MOE possam oferecer melhor desempenho, suas velocidades são significativamente mais lentas.
📖 Read the full source: r/LocalLLaMA
👀 See Also

Desenvolvedor Cria Servidor MCP do Power Automate com 108 Ferramentas e Suporte Multiplataforma
Um desenvolvedor criou um servidor MCP do Power Automate que se expandiu de 12 para 108 ferramentas, abrangendo operações CRUD do Dataverse via OData, gerenciamento do SharePoint via Graph, controle de versão do Power Apps, administração de ambientes e suporte multiplataforma para Windows, macOS e Linux.

Executando Qwen3.6-35B-A3B-UD-Q5_K_XL localmente com VS Code Copilot no AMD R9700
Um usuário compartilha sua configuração funcional do llama.cpp para Qwen3.6-35B-A3B-UD-Q5_K_XL em uma única AMD R9700 com Vulkan, alcançando geração completa de site e testes Playwright do zero com mínima intervenção.

Agente de IA de Desktop Skales Desenvolvido com Claude, Apresenta Mascote no Estilo Clippy
Skales é um agente de IA para desktop que roda localmente no Windows e macOS, usando o Claude via API OpenRouter/Anthropic para raciocínio e execução de ferramentas. Ele inclui um mascote Desktop Buddy flutuante com uma referência de skin de clipe de papel e pode executar comandos como enviar e-mails, gerenciar arquivos, navegar na web e gerenciar calendários.

Mentor de Carreira Multiagente Desenvolvido com Ollama e MCP para IA Local
Um desenvolvedor criou um sistema de IA com 5 agentes que analisa currículos e gera relatórios de inteligência de carreira usando Ollama com llama3 localmente. O sistema encadeia as saídas dos agentes para que cada um construa sobre o contexto anterior, com MCP lidando com a integração de ferramentas.