O OmniCoder-9B ajustado demonstra um desempenho robusto para codificação autônoma em sistemas com 8GB de VRAM.

✍️ OpenClawRadar📅 Publicado: March 13, 2026🔗 Source
O OmniCoder-9B ajustado demonstra um desempenho robusto para codificação autônoma em sistemas com 8GB de VRAM.
Ad

Resultados de desempenho do teste do OmniCoder-9B com OpenCode

Um usuário no r/LocalLLaMA relatou testar o OmniCoder-9B, um ajuste fino do Qwen3.5-9B treinado em traços do Opus, e descobriu que ele teve um bom desempenho em tarefas de codificação agentica em sistemas com VRAM limitada. O modelo está disponível no Hugging Face em Tesslate/OmniCoder-9B.

Configuração e configuração técnica

O usuário executou a quantização Q4_K_M GGUF usando ik_llama com o seguinte comando:

ik_llama.cpp\build\bin\Release\llama-server.exe -m models/Tesslate/OmniCoder-9B-GGUF/omnicoder-9b-q4_k_m.gguf -ngl 999 -fa 1 -b 2048 -ub 512 -t 8 -c 100000 -ctk f16 -ctv q4_0 --temp 0.4 --top-p 0.95 --top-k 20 --presence-penalty 0.0 --jinja --ctx-checkpoints 0

Eles alcançaram aproximadamente 40 tokens por segundo com essa configuração. O usuário observou que a quantização Q5_KS com comprimento de contexto de 64.000 oferece velocidades semelhantes.

Ad

Configuração do OpenCode

A configuração do OpenCode usada para o teste:

"local": { "models": { "/models/Tesslate/OmniCoder-9B-GGUF/omnicoder-9b-q4_k_m.gguf": { "interleaved": { "field": "reasoning_content" }, "limit": { "context": 100000, "output": 32000 }, "name": "omnicoder-9b-q4_k_m", "reasoning": true, "temperature": true, "tool_call": true } }, "npm": "@ai-sdk/openai-compatible", "options": { "baseURL": "http://localhost:8080/v1" } }

O usuário mencionou um possível bug que causa o reprocessamento completo do prompt, que eles estão investigando.

Contexto e comparação

O teste foi motivado por preocupações com restrições de cota e mudanças de preços em ferramentas comerciais de IA para codificação. O usuário mencionou especificamente ter 8GB de VRAM, o que normalmente limita a capacidade de executar modelos de código aberto capazes em boas velocidades para codificação agentica. Eles observaram que, embora os modelos MOE possam oferecer melhor desempenho, suas velocidades são significativamente mais lentas.

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

Caddie: Alternativa ao OpenClaw Baseada no Slack Será Lançada na Próxima Semana
Tools

Caddie: Alternativa ao OpenClaw Baseada no Slack Será Lançada na Próxima Semana

Caddie é uma versão baseada no Slack do OpenClaw que não requer instalação local ou configuração MCP. Os usuários autorizam através do Slack App Directory em 60 segundos, depois digitam comandos para automatizar tarefas no Gmail, LinkedIn, CRM, calendário e mais de 100 outras ferramentas.

OpenClawRadar
Viés Logit Toroidal: Truque Simples no Momento da Inferência Reduz Alucinação em 40%
Tools

Viés Logit Toroidal: Truque Simples no Momento da Inferência Reduz Alucinação em 40%

Um novo método mapeia tokens para um toro e impulsiona logits próximos, reduzindo erros factuais sem ajuste fino ou RAG.

OpenClaw Radar
Configurando o OpenClaw como um Assistente de IA Sempre Ativo
Tools

Configurando o OpenClaw como um Assistente de IA Sempre Ativo

O OpenClaw é configurado como um assistente de IA sempre ativo para uma pequena equipe de desenvolvimento. Ele está hospedado em um servidor Railway, garantindo acessibilidade constante além das máquinas locais individuais. O backend de Modelo de Linguagem Grande (LLM) utilizado é o Opus 4.5 do Claude. A interação ocorre principalmente através do WhatsApp via o gateway integrado.

OpenClawRadar
Dirac: Agente Open-Source Alcança 65,2% no TerminalBench, Mais Barato e Aberto
Tools

Dirac: Agente Open-Source Alcança 65,2% no TerminalBench, Mais Barato e Aberto

Dirac, um agente de codificação de código aberto, alcançou 65,2% no TerminalBench 2.0 para gemini-3-flash-preview, superando a linha de base do Google (47,6%) e o principal agente de código fechado Junie CLI (64,3%). Também reduz os custos de API em 64,8% em relação aos concorrentes.

OpenClawRadar