Revisão de Desempenho do Omnicoder-9B: Velocidade vs. Problemas de Chamada de Ferramentas

Visão Geral Técnica
Omnicoder-9B é um modelo específico para programação desenvolvido pela Tesslate, baseado na arquitetura Qwen 3.5. Ele foi ajustado sobre o Qwen3.5 9B usando saídas de vários modelos, incluindo Opus 4.6, GPT 5.4, GPT 5.3 Codex e Gemini 3.1 Pro.
Características de Desempenho
O modelo demonstra um desempenho forte em hardware de médio porte. Com 12 GB de VRAM, usuários relatam geração consistente de tokens a 15 tokens/segundo mesmo com o tamanho do contexto definido em 100k. O processamento de prompts é notavelmente rápido, com aproximadamente 265 tokens/segundo. O modelo funciona sem travar sistemas ou causar degradação de desempenho.
Limitações e Problemas
Apesar das vantagens de velocidade, o Omnicoder-9B mostra várias limitações em cenários práticos de programação:
- Falhou em gerar um clone completo do Super Mario em um arquivo HTML independente com um prompt único
- Experimentou falhas na chamada de ferramentas com servidores MCP, gerando erros MCP durante a busca de dados
- Problemas ao executar chamadas de ferramentas de escrita do Claude Code, embora isso possa envolver fatores de compatibilidade
Testes de Integração em IDE
Testes em ambientes de desenvolvimento revelaram resultados mistos:
- No LM Studio com Roo Code: Ocorreram desconexões conforme o tamanho do token aumentava para 4k, embora isso pareça ser um problema de integração e não específico do modelo
- O modelo atualizou ou escreveu pequenos scripts com sucesso com tamanhos de token entre 2-3k
- Solicitações de API falharam para tokens acima de 4k sem mensagens de erro
- No Claude Code: A geração de tokens pareceu mais lenta em comparação com o Roo Code, e o modelo falhou em executar chamadas de ferramentas de escrita após gerar a saída
O usuário observa que o Roo Code tem sido a extensão mais eficaz para LLMs locais entre Continue e outras opções testadas.
📖 Read the full source: r/LocalLLaMA
👀 See Also

Explorando o LiveDocs: Um Notebook de Análise de Dados Nativamente em IA
O LiveDocs oferece um ambiente de notebook reativo que permite que equipes de dados realizem análises de múltiplas etapas e mantenham a análise de ponta a ponta com a ajuda de um agente de IA.

Claude Code Controle Remoto: Continue Sessões Locais de Qualquer Dispositivo
O Controle Remoto do Claude Code permite que você continue sessões locais do Claude Code em outros dispositivos como telefones ou navegadores, mantendo tudo funcionando em sua máquina. Está disponível como uma visualização de pesquisa nos planos Pro e Max, exigindo configuração de autenticação e confiança no espaço de trabalho.

O mecanismo de inferência Atlas se torna open source: Rust puro + CUDA, mais de 100 tok/s no DGX Spark
Atlas agora é open source — um motor de inferência Rust + CUDA que atinge 130 tok/s de pico no Qwen3.5-35B (NVFP4) em um único DGX Spark, sem runtime Python e com cold start inferior a 2 minutos.

Hypura: Agendador de inferência de LLM com consciência de camada de armazenamento para Apple Silicon
Hypura é um agendador de inferência baseado em Rust que posiciona tensores do modelo nas camadas GPU, RAM e NVMe para executar modelos que excedem a memória física em Macs Apple Silicon. Ele permite executar um Mixtral 8x7B de 31GB em um Mac Mini de 32GB a 2,2 tok/s e um Llama 70B de 40GB a 0,3 tok/s, onde o llama.cpp padrão trava.