OmniCoder-9B ajustado muestra un rendimiento sólido para la codificación de agentes en sistemas con 8 GB de VRAM.

Resultados de rendimiento de las pruebas con OmniCoder-9B y OpenCode
Un usuario en r/LocalLLaMA reportó haber probado OmniCoder-9B, un ajuste fino de Qwen3.5-9B entrenado en trazas Opus, y encontró que funcionaba bien para tareas de codificación agentiva en sistemas con VRAM limitada. El modelo está disponible en Hugging Face en Tesslate/OmniCoder-9B.
Configuración técnica y configuración
El usuario ejecutó la cuantización Q4_K_M GGUF usando ik_llama con el siguiente comando:
ik_llama.cpp\build\bin\Release\llama-server.exe -m models/Tesslate/OmniCoder-9B-GGUF/omnicoder-9b-q4_k_m.gguf -ngl 999 -fa 1 -b 2048 -ub 512 -t 8 -c 100000 -ctk f16 -ctv q4_0 --temp 0.4 --top-p 0.95 --top-k 20 --presence-penalty 0.0 --jinja --ctx-checkpoints 0
Lograron aproximadamente 40 tokens por segundo con esta configuración. El usuario señaló que la cuantización Q5_KS con una longitud de contexto de 64,000 proporciona velocidades similares.
Configuración de OpenCode
La configuración de OpenCode utilizada para las pruebas:
"local": { "models": { "/models/Tesslate/OmniCoder-9B-GGUF/omnicoder-9b-q4_k_m.gguf": { "interleaved": { "field": "reasoning_content" }, "limit": { "context": 100000, "output": 32000 }, "name": "omnicoder-9b-q4_k_m", "reasoning": true, "temperature": true, "tool_call": true } }, "npm": "@ai-sdk/openai-compatible", "options": { "baseURL": "http://localhost:8080/v1" } }El usuario mencionó un posible error que causa el reprocesamiento completo del prompt, el cual están investigando.
Contexto y comparación
Las pruebas fueron motivadas por preocupaciones sobre restricciones de cuota y cambios de precios en herramientas comerciales de IA para codificación. El usuario mencionó específicamente tener 8GB de VRAM, lo que típicamente limita la capacidad de ejecutar modelos de código abierto capaces a buenas velocidades para codificación agentiva. Señalaron que, aunque los modelos MOE podrían ofrecer un mejor rendimiento, sus velocidades son significativamente más lentas.
📖 Read the full source: r/LocalLLaMA
👀 Ver también

Claude Code Routines mejora el rendimiento de CLI 2.4x en más de 20 PR
Usando las Rutinas de Claude Code en un cron de 2 horas para optimizar autónomamente una CLI de código abierto (Repomix), resultando en más de 20 PR generados automáticamente y una mejora de 2.4x en el tiempo de ejecución.

Pneuma: Un Entorno de Escritorio Generado por IA Donde el Software se Materializa a Partir de Descripciones
Pneuma es un entorno de computación de escritorio donde describes lo que quieres—un monitor de CPU, un juego, una aplicación de notas o un visualizador de datos—y un programa funcional se materializa en segundos. El sistema genera módulos autónomos en Rust, los compila a WebAssembly y los ejecuta en instancias sandboxed de Wasmtime con renderizado GPU mediante wgpu.

Claude-rank: Complemento de Claude Code para Auditorías de Visibilidad en Búsquedas de IA
Claude-rank es un complemento gratuito de Claude Code y CLI que audita los fundamentos técnicos para la visibilidad en búsquedas de IA, manejando SEO técnico, puntuación de citabilidad de IA, verificaciones de rastreabilidad para bots de IA y correcciones automatizadas para problemas de descubrimiento.

Claude Code Karma: Panel de Observabilidad Local para Sesiones de Claude Code
Claude Code Karma es un panel de control local de código abierto que analiza archivos JSONL de ~/.claude/ para visualizar datos de sesiones de Claude Code, rastrear el uso de herramientas y monitorear fallos silenciosos. Construido con FastAPI, Svelte-Kit 2, Svelte 5 y SQLite, proporciona líneas de tiempo completas de sesiones y seguimiento en vivo.