Revisión del Rendimiento de Omnicoder-9B: Velocidad frente a Problemas de Llamada a Herramientas

Descripción Técnica
Omnicoder-9B es un modelo específico para codificación desarrollado por Tesslate, basado en la arquitectura Qwen 3.5. Está ajustado sobre Qwen3.5 9B utilizando salidas de múltiples modelos incluyendo Opus 4.6, GPT 5.4, GPT 5.3 Codex y Gemini 3.1 Pro.
Características de Rendimiento
El modelo demuestra un rendimiento sólido en hardware de gama media. Con 12GB de VRAM, los usuarios reportan generación consistente de tokens a 15 tokens/segundo incluso con un tamaño de contexto establecido en 100k. El procesamiento de prompts es notablemente rápido a aproximadamente 265 tokens/segundo. El modelo funciona sin bloquear sistemas o causar degradación del rendimiento.
Limitaciones y Problemas
A pesar de las ventajas de velocidad, Omnicoder-9B muestra varias limitaciones en escenarios prácticos de codificación:
- Falló al generar un clon completo de Super Mario en un archivo HTML independiente con un prompt de una sola toma
- Experimentó fallos en llamadas a herramientas con servidores MCP, generando errores MCP durante la obtención de datos
- Problemas al ejecutar llamadas a herramientas de escritura desde Claude Code, aunque esto puede involucrar factores de compatibilidad
Pruebas de Integración en IDE
Las pruebas en entornos de desarrollo revelaron resultados mixtos:
- En LM Studio con Roo Code: Ocurrieron desconexiones a medida que el tamaño de tokens aumentaba a 4k, aunque esto parece ser un problema de integración más que específico del modelo
- El modelo actualizó o escribió pequeños scripts con tamaños de tokens entre 2-3k exitosamente
- Las solicitudes API fallaron para tokens por encima de 4k sin mensajes de error
- En Claude Code: La generación de tokens se sintió más lenta en comparación con Roo Code, y el modelo falló al ejecutar llamadas a herramientas de escritura después de generar salida
El usuario señala que Roo Code ha sido la extensión más efectiva para LLMs locales entre Continue y otras opciones probadas.
📖 Leer la fuente completa: r/LocalLLaMA
👀 Ver también

Gobernador: Un Plugin de Claude Code para Reducir el Desperdicio de Tokens mediante Compresión de Salida, Reducción de Contexto y Filtrado de Herramientas
Governor es un plugin de Claude Code que reduce el desperdicio de tokens/contexto mediante una salida profesional compacta, compresión de archivos de memoria, filtrado de salida de herramientas y barreras de protección contra la desviación. Los benchmarks muestran un ahorro del 55.5% en tokens de salida frente al control.

Sistema de Memoria MCP Local con Consolidación para Conversaciones de IA
Un desarrollador construyó un servidor MCP que proporciona memoria local persistente para clientes de IA, utilizando Qwen 2.5-7B para consolidar conversaciones en documentos de conocimiento estructurado cada 6 horas. El sistema funciona completamente en tu hardware con deduplicación semántica, puntuación adaptativa y búsqueda vectorial FAISS.

Marco de trabajo de código abierto para memoria persistente de agentes de IA con almacenamiento local y recuperación basada en grafos.
Un desarrollador ha estado construyendo un marco de trabajo de código abierto para memoria persistente de agentes de IA que almacena datos localmente como archivos Markdown, utiliza enlaces wiki como bordes de grafo e implementa Git para control de versiones. El sistema cuenta con recuperación de cuatro señales y olvido consciente del grafo basado en la ciencia cognitiva ACT-R.

Herramienta gratuita de detección de señales de farmacovigilancia desarrollada con Claude Code
Un desarrollador utilizó Claude Code para crear una plataforma gratuita de farmacovigilancia que analiza 2.9 millones de informes de eventos adversos de la FDA, ejecutando detección estadística de señales por la que las plataformas comerciales cobran entre $50,000 y $500,000 al año. La herramienta está alojada gratuitamente en HuggingFace.