OmniCoder-9B ajustado muestra un rendimiento sólido para la codificación de agentes en sistemas con 8 GB de VRAM.

Resultados de rendimiento de las pruebas con OmniCoder-9B y OpenCode
Un usuario en r/LocalLLaMA reportó haber probado OmniCoder-9B, un ajuste fino de Qwen3.5-9B entrenado en trazas Opus, y encontró que funcionaba bien para tareas de codificación agentiva en sistemas con VRAM limitada. El modelo está disponible en Hugging Face en Tesslate/OmniCoder-9B.
Configuración técnica y configuración
El usuario ejecutó la cuantización Q4_K_M GGUF usando ik_llama con el siguiente comando:
ik_llama.cpp\build\bin\Release\llama-server.exe -m models/Tesslate/OmniCoder-9B-GGUF/omnicoder-9b-q4_k_m.gguf -ngl 999 -fa 1 -b 2048 -ub 512 -t 8 -c 100000 -ctk f16 -ctv q4_0 --temp 0.4 --top-p 0.95 --top-k 20 --presence-penalty 0.0 --jinja --ctx-checkpoints 0
Lograron aproximadamente 40 tokens por segundo con esta configuración. El usuario señaló que la cuantización Q5_KS con una longitud de contexto de 64,000 proporciona velocidades similares.
Configuración de OpenCode
La configuración de OpenCode utilizada para las pruebas:
"local": { "models": { "/models/Tesslate/OmniCoder-9B-GGUF/omnicoder-9b-q4_k_m.gguf": { "interleaved": { "field": "reasoning_content" }, "limit": { "context": 100000, "output": 32000 }, "name": "omnicoder-9b-q4_k_m", "reasoning": true, "temperature": true, "tool_call": true } }, "npm": "@ai-sdk/openai-compatible", "options": { "baseURL": "http://localhost:8080/v1" } }El usuario mencionó un posible error que causa el reprocesamiento completo del prompt, el cual están investigando.
Contexto y comparación
Las pruebas fueron motivadas por preocupaciones sobre restricciones de cuota y cambios de precios en herramientas comerciales de IA para codificación. El usuario mencionó específicamente tener 8GB de VRAM, lo que típicamente limita la capacidad de ejecutar modelos de código abierto capaces a buenas velocidades para codificación agentiva. Señalaron que, aunque los modelos MOE podrían ofrecer un mejor rendimiento, sus velocidades son significativamente más lentas.
📖 Read the full source: r/LocalLLaMA
👀 Ver también

La habilidad atoship de OpenClaw convierte al asistente de IA en un gestor de envíos.
La habilidad atoship para OpenClaw permite a los usuarios describir sus necesidades de envío en inglés sencillo, luego maneja la selección de transportistas, comparación de tarifas, compra de etiquetas y seguimiento. Los comandos de ejemplo incluyen 'envía esta caja de 1 libra a Nueva York, la opción más económica'.

Context Gateway: Un Proxy de Código Abierto para Comprimir el Contexto de Agentes de IA
Context Gateway es un proxy de código abierto que se sitúa entre los agentes de programación y los LLM, comprimiendo las salidas de las herramientas antes de que entren en la ventana de contexto. Utiliza modelos de lenguaje pequeños para detectar señales en el contexto, realiza compactación en segundo plano al 85% de la capacidad de la ventana e incluye límites de gasto, un panel de control y notificaciones de Slack.

Anthropic lanza Claude para pequeñas empresas con flujos de trabajo predefinidos para QuickBooks, HubSpot, Canva
Claude para Pequeñas Empresas es un paquete de instalación opcional dentro de Claude Cowork que se conecta a QuickBooks, PayPal, HubSpot, Canva, Docusign, Google Workspace y Microsoft 365, con 15 flujos de trabajo listos para usar para nóminas, cierre de mes, facturación, gestión de campañas y más.

LLM-Memory.net: Sistema de Memoria de Código Abierto con Infraestructura Multi-Agente
LLM-Memory.net es un sistema de memoria autoalojable para agentes de IA que proporciona almacenamiento de notas con búsqueda semántica, comunicación en tiempo real por chat/correo entre agentes, discusiones estructuradas con votación e integración de servidor MCP. El código fuente completo está disponible en GitHub con un instalador y playbooks de Ansible.