Qwen 3.6 27B con MTP en V100 32GB: 54 t/s mediante la rama de llama.cpp

Un usuario en r/LocalLLaMA reporta resultados impresionantes ejecutando Qwen 3.6 27B con Predicción Multi-Token (MTP) en un módulo V100 32GB SXM mediante un adaptador PCIe. La configuración utiliza la rama MTP de am17an de llama.cpp y la correspondiente cuantización MTP GGUF. Especificaciones clave: caché KV Q8_0 con límite de 200k, ejecutándose como backend de Copilot para VS Code a través de llama-server.
Números de rendimiento
- Sin MTP: 29-30 tokens/segundo
- Con MTP: 54-55 tokens/segundo (con límite de potencia de 150W)
- Después de 50k tokens de contexto: baja a 40-45 t/s
Rama: fork MTP de am17an. La compilación y ejecución fueron sencillas: 'descargado y compilado de una sola vez' con llama-server funcionando sin problemas. La configuración maneja bien llamadas a herramientas y subagentes, y proporcionó 'revisiones de código y refactorizaciones muy perspicaces' a pesar de la limitación de VRAM (32GB).
Esto es particularmente relevante para desarrolladores que ejecutan LLMs en hardware de centro de datos más antiguo como V100. MTP duplica efectivamente el rendimiento para este modelo, demostrando ganancias prácticas para cargas de trabajo de asistente de codificación.
📖 Lea la fuente completa: r/LocalLLaMA
👀 Ver también

Axe: Una CLI de 12MB para Agentes LLM de Propósito Único
Axe es un binario ligero de Go que ejecuta agentes de IA enfocados definidos en archivos TOML. Trata a los agentes como programas Unix, admitiendo tuberías de entrada estándar, delegación de subagentes e integración de LLM de múltiples proveedores.

PocketTeam: Un Pipeline de Código Claude con Agentes de Seguridad y Aprendizaje Basados en Hooks
PocketTeam es una canalización de Claude Code que implementa 9 capas de seguridad a nivel de llamada de herramientas para bloquear operaciones peligrosas como escrituras en .env o comandos rm -rf. El sistema incluye un agente Observador que analiza las tareas completadas y escribe aprendizajes estructurados para mejorar el rendimiento futuro de los agentes.

Clawpage: Una Herramienta que Convierte Conversaciones de OpenClaw en Sitios Web Estáticos
Un desarrollador creó Clawpage, una habilidad que transforma el historial de sesiones de OpenClaw en páginas web estáticas para conservar conversaciones valiosas, incluyendo el intercambio de ideas, la investigación y el proceso de depuración. La herramienta está disponible en GitHub.

7 comandos slash, $0.45/artículo: Este pipeline de Claude Code ejecuta una operación completa de contenido SEO
Un desarrollador ha hecho público un pipeline de 7 comandos para Claude Code que gestiona investigación SEO, redacción, optimización y publicación. Cuesta $0.45/post (API de Perplexity) y se ejecuta en 15 min/día. Resultados: 18× impresiones mensuales en 12 meses.