Qwen 3.6 27B con MTP en V100 32GB: 54 t/s mediante la rama de llama.cpp

✍️ OpenClawRadar📅 Publicado: 6 de mayo de 2026🔗 Source
Qwen 3.6 27B con MTP en V100 32GB: 54 t/s mediante la rama de llama.cpp
Ad

Un usuario en r/LocalLLaMA reporta resultados impresionantes ejecutando Qwen 3.6 27B con Predicción Multi-Token (MTP) en un módulo V100 32GB SXM mediante un adaptador PCIe. La configuración utiliza la rama MTP de am17an de llama.cpp y la correspondiente cuantización MTP GGUF. Especificaciones clave: caché KV Q8_0 con límite de 200k, ejecutándose como backend de Copilot para VS Code a través de llama-server.

Números de rendimiento

  • Sin MTP: 29-30 tokens/segundo
  • Con MTP: 54-55 tokens/segundo (con límite de potencia de 150W)
  • Después de 50k tokens de contexto: baja a 40-45 t/s

Rama: fork MTP de am17an. La compilación y ejecución fueron sencillas: 'descargado y compilado de una sola vez' con llama-server funcionando sin problemas. La configuración maneja bien llamadas a herramientas y subagentes, y proporcionó 'revisiones de código y refactorizaciones muy perspicaces' a pesar de la limitación de VRAM (32GB).

Esto es particularmente relevante para desarrolladores que ejecutan LLMs en hardware de centro de datos más antiguo como V100. MTP duplica efectivamente el rendimiento para este modelo, demostrando ganancias prácticas para cargas de trabajo de asistente de codificación.

📖 Lea la fuente completa: r/LocalLLaMA

Ad

👀 Ver también

CLI-Anything-WEB: Plugin de código abierto que reconstruye cualquier sitio web en una CLI de Python para Claude Code
Herramientas

CLI-Anything-WEB: Plugin de código abierto que reconstruye cualquier sitio web en una CLI de Python para Claude Code

CLI-Anything-WEB es un plugin de código abierto para Claude Code que monitorea tu tráfico del navegador, aplica ingeniería inversa al protocolo y genera un CLI completo en Python con autenticación, pruebas y soporte --json. Incluye 19 CLIs de muestra para sitios como Reddit, Booking, Airbnb, ChatGPT y LinkedIn.

OpenClawRadar
Apfel: Herramienta CLI gratuita para acceder al LLM local de Apple en macOS
Herramientas

Apfel: Herramienta CLI gratuita para acceder al LLM local de Apple en macOS

Apfel v0.6.13 es un binario Swift 6.3 que expone el LLM integrado de Apple como una herramienta CLI, un servidor compatible con OpenAI y un chat interactivo. Se ejecuta 100% en el dispositivo sin claves API ni costos, utilizando el modelo de 4,096 tokens incluido con macOS 26+ en Macs con Apple Silicon.

OpenClawRadar
El Complemento de Pregunta Rápida Automatiza el Desarrollo en Unity con Claude Code
Herramientas

El Complemento de Pregunta Rápida Automatiza el Desarrollo en Unity con Claude Code

Un desarrollador ha lanzado quick-question, un complemento para macOS de Unity 2021.3+ que automatiza la compilación, las pruebas y la revisión de código entre modelos cuando se utiliza Claude Code. La herramienta incluye 20 comandos de barra diagonal y utiliza un patrón 'Tribunal' donde Codex y Claude revisan mutuamente sus hallazgos.

OpenClawRadar
OpenClaw .NET: Port a NativeAOT con Puente JSON-RPC para Complementos Existentes
Herramientas

OpenClaw .NET: Port a NativeAOT con Puente JSON-RPC para Complementos Existentes

OpenClaw .NET es un port de C# de OpenClaw que se compila en un binario NativeAOT de ~23 MB, eliminando el calentamiento del JIT y la sobrecarga del runtime de Node, manteniendo la compatibilidad con los complementos existentes de TypeScript/JavaScript a través de un puente JSON-RPC integrado.

OpenClawRadar