Predicción Multi-Token MTP: Generación de Tokens 2x Más Rápida en AMD Strix Halo y Radeon 9700 AI Pro

La Predicción de Múltiples Tokens (MTP) promete una generación de tokens hasta 2 veces más rápida para LLM locales. Un nuevo video demo muestra MTP ejecutándose en hardware AMD Strix Halo y Dual Radeon 9700 AI Pro, orientado a modelos de la clase Qwen 3.6.
Detalles clave
- Rendimiento: MTP acelera la inferencia de LLM hasta 2x, especialmente beneficioso para agentes de código.
- Hardware probado: AMD Strix Halo (probablemente Ryzen AI 300 series) y Dual Radeon 9700 AI Pro (RDNA 4).
- Modelo: Qwen 3.6 (presumiblemente Qwen2.5-7B o similar, variante exacta no especificada).
- Formato del demo: Video de YouTube que cubre cómo funciona MTP y las mejoras medidas.
MTP funciona prediciendo múltiples tokens futuros en paralelo a partir de una sola pasada hacia adelante, reduciendo el número de pasos autorregresivos necesarios. La técnica es especialmente efectiva para salidas estructuradas como código, donde los patrones de tokens son más predecibles.
Para contexto, el stack de cómputo GPU reciente de AMD (ROCm) ha estado alcanzando a NVIDIA CUDA para inferencia de LLM, y las implementaciones de MTP a través de llama.cpp o vLLM podrían cerrar aún más la brecha. Los desarrolladores que ejecutan agentes de código locales (por ejemplo, CodeLlama, DeepSeek-Coder) deberían esperar aceleraciones significativas en hardware compatible.
📖 Leer la fuente completa: r/LocalLLaMA
👀 Ver también

Los CEOs que creen que la IA reemplazará a sus empleados son simplemente malos CEOs
El CEO Aaron Levie explica la 'psicosis de la IA': cuando los líderes, desconectados del trabajo real, ven demostraciones del camino feliz y sobreestiman herramientas como Claude Code, ignorando la última milla de la producción.

Encyclopædia Britannica presenta demanda contra OpenAI por datos de entrenamiento de IA
La Enciclopedia Británica ha presentado una demanda contra OpenAI, alegando infracción de derechos de autor relacionada con los datos de entrenamiento de IA. El caso fue reportado por Reuters el 16 de marzo de 2026 y ha generado discusión en Hacker News.

Ubuntu Linux integrará funciones de IA en el próximo año, comenzando con inferencia local
Canonical anuncia una apuesta multianual por la IA para Ubuntu, centrada en inferencia local, flujos de trabajo agentivos y capacidades del SO conscientes del contexto, con funciones que se lanzarán a lo largo de 2026.

Estrategia Comercial de Anthropic: Los Ingresos por API Impulsan las Limitaciones del Nivel de Consumidor
Los niveles de suscripción para consumidores de Anthropic operan con pérdidas, subsidiados para construir participación mental en IA, mientras que su negocio de API genera ingresos. El nivel Pro de $20 está intencionalmente limitado para filtrar usuarios hacia suscripciones Max de mayor valor.