vLLM 0.17.0 modificado se ejecuta en Tesla P40 para transcripción en tiempo real con Qwen3 ASR 1.7B

Un desarrollador ha modificado exitosamente vLLM 0.17.0 para ejecutarse en GPUs Tesla P40, permitiendo la transcripción de conferencias en tiempo real con el modelo Qwen3 ASR 1.7B. La P40 utiliza la arquitectura Pascal, que normalmente carece de soporte para motores de inferencia más recientes.
Detalles Clave
El desarrollador estaba trabajando en un proyecto personal para la transcripción de conferencias en tiempo real. Inicialmente planeaba usar el modelo Qwen3 ASR 1.7B, pero descubrió que la transcripción verdaderamente en tiempo real solo es compatible a través de vLLM. En lugar de dividir muestras de audio como alternativa, intentó una modificación experimental.
Usando Codex, modificaron vLLM para ejecutarse en la arquitectura Pascal. Esto les permitió ejecutar el modelo Qwen3 ASR 1.7B en su GPU de servidor Tesla P40. El resultado fue una aceleración por hardware casi completa y una transcripción completamente en tiempo real.
El fork modificado de vLLM está disponible en: https://github.com/uaysk/vllm-pascal
Próximos Pasos y Desafíos
El siguiente objetivo del desarrollador es intentar ejecutar modelos Qwen3.5 en esta configuración. Sin embargo, señalan varios problemas técnicos. La funcionalidad de visión parece no estar disponible, e incluso usar solo las capacidades de texto presenta desafíos. En este punto, no están seguros de si será posible.
📖 Read the full source: r/LocalLLaMA
👀 Ver también

Desarrollador Cambia su Negocio de OpenClaw a RunLobster Tras Incidente de Seguridad, Mantiene Instancia Personal Autohospedada
Un desarrollador trasladó su agente de negocio OpenClaw a RunLobster por $49/mes después de descubrir que su instancia autoalojada había estado expuesta en 0.0.0.0 durante 3 meses tras la CVE de febrero. Mantuvieron su OpenClaw personal autoalojado en un Mac Mini para cargas de trabajo no críticas.

Claude para Cumplimiento de Ingeniería: Desglose del Flujo de Trabajo de 6 Meses
Una firma técnica comparte cómo usan Claude Projects, Artifacts y el seguimiento de restricciones para evitar alucinaciones en especificaciones para clientes.

Configuración local de LLM en Mac Studio: GLM 5.1, Kimi K2.6 y lo que funciona para codificar con Claude Code
Un desarrollador comparte su configuración de Mac Studio (M3 Ultra) de mayo de 2026 con GLM 5.1 cuantizado (380GB, 17 tps de decodificación), Kimi K2.6 (460GB, 21 tps de decodificación), y notas sobre Minimax 2.7, Gemma 4 31B, Qwen 3.5 9B, y soporte pendiente de Deepseek/Mimo.

Neuberg: Terminal de Trading Multi-Mercado de Código Abierto Desarrollado con Claude AI
Neuberg es una terminal de trading basada en navegador que se conecta a mercados como Hyperliquid, Polymarket y Alpaca, construida utilizando Claude y Claude Code. El proceso de desarrollo reveló fortalezas específicas en la crítica arquitectónica y la refactorización, junto con limitaciones en la gestión de contexto largo y sistemas en tiempo real.