vLLM 0.17.0 modificado se ejecuta en Tesla P40 para transcripción en tiempo real con Qwen3 ASR 1.7B

Un desarrollador ha modificado exitosamente vLLM 0.17.0 para ejecutarse en GPUs Tesla P40, permitiendo la transcripción de conferencias en tiempo real con el modelo Qwen3 ASR 1.7B. La P40 utiliza la arquitectura Pascal, que normalmente carece de soporte para motores de inferencia más recientes.
Detalles Clave
El desarrollador estaba trabajando en un proyecto personal para la transcripción de conferencias en tiempo real. Inicialmente planeaba usar el modelo Qwen3 ASR 1.7B, pero descubrió que la transcripción verdaderamente en tiempo real solo es compatible a través de vLLM. En lugar de dividir muestras de audio como alternativa, intentó una modificación experimental.
Usando Codex, modificaron vLLM para ejecutarse en la arquitectura Pascal. Esto les permitió ejecutar el modelo Qwen3 ASR 1.7B en su GPU de servidor Tesla P40. El resultado fue una aceleración por hardware casi completa y una transcripción completamente en tiempo real.
El fork modificado de vLLM está disponible en: https://github.com/uaysk/vllm-pascal
Próximos Pasos y Desafíos
El siguiente objetivo del desarrollador es intentar ejecutar modelos Qwen3.5 en esta configuración. Sin embargo, señalan varios problemas técnicos. La funcionalidad de visión parece no estar disponible, e incluso usar solo las capacidades de texto presenta desafíos. En este punto, no están seguros de si será posible.
📖 Read the full source: r/LocalLLaMA
👀 Ver también

Desarrollador Cambia de Especificaciones a Propuestas para Sesiones de Código Paralelas de Claude
Un desarrollador comparte un flujo de trabajo utilizando propuestas en lugar de especificaciones al ejecutar 5-10 sesiones de Claude Code en paralelo, abordando el problema de que la IA genere código técnicamente correcto pero contextualmente erróneo a partir de especificaciones detalladas.

SeatBee.app utiliza la inteligencia artificial Claude para organizar los asientos en bodas.
SeatBee.app fue creado usando Claude Code con Claude AI a través de OpenRouter para resolver problemas de planos de asientos en bodas. La IA maneja la satisfacción de restricciones para 150 invitados con 20 reglas, genera asientos óptimos en segundos y comprende dinámicas sociales como crear zonas de amortiguación entre personas con rupturas complicadas.

El Agente de IA OpenClaw Encuentra Coincidencia de Empleo Federal y Crea Automatización Diaria
Un usuario encargó a su agente de IA OpenClaw encontrar un trabajo federal en usajobs.gov que coincidiera con sus requisitos salariales y preservara los beneficios especiales de jubilación, lo que resultó en una coincidencia específica de descripción de trabajo y una automatización de notificaciones diarias.

Desarrollador envía 6 PRs desde el móvil en una fiesta — los agentes hicieron el trabajo
Un usuario de Reddit demostró el poder de los agentes de IA autónomos gestionando múltiples pull requests desde su teléfono mientras estaba en una fiesta. Sus agentes OpenClaw manejaron correcciones de backend, mejoras de rendimiento y ajustes de frontend de forma independiente.