vLLM 0.17.0 modificado se ejecuta en Tesla P40 para transcripción en tiempo real con Qwen3 ASR 1.7B

✍️ OpenClawRadar📅 Publicado: 9 de marzo de 2026🔗 Source
vLLM 0.17.0 modificado se ejecuta en Tesla P40 para transcripción en tiempo real con Qwen3 ASR 1.7B
Ad

Un desarrollador ha modificado exitosamente vLLM 0.17.0 para ejecutarse en GPUs Tesla P40, permitiendo la transcripción de conferencias en tiempo real con el modelo Qwen3 ASR 1.7B. La P40 utiliza la arquitectura Pascal, que normalmente carece de soporte para motores de inferencia más recientes.

Detalles Clave

El desarrollador estaba trabajando en un proyecto personal para la transcripción de conferencias en tiempo real. Inicialmente planeaba usar el modelo Qwen3 ASR 1.7B, pero descubrió que la transcripción verdaderamente en tiempo real solo es compatible a través de vLLM. En lugar de dividir muestras de audio como alternativa, intentó una modificación experimental.

Usando Codex, modificaron vLLM para ejecutarse en la arquitectura Pascal. Esto les permitió ejecutar el modelo Qwen3 ASR 1.7B en su GPU de servidor Tesla P40. El resultado fue una aceleración por hardware casi completa y una transcripción completamente en tiempo real.

El fork modificado de vLLM está disponible en: https://github.com/uaysk/vllm-pascal

Ad

Próximos Pasos y Desafíos

El siguiente objetivo del desarrollador es intentar ejecutar modelos Qwen3.5 en esta configuración. Sin embargo, señalan varios problemas técnicos. La funcionalidad de visión parece no estar disponible, e incluso usar solo las capacidades de texto presenta desafíos. En este punto, no están seguros de si será posible.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Ver también

Desarrollador Cambia de Especificaciones a Propuestas para Sesiones de Código Paralelas de Claude
Casos de uso

Desarrollador Cambia de Especificaciones a Propuestas para Sesiones de Código Paralelas de Claude

Un desarrollador comparte un flujo de trabajo utilizando propuestas en lugar de especificaciones al ejecutar 5-10 sesiones de Claude Code en paralelo, abordando el problema de que la IA genere código técnicamente correcto pero contextualmente erróneo a partir de especificaciones detalladas.

OpenClawRadar
SeatBee.app utiliza la inteligencia artificial Claude para organizar los asientos en bodas.
Casos de uso

SeatBee.app utiliza la inteligencia artificial Claude para organizar los asientos en bodas.

SeatBee.app fue creado usando Claude Code con Claude AI a través de OpenRouter para resolver problemas de planos de asientos en bodas. La IA maneja la satisfacción de restricciones para 150 invitados con 20 reglas, genera asientos óptimos en segundos y comprende dinámicas sociales como crear zonas de amortiguación entre personas con rupturas complicadas.

OpenClawRadar
El Agente de IA OpenClaw Encuentra Coincidencia de Empleo Federal y Crea Automatización Diaria
Casos de uso

El Agente de IA OpenClaw Encuentra Coincidencia de Empleo Federal y Crea Automatización Diaria

Un usuario encargó a su agente de IA OpenClaw encontrar un trabajo federal en usajobs.gov que coincidiera con sus requisitos salariales y preservara los beneficios especiales de jubilación, lo que resultó en una coincidencia específica de descripción de trabajo y una automatización de notificaciones diarias.

OpenClawRadar
Desarrollador envía 6 PRs desde el móvil en una fiesta — los agentes hicieron el trabajo
Casos de uso

Desarrollador envía 6 PRs desde el móvil en una fiesta — los agentes hicieron el trabajo

Un usuario de Reddit demostró el poder de los agentes de IA autónomos gestionando múltiples pull requests desde su teléfono mientras estaba en una fiesta. Sus agentes OpenClaw manejaron correcciones de backend, mejoras de rendimiento y ajustes de frontend de forma independiente.

Reddit User