vLLM 0.17.0 modificado se ejecuta en Tesla P40 para transcripción en tiempo real con Qwen3 ASR 1.7B

✍️ OpenClawRadar📅 Publicado: 9 de marzo de 2026🔗 Source
vLLM 0.17.0 modificado se ejecuta en Tesla P40 para transcripción en tiempo real con Qwen3 ASR 1.7B
Ad

Un desarrollador ha modificado exitosamente vLLM 0.17.0 para ejecutarse en GPUs Tesla P40, permitiendo la transcripción de conferencias en tiempo real con el modelo Qwen3 ASR 1.7B. La P40 utiliza la arquitectura Pascal, que normalmente carece de soporte para motores de inferencia más recientes.

Detalles Clave

El desarrollador estaba trabajando en un proyecto personal para la transcripción de conferencias en tiempo real. Inicialmente planeaba usar el modelo Qwen3 ASR 1.7B, pero descubrió que la transcripción verdaderamente en tiempo real solo es compatible a través de vLLM. En lugar de dividir muestras de audio como alternativa, intentó una modificación experimental.

Usando Codex, modificaron vLLM para ejecutarse en la arquitectura Pascal. Esto les permitió ejecutar el modelo Qwen3 ASR 1.7B en su GPU de servidor Tesla P40. El resultado fue una aceleración por hardware casi completa y una transcripción completamente en tiempo real.

El fork modificado de vLLM está disponible en: https://github.com/uaysk/vllm-pascal

Ad

Próximos Pasos y Desafíos

El siguiente objetivo del desarrollador es intentar ejecutar modelos Qwen3.5 en esta configuración. Sin embargo, señalan varios problemas técnicos. La funcionalidad de visión parece no estar disponible, e incluso usar solo las capacidades de texto presenta desafíos. En este punto, no están seguros de si será posible.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Ver también

Desarrollador Cambia su Negocio de OpenClaw a RunLobster Tras Incidente de Seguridad, Mantiene Instancia Personal Autohospedada
Casos de uso

Desarrollador Cambia su Negocio de OpenClaw a RunLobster Tras Incidente de Seguridad, Mantiene Instancia Personal Autohospedada

Un desarrollador trasladó su agente de negocio OpenClaw a RunLobster por $49/mes después de descubrir que su instancia autoalojada había estado expuesta en 0.0.0.0 durante 3 meses tras la CVE de febrero. Mantuvieron su OpenClaw personal autoalojado en un Mac Mini para cargas de trabajo no críticas.

OpenClawRadar
Claude para Cumplimiento de Ingeniería: Desglose del Flujo de Trabajo de 6 Meses
Casos de uso

Claude para Cumplimiento de Ingeniería: Desglose del Flujo de Trabajo de 6 Meses

Una firma técnica comparte cómo usan Claude Projects, Artifacts y el seguimiento de restricciones para evitar alucinaciones en especificaciones para clientes.

OpenClawRadar
Configuración local de LLM en Mac Studio: GLM 5.1, Kimi K2.6 y lo que funciona para codificar con Claude Code
Casos de uso

Configuración local de LLM en Mac Studio: GLM 5.1, Kimi K2.6 y lo que funciona para codificar con Claude Code

Un desarrollador comparte su configuración de Mac Studio (M3 Ultra) de mayo de 2026 con GLM 5.1 cuantizado (380GB, 17 tps de decodificación), Kimi K2.6 (460GB, 21 tps de decodificación), y notas sobre Minimax 2.7, Gemma 4 31B, Qwen 3.5 9B, y soporte pendiente de Deepseek/Mimo.

OpenClawRadar
Neuberg: Terminal de Trading Multi-Mercado de Código Abierto Desarrollado con Claude AI
Casos de uso

Neuberg: Terminal de Trading Multi-Mercado de Código Abierto Desarrollado con Claude AI

Neuberg es una terminal de trading basada en navegador que se conecta a mercados como Hyperliquid, Polymarket y Alpaca, construida utilizando Claude y Claude Code. El proceso de desarrollo reveló fortalezas específicas en la crítica arquitectónica y la refactorización, junto con limitaciones en la gestión de contexto largo y sistemas en tiempo real.

OpenClawRadar