La version modifiée de vLLM 0.17.0 fonctionne sur Tesla P40 pour la transcription en temps réel avec Qwen3 ASR 1.7B.

Un développeur a réussi à modifier vLLM 0.17.0 pour l'exécuter sur des GPU Tesla P40, permettant la transcription en temps réel de conférences avec le modèle Qwen3 ASR 1.7B. Le P40 utilise l'architecture Pascal, qui manque généralement de support pour les moteurs d'inférence plus récents.
Détails clés
Le développeur travaillait sur un projet personnel de transcription en temps réel de conférences. Il avait initialement prévu d'utiliser le modèle Qwen3 ASR 1.7B, mais a constaté que la transcription véritablement en temps réel n'est prise en charge que par vLLM. Plutôt que de segmenter les échantillons audio comme alternative, il a tenté une modification expérimentale.
En utilisant Codex, il a modifié vLLM pour l'exécuter sur l'architecture Pascal. Cela lui a permis d'exécuter le modèle Qwen3 ASR 1.7B sur son GPU serveur Tesla P40. Le résultat a été une accélération matérielle quasi complète et une transcription entièrement en temps réel.
Le fork modifié de vLLM est disponible à l'adresse : https://github.com/uaysk/vllm-pascal
Prochaines étapes et défis
L'objectif suivant du développeur est d'essayer d'exécuter les modèles Qwen3.5 sur cette configuration. Cependant, il note plusieurs problèmes techniques. La fonctionnalité de vision semble indisponible, et même l'utilisation uniquement des capacités textuelles présente des défis. À ce stade, il n'est pas certain que cela soit possible.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

Sauveteur de la faune utilise Claude IA pour un livre sur les soins aux bébés écureuils et un chatbot interactif
Un sauveteur de la faune avec 38 ans d'expérience utilise Claude AI pour affiner un livre de 300 pages sur les soins aux bébés écureuils et a programmé un chatbot interactif nommé Hazel pour aider d'autres sauveteurs. Le sauveteur teste actuellement les capacités de Claude en lui demandant de suivre et de tenir un journal des progrès d'un bébé écureuil nommé Nova.

OpenClaw, l'agent IA, documente la première semaine de construction d'une entreprise sans intervention humaine.
Un agent IA fonctionnant sur OpenClaw a documenté sa première semaine de création d'une entreprise sans intervention humaine, rapportant des intégrations d'API réussies et des tâches cron nocturnes, mais rencontrant des problèmes d'exécution et aucun revenu.

Développeur Passe de Business OpenClaw à RunLobster Après un Incident de Sécurité, Garde Son Instance Personnelle en Auto-hébergement
Un développeur a migré son agent OpenClaw professionnel vers RunLobster à 49 $/mois après avoir découvert que son instance auto-hébergée était exposée sur 0.0.0.0 pendant 3 mois suite à la CVE de février. Il a conservé son OpenClaw personnel auto-hébergé sur un Mac Mini pour les charges de travail non critiques.

Start-up de santé IA utilise l'IA et un partenariat avec Mark Cuban pour lutter contre les refus de remboursement d'assurance.
Une startup spécialisée dans l'IA pour la santé a développé des outils utilisant l'intelligence artificielle pour aider à contester et faire annuler des refus de remboursement d'assurance maladie, avec la participation de Mark Cuban dans l'approche de la startup.