La version modifiée de vLLM 0.17.0 fonctionne sur Tesla P40 pour la transcription en temps réel avec Qwen3 ASR 1.7B.

✍️ OpenClawRadar📅 Publié: March 9, 2026🔗 Source
La version modifiée de vLLM 0.17.0 fonctionne sur Tesla P40 pour la transcription en temps réel avec Qwen3 ASR 1.7B.
Ad

Un développeur a réussi à modifier vLLM 0.17.0 pour l'exécuter sur des GPU Tesla P40, permettant la transcription en temps réel de conférences avec le modèle Qwen3 ASR 1.7B. Le P40 utilise l'architecture Pascal, qui manque généralement de support pour les moteurs d'inférence plus récents.

Détails clés

Le développeur travaillait sur un projet personnel de transcription en temps réel de conférences. Il avait initialement prévu d'utiliser le modèle Qwen3 ASR 1.7B, mais a constaté que la transcription véritablement en temps réel n'est prise en charge que par vLLM. Plutôt que de segmenter les échantillons audio comme alternative, il a tenté une modification expérimentale.

En utilisant Codex, il a modifié vLLM pour l'exécuter sur l'architecture Pascal. Cela lui a permis d'exécuter le modèle Qwen3 ASR 1.7B sur son GPU serveur Tesla P40. Le résultat a été une accélération matérielle quasi complète et une transcription entièrement en temps réel.

Le fork modifié de vLLM est disponible à l'adresse : https://github.com/uaysk/vllm-pascal

Ad

Prochaines étapes et défis

L'objectif suivant du développeur est d'essayer d'exécuter les modèles Qwen3.5 sur cette configuration. Cependant, il note plusieurs problèmes techniques. La fonctionnalité de vision semble indisponible, et même l'utilisation uniquement des capacités textuelles présente des défis. À ce stade, il n'est pas certain que cela soit possible.

📖 Lire la source complète : r/LocalLLaMA

Ad

👀 See Also

Exécution d'agents LLM locaux sur Mac Minis avec interface Telegram
Use Cases

Exécution d'agents LLM locaux sur Mac Minis avec interface Telegram

Un développeur partage une configuration utilisant 5 agents LLM locaux sur des Mac Minis, contrôlés via des bots Telegram sans aucun coût d'API. Le système utilise LMStudio pour servir les modèles, des sessions tmux pour Claude Code, et 80 lignes de Python pour le pont Telegram.

OpenClawRadar
Traduire en français : Claude Sonnet 4.6 Évalue les Rapports de Bugs de Quatre Modèles Locaux Qwen3.5
Use Cases

Traduire en français : Claude Sonnet 4.6 Évalue les Rapports de Bugs de Quatre Modèles Locaux Qwen3.5

Un développeur a testé quatre variantes de Qwen3.5 en leur faisant générer des rapports de bug pour un problème de jeu iOS, puis a demandé à Claude Sonnet 4.6 d'évaluer ces rapports. Les modèles ont correctement identifié un bug Swift où les couleurs des bordures d'équipement ne se réinitialisent pas, mais le code de test présentait des problèmes de compilation.

OpenClawRadar
Conseil en Conception de Bâtiments Remplace Wix par un Agent d'Intelligence Artificielle de Pointe
Use Cases

Conseil en Conception de Bâtiments Remplace Wix par un Agent d'Intelligence Artificielle de Pointe

Un cabinet de conseil en conception de bâtiments a développé un agent IA personnalisé pour gérer les demandes des clients, remplaçant un site Wix à 40$/mois. Le système utilise une architecture divisée en raison du délai d'expiration serverless de 10 secondes de Netlify et emploie DeepSeek-R3 pour les réponses.

OpenClawRadar
L'agent IA RunLobster construit un tableau de bord fonctionnel à partir d'une demande en langage naturel.
Use Cases

L'agent IA RunLobster construit un tableau de bord fonctionnel à partir d'une demande en langage naturel.

Un développeur rapporte que RunLobster a construit et déployé un tableau de bord complet avec intégration Stripe et système d'authentification en réponse à une seule commande en langage naturel, réalisant en quelques minutes ce qui prendrait normalement plusieurs jours.

OpenClawRadar