Modifiziertes vLLM 0.17.0 läuft auf Tesla P40 für Echtzeit-Transkription mit Qwen3 ASR 1.7B

Ein Entwickler hat vLLM 0.17.0 erfolgreich für den Betrieb auf Tesla P40 GPUs modifiziert, wodurch Echtzeit-Vorlesungstranskription mit dem Qwen3 ASR 1.7B Modell ermöglicht wird. Die P40 verwendet die Pascal-Architektur, die normalerweise keine Unterstützung für neuere Inferenz-Engines bietet.
Wichtige Details
Der Entwickler arbeitete an einem persönlichen Projekt zur Echtzeit-Transkription von Vorlesungen. Ursprünglich war geplant, das Qwen3 ASR 1.7B Modell zu verwenden, aber es stellte sich heraus, dass echte Echtzeit-Transkription nur über vLLM unterstützt wird. Anstatt Audiodateien in Abschnitte zu unterteilen, versuchte er eine experimentelle Modifikation.
Mithilfe von Codex passte er vLLM für die Pascal-Architektur an. Dies ermöglichte es ihm, das Qwen3 ASR 1.7B Modell auf seiner Tesla P40 Server-GPU auszuführen. Das Ergebnis war nahezu vollständige Hardwarebeschleunigung und vollständige Echtzeit-Transkription.
Der modifizierte vLLM Fork ist verfügbar unter: https://github.com/uaysk/vllm-pascal
Nächste Schritte und Herausforderungen
Das nächste Ziel des Entwicklers ist es, Qwen3.5 Modelle mit diesem Setup auszuprobieren. Allerdings weist er auf mehrere technische Probleme hin. Die Vision-Funktionalität scheint nicht verfügbar zu sein, und selbst die Nutzung nur der Textfähigkeiten stellt Herausforderungen dar. Derzeit ist unklar, ob dies möglich sein wird.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

Entwickler verbrennt Opus-Token im Wert von 2.500 US-Dollar auf OpenClaw: Reale Workflows vs. Tools
Ein Software-Shop-Besitzer berichtet, wie er über OpenClaw 2.500 US-Dollar für Opus-Tokens ausgegeben hat, die er für Fehlerbehebungen, visuelle Automatisierung und Serververwaltung nutzt – aber er hinterfragt, was ein 'Workflow' eigentlich bedeutet.

Nicht-Entwickler baut Krypto-Risiko-API mit Claude an einem Nachmittag
Ein ehemaliger Futures-Händler ohne Entwicklungserfahrung nutzte Claude, um RiskSnap zu erstellen und bereitzustellen – einen FastAPI-Endpunkt, der Krypto-Portfolios in 7 Risikodimensionen bewertet. Das Projekt umfasst eine Live-API, eine eigene Domain und vollständige Dokumentation.

Linke Argumente für KI: Behinderung, chronische Krankheit und Klasse
Sean Goedecke argumentiert, dass LLMs linke Werte unterstützen, indem sie behinderten Menschen helfen, Patienten mit chronischen Krankheiten bei der Bewältigung medizinischer Hürden unterstützen und Klassen-Code-Switching zur bürokratischen Sprache ermöglichen.
OpenClaw Agents einfache MEMORY.md-Einrichtung schlägt die Laufzeit von Memory Startup im Temporal-Test
Die Runtime eines Memory-Startups lieferte in einem Temporal-Decision-Test die falsche Version zurück und erreichte für alle drei Versionen eine Relevanz von 1,000. Der OpenClaw-Agent des Nutzers, dessen Memory als Markdown in einem Git-Repository liegt, gab die aktuelle Entscheidung mit Datum zurück.