Модифицированный vLLM 0.17.0 работает на Tesla P40 для транскрипции в реальном времени с использованием Qwen3 ASR 1.7B.

Разработчик успешно модифицировал vLLM 0.17.0 для работы на графических процессорах Tesla P40, что позволило осуществлять транскрипцию лекций в реальном времени с использованием модели Qwen3 ASR 1.7B. P40 использует архитектуру Pascal, которая обычно не поддерживается более новыми механизмами вывода.
Ключевые детали
Разработчик работал над личным проектом по транскрипции лекций в реальном времени. Изначально он планировал использовать модель Qwen3 ASR 1.7B, но обнаружил, что настоящая транскрипция в реальном времени поддерживается только через vLLM. Вместо использования альтернативы с разбиением аудиосэмплов, он попробовал экспериментальную модификацию.
С помощью Codex он модифицировал vLLM для работы на архитектуре Pascal. Это позволило ему запустить модель Qwen3 ASR 1.7B на своём серверном GPU Tesla P40. Результатом стало почти полное аппаратное ускорение и полностью реальное время транскрипции.
Модифицированный форк vLLM доступен по адресу: https://github.com/uaysk/vllm-pascal
Следующие шаги и проблемы
Следующая цель разработчика — попробовать запустить модели Qwen3.5 на этой конфигурации. Однако он отмечает несколько технических проблем. Функциональность зрения, по-видимому, недоступна, и даже использование только текстовых возможностей представляет сложности. На данный момент он не уверен, будет ли это возможно.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

Claude Code использовался для реверс-инжиниринга Disney Infinity 1.0, преодолев 13-летнее ограничение на персонажей.
Разработчик использовал Claude Code (Opus 4.6 с высоким уровнем рассуждений) для обратного проектирования игрового бинарного файла Disney Infinity 1.0, выявив и исправив 13 точек проверки, которые не позволяли персонажам играть в любом наборе. Решение потребовало 17 бинарных патчей и 3 изменённых файлов данных, решив проблему, которую сообщество моддеров не могло решить более десяти лет.

Пользователь OpenClaw сообщает о значительных улучшениях после перехода на аутентификацию OpenAI OAuth с использованием GPT-4.
Разработчик, испытывавший трудности с моделями Kimi k2.5 и Minimax2.7 в OpenClaw, перешёл на OAuth-подключение OpenAI с GPT-4 и адаптивным мышлением, сообщив о немедленном улучшении стабильности и выполнении нескольких задач автоматизации за 4-5 часов.

Недооцененная сила Claude Code: Навигация по кодовой базе вместо генерации кода
Разработчик сообщает, что после месяцев использования Claude Code в качестве основного инструмента разработки, наибольший прирост производительности достигается благодаря его способности читать и перекрестно ссылаться на целые кодовые базы быстрее, чем grep, что позволяет быстро понимать потоки данных и отлаживать код.

Перестройка веб-сайта с использованием Claude Code, Strapi и GCP Cloud Run
Разработчик перестроил свой сайт Lovable с использованием Claude Code, Strapi в качестве headless CMS и GCP Cloud Run для развертывания. Проект использовал пользовательские навыки для дизайна, автоматизации и контент-пайплайнов, что позволило уйти от ограничений кредитной системы Lovable.