Модифицированный vLLM 0.17.0 работает на Tesla P40 для транскрипции в реальном времени с использованием Qwen3 ASR 1.7B.

Разработчик успешно модифицировал vLLM 0.17.0 для работы на графических процессорах Tesla P40, что позволило осуществлять транскрипцию лекций в реальном времени с использованием модели Qwen3 ASR 1.7B. P40 использует архитектуру Pascal, которая обычно не поддерживается более новыми механизмами вывода.
Ключевые детали
Разработчик работал над личным проектом по транскрипции лекций в реальном времени. Изначально он планировал использовать модель Qwen3 ASR 1.7B, но обнаружил, что настоящая транскрипция в реальном времени поддерживается только через vLLM. Вместо использования альтернативы с разбиением аудиосэмплов, он попробовал экспериментальную модификацию.
С помощью Codex он модифицировал vLLM для работы на архитектуре Pascal. Это позволило ему запустить модель Qwen3 ASR 1.7B на своём серверном GPU Tesla P40. Результатом стало почти полное аппаратное ускорение и полностью реальное время транскрипции.
Модифицированный форк vLLM доступен по адресу: https://github.com/uaysk/vllm-pascal
Следующие шаги и проблемы
Следующая цель разработчика — попробовать запустить модели Qwen3.5 на этой конфигурации. Однако он отмечает несколько технических проблем. Функциональность зрения, по-видимому, недоступна, и даже использование только текстовых возможностей представляет сложности. На данный момент он не уверен, будет ли это возможно.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

Использование бота SkyClaw от OpenClaw для отслеживания личных расходов через Discord и Google Таблицы.
Пользователь описывает использование SkyClaw, облачного бота на базе OpenClaw, для записи расходов через сообщения в Discord и изображения чеков, которые автоматически добавляются в Google Таблицу без необходимости доступа к конфиденциальным личным аккаунтам.

Генерация лидов и автоматизация CRM с OpenClaw

Настройка управления проектами в файловой системе для не-программиста в Claude Desktop
Пользователь Reddit делится своей системой использования функций Claude Chat with Filesystem и Cowork для управления несколькими долгосрочными проектами. Настройка использует стандартизированную структуру каталогов с WORKFLOW.txt в качестве точки входа и включает конкретные инструкции по проекту для поддержания непрерывности между сессиями.

Кейс: Использование нескольких ИИ-агентов для создания производственной библиотеки на C++
Разработчик задокументировал многомесячный процесс использования четырех ИИ-агентов (Claude, ChatGPT, Gemini, Grok) с различными ролями для создания FAT-P — библиотеки на C++20, состоящей только из заголовочных файлов (107 заголовков) и не имеющей внешних зависимостей. Система включала перекрестную проверку, управляющие документы, написанные ИИ, и трекер штрафных баллов для фиксации типовых ошибок.