O vLLM 0.17.0 modificado roda em Tesla P40 para transcrição em tempo real com Qwen3 ASR 1.7B

✍️ OpenClawRadar📅 Publicado: March 9, 2026🔗 Source
O vLLM 0.17.0 modificado roda em Tesla P40 para transcrição em tempo real com Qwen3 ASR 1.7B
Ad

Um desenvolvedor modificou com sucesso o vLLM 0.17.0 para rodar em GPUs Tesla P40, permitindo transcrição de aulas em tempo real com o modelo Qwen3 ASR 1.7B. A P40 usa a arquitetura Pascal, que normalmente não tem suporte para mecanismos de inferência mais recentes.

Detalhes Principais

O desenvolvedor estava trabalhando em um projeto pessoal para transcrição de aulas em tempo real. Inicialmente, planejava usar o modelo Qwen3 ASR 1.7B, mas descobriu que a transcrição verdadeiramente em tempo real só é suportada através do vLLM. Em vez de dividir amostras de áudio como alternativa, tentou uma modificação experimental.

Usando Codex, modificou o vLLM para rodar na arquitetura Pascal. Isso permitiu executar o modelo Qwen3 ASR 1.7B em sua GPU de servidor Tesla P40. O resultado foi aceleração de hardware quase completa e transcrição totalmente em tempo real.

A versão modificada do vLLM está disponível em: https://github.com/uaysk/vllm-pascal

Ad

Próximos Passos e Desafios

O próximo objetivo do desenvolvedor é tentar executar modelos Qwen3.5 nesta configuração. No entanto, ele observa vários problemas técnicos. A funcionalidade de visão parece indisponível, e mesmo usar apenas as capacidades de texto apresenta desafios. Neste momento, ele não tem certeza se será possível.

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also

O usuário do OpenClaw muda de configurações complexas de agentes para automação prática, economiza 8 a 10 horas por semana
Use Cases

O usuário do OpenClaw muda de configurações complexas de agentes para automação prática, economiza 8 a 10 horas por semana

Um desenvolvedor que executou o OpenClaw por um mês abandonou sistemas multiagentes elaborados e focou na automação do gerenciamento de sites através do GitHub. A configuração agora produz 30 posts em 4 semanas, reduzindo o trabalho semanal de 8-10 horas para cerca de 20 minutos diários para revisão.

OpenClawRadar
Executando uma Equipe de Startup Multi-Agente no OpenClaw: Configuração e Padrões
Use Cases

Executando uma Equipe de Startup Multi-Agente no OpenClaw: Configuração e Padrões

A equipe noHuman criou uma interface web que implanta configurações multiagente do OpenClaw com modelos de equipe pré-construídos, isolando cada agente em seu próprio computador virtual com um navegador. Eles usam um retransmissor HTTP simples para comunicação entre agentes e mantêm limites de função para trabalho focado.

OpenClawRadar
OpenClaw Orquestra Sistema de ReleaseOps Empresarial para Aplicativo Multiplataforma
Use Cases

OpenClaw Orquestra Sistema de ReleaseOps Empresarial para Aplicativo Multiplataforma

Um desenvolvedor criou um sistema de ReleaseOps semi-automatizado usando OpenClaw para gerenciar processos de QA para um aplicativo com quase 1 milhão de usuários nas plataformas Web, iOS, Android e TV. O sistema automatiza o gerenciamento de tickets, saídas de logs de scripts de teste e integra tudo usando GPT-4 mini.

OpenClawRadar
Adicionando uma camada leve de navegador ao OpenClaw em VPS headless
Use Cases

Adicionando uma camada leve de navegador ao OpenClaw em VPS headless

Um desenvolvedor compartilha sua abordagem para lidar com sites que precisam de mais do que apenas navegação headless pura, adicionando um ambiente de navegador visual mínimo apenas quando necessário, mantendo o VPS headless por padrão e reutilizando perfis de navegador persistentes.

OpenClawRadar