O vLLM 0.17.0 modificado roda em Tesla P40 para transcrição em tempo real com Qwen3 ASR 1.7B

✍️ OpenClawRadar📅 Publicado: March 9, 2026🔗 Source
O vLLM 0.17.0 modificado roda em Tesla P40 para transcrição em tempo real com Qwen3 ASR 1.7B
Ad

Um desenvolvedor modificou com sucesso o vLLM 0.17.0 para rodar em GPUs Tesla P40, permitindo transcrição de aulas em tempo real com o modelo Qwen3 ASR 1.7B. A P40 usa a arquitetura Pascal, que normalmente não tem suporte para mecanismos de inferência mais recentes.

Detalhes Principais

O desenvolvedor estava trabalhando em um projeto pessoal para transcrição de aulas em tempo real. Inicialmente, planejava usar o modelo Qwen3 ASR 1.7B, mas descobriu que a transcrição verdadeiramente em tempo real só é suportada através do vLLM. Em vez de dividir amostras de áudio como alternativa, tentou uma modificação experimental.

Usando Codex, modificou o vLLM para rodar na arquitetura Pascal. Isso permitiu executar o modelo Qwen3 ASR 1.7B em sua GPU de servidor Tesla P40. O resultado foi aceleração de hardware quase completa e transcrição totalmente em tempo real.

A versão modificada do vLLM está disponível em: https://github.com/uaysk/vllm-pascal

Ad

Próximos Passos e Desafios

O próximo objetivo do desenvolvedor é tentar executar modelos Qwen3.5 nesta configuração. No entanto, ele observa vários problemas técnicos. A funcionalidade de visão parece indisponível, e mesmo usar apenas as capacidades de texto apresenta desafios. Neste momento, ele não tem certeza se será possível.

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also

Executando OpenClaw 24/7: Arquitetura Prática para Agentes Autônomos Persistentes
Use Cases

Executando OpenClaw 24/7: Arquitetura Prática para Agentes Autônomos Persistentes

Um desenvolvedor compartilha soluções testadas para executar o OpenClaw como um servidor 24/7 com tarefas cron, incluindo arquivos de memória divididos por tópico, gerenciamento agressivo do ciclo de vida da sessão, poda de contexto com marcadores de recuperação e ferramentas wrapper para armazenamento estruturado e recuperação de falhas.

OpenClawRadar
Transforme seu Briefing do OpenClaw em um Feed de Podcast para Apple Podcasts
Use Cases

Transforme seu Briefing do OpenClaw em um Feed de Podcast para Apple Podcasts

Um usuário do Reddit compartilha um fluxo de trabalho simples para converter a saída do briefing matinal do OpenClaw em um feed de podcast: converter o texto em áudio (TTS), hospedar o MP3, anexar ao XML do RSS e assinar no Apple Podcasts.

OpenClawRadar
OpenClaw e Chorus: Um Pipeline de Produto Construído por Dois Humanos e Agentes de IA em Uma Semana
Use Cases

OpenClaw e Chorus: Um Pipeline de Produto Construído por Dois Humanos e Agentes de IA em Uma Semana

OpenClaw e Chorus se combinam para criar um pipeline de desenvolvimento de produtos onde agentes de IA lidam com pesquisa, gerenciamento de produtos e programação, enquanto humanos propõem ideias e aprovam trabalhos. O sistema foi construído em menos de uma semana por duas pessoas com empregos em tempo integral usando OpenClaw como um agente persistente de gerente de produto.

OpenClawRadar
Caso de depuração do Claude: O agente falhou silenciosamente devido a um parâmetro ausente, o enquadramento importou mais do que o modelo
Use Cases

Caso de depuração do Claude: O agente falhou silenciosamente devido a um parâmetro ausente, o enquadramento importou mais do que o modelo

Um desenvolvedor usou o Claude para criar um agente de calendário, depois passou 40 minutos fazendo o Claude depurá-lo antes de perceber que a ferramenta write_calendar não tinha um parâmetro de participantes. Quando recebeu o contexto completo, o Claude identificou o problema em 10 segundos.

OpenClawRadar