수정된 vLLM 0.17.0이 Tesla P40에서 Qwen3 ASR 1.7B로 실시간 음성 인식을 실행합니다.

개발자가 vLLM 0.17.0을 성공적으로 수정하여 Tesla P40 GPU에서 실행할 수 있게 했으며, Qwen3 ASR 1.7B 모델을 활용한 실시간 강의 녹취가 가능해졌습니다. P40은 일반적으로 최신 추론 엔진을 지원하지 않는 Pascal 아키텍처를 사용합니다.
주요 세부사항
이 개발자는 실시간 강의 녹취를 위한 개인 프로젝트를 진행 중이었습니다. 처음에는 Qwen3 ASR 1.7B 모델을 사용할 계획이었지만, 진정한 실시간 녹취는 vLLM을 통해서만 지원된다는 사실을 발견했습니다. 오디오 샘플을 청크로 나누는 대안 대신, 실험적인 수정을 시도했습니다.
Codex를 사용하여 vLLM을 Pascal 아키텍처에서 실행되도록 수정했습니다. 이를 통해 Tesla P40 서버 GPU에서 Qwen3 ASR 1.7B 모델을 실행할 수 있게 되었습니다. 결과는 거의 완벽한 하드웨어 가속과 완전한 실시간 녹취였습니다.
수정된 vLLM 포크는 다음에서 이용 가능합니다: https://github.com/uaysk/vllm-pascal
다음 단계와 과제
개발자의 다음 목표는 이 설정에서 Qwen3.5 모델을 실행해 보는 것입니다. 그러나 여러 기술적 문제가 있습니다. 비전 기능은 사용할 수 없는 것으로 보이며, 텍스트 기능만 사용하는 것도 어려움이 있습니다. 현재로서는 가능할지 여부를 확신하지 못하고 있습니다.
📖 전체 출처 읽기: r/LocalLLaMA
👀 See Also

개발자, 클로드 코드로 마인크래프트 런처 제작
20년 이상의 경력을 가진 개발자가 Claude Code를 사용하여 BlockHaven Launcher를 만들었습니다. 이는 Microsoft 인증, Modrinth 모드 탐색, 격리된 멀티 인스턴스 프로필을 갖춘 Electron 기반의 Minecraft 런처입니다. 이 프로젝트는 MIT 라이선스로 오픈소스입니다.

AI 에이전트 로직을 YAML로 옮기기: Telegram, VS Code, CLI에서 실행하기
한 개발자가 AI 에이전트 비즈니스 로직을 OpenClaw에서 YAML 파일로 옮기고, OE Runtime을 HTTP 서버로 사용합니다. 동일한 agent.yaml이 이제 Telegram, VS Code, CLI, HTTP에서 중복 없이 실행됩니다.

제한된 하드웨어에서 Claude Opus 4를 활용한 AI 오케스트레이션
2014년 Mac Mini에서 Claude API를 활용하여 복잡한 오케스트레이션 작업을 처리하는 추론 엔진으로 Claude Opus 4를 탐구합니다.

오픈클로로 이커머스 AI 에이전트 구축에서 얻은 실용적인 교훈
한 개발자가 OpenClaw로 전자상거래 AI 에이전트를 100시간 이상 구축한 후 구체적인 인프라, 보안 및 워크플로우 통찰을 공유합니다. 여기에는 Digital Ocean의 VPS 설정(월 $24), Kimi K2.5 및 Gemini Flash를 통한 모델 비용 관리, 그리고 메모리 아키텍처 권장 사항이 포함됩니다.