Qwen3.5 35B-A3B MoE는 중급 사양 하드웨어에서 27단계 에이전트 워크플로우를 로컬에서 실행합니다.

✍️ OpenClawRadar📅 게시일: March 25, 2026🔗 Source
Qwen3.5 35B-A3B MoE는 중급 사양 하드웨어에서 27단계 에이전트 워크플로우를 로컬에서 실행합니다.
Ad

로컬 에이전트 워크플로우 데모

r/LocalLLaMA의 한 개발자가 Qwen3.5 35B-A3B MoE를 사용하여 복잡한 에이전트 워크플로우를 로컬에서 성공적으로 실행했다고 보고했습니다. 이 모델은 중급 사양 하드웨어에서 27단계 비디오 처리 체인을 자율적으로 실행했습니다.

워크플로우 상세

이 작업은 단일 자연어 프롬프트에서 비디오를 처리하는 것을 포함했습니다:

  • 비디오 업로드
  • Whisper로 자막 생성
  • 자막 편집
  • 커스텀 스타일로 비디오에 자막 입히기

워크플로우는 extract_audio, transcribe, read_file, edit_file, burn_subtitles 및 검증 단계를 포함한 27개의 순차적 도구 호출로 구성되었습니다. 모델은 각 단계를 계획, 실행, 검증하고 필요 시 자가 수정했습니다.

Ad

기술 사양

하드웨어:

  • 레노버 ThinkPad P53 모바일 워크스테이션
  • 인텔 i7-9850H 프로세서
  • 쿼드로 RTX 3000 (6GB VRAM)
  • 48GB DDR4 2666MT/s RAM

소프트웨어 스택:

  • llama.cpp + whisper.cpp를 사용한 완전 로컬 구현
  • 클라우드 API 미사용

모델 구성:

  • Q4_K_M 양자화된 Qwen3.5 35B-A3B MoE
  • 토큰당 약 30억 개의 활성 파라미터를 가진 MoE 아키텍처
  • 레이어 오프로딩으로 6GB VRAM에 적합하고 실행 가능
  • 전체 350억 파라미터 지식 베이스

성능 결과

전체 워크플로우는 약 10분 동안 실행되었으며, 대부분의 시간이 추론에 소요되었습니다. 개발자는 27단계 체인 동안 오류 없이 사람의 개입이 필요하지 않았다고 언급했습니다. MoE 아키텍처는 활성 파라미터 수를 낮게 유지하면서 전체 모델 능력을 유지함으로써 중급 하드웨어에서 이를 가능하게 했습니다.

이는 로컬 에이전트 워크플로우가 특히 속도를 위한 활성 파라미터 수와 능력을 위한 전체 파라미터 수를 균형 있게 조절하는 MoE 모델을 통해 소비자급 하드웨어에서 실용화되고 있음을 보여줍니다.

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also