Qwen3.5 35B-A3B MoE는 중급 사양 하드웨어에서 27단계 에이전트 워크플로우를 로컬에서 실행합니다.

로컬 에이전트 워크플로우 데모
r/LocalLLaMA의 한 개발자가 Qwen3.5 35B-A3B MoE를 사용하여 복잡한 에이전트 워크플로우를 로컬에서 성공적으로 실행했다고 보고했습니다. 이 모델은 중급 사양 하드웨어에서 27단계 비디오 처리 체인을 자율적으로 실행했습니다.
워크플로우 상세
이 작업은 단일 자연어 프롬프트에서 비디오를 처리하는 것을 포함했습니다:
- 비디오 업로드
- Whisper로 자막 생성
- 자막 편집
- 커스텀 스타일로 비디오에 자막 입히기
워크플로우는 extract_audio, transcribe, read_file, edit_file, burn_subtitles 및 검증 단계를 포함한 27개의 순차적 도구 호출로 구성되었습니다. 모델은 각 단계를 계획, 실행, 검증하고 필요 시 자가 수정했습니다.
기술 사양
하드웨어:
- 레노버 ThinkPad P53 모바일 워크스테이션
- 인텔 i7-9850H 프로세서
- 쿼드로 RTX 3000 (6GB VRAM)
- 48GB DDR4 2666MT/s RAM
소프트웨어 스택:
- llama.cpp + whisper.cpp를 사용한 완전 로컬 구현
- 클라우드 API 미사용
모델 구성:
- Q4_K_M 양자화된 Qwen3.5 35B-A3B MoE
- 토큰당 약 30억 개의 활성 파라미터를 가진 MoE 아키텍처
- 레이어 오프로딩으로 6GB VRAM에 적합하고 실행 가능
- 전체 350억 파라미터 지식 베이스
성능 결과
전체 워크플로우는 약 10분 동안 실행되었으며, 대부분의 시간이 추론에 소요되었습니다. 개발자는 27단계 체인 동안 오류 없이 사람의 개입이 필요하지 않았다고 언급했습니다. MoE 아키텍처는 활성 파라미터 수를 낮게 유지하면서 전체 모델 능력을 유지함으로써 중급 하드웨어에서 이를 가능하게 했습니다.
이는 로컬 에이전트 워크플로우가 특히 속도를 위한 활성 파라미터 수와 능력을 위한 전체 파라미터 수를 균형 있게 조절하는 MoE 모델을 통해 소비자급 하드웨어에서 실용화되고 있음을 보여줍니다.
📖 Read the full source: r/LocalLLaMA
👀 See Also

MCP 도구와 Claude Code를 활용한 자동화된 리드 프로스펙팅
한 영업 전문가는 Claude Code를 MCP 도구와 연결해 사용하여 리드 조사 시간을 매일 2~3시간에서 30분으로 단축했다고 보고했습니다. 이 설정은 실제 데이터 소스를 쿼리하고, 강화 및 ICP 점수화가 적용된 구조화된 리드 목록을 반환합니다.

제한된 하드웨어에서 Claude Opus 4를 활용한 AI 오케스트레이션
2014년 Mac Mini에서 Claude API를 활용하여 복잡한 오케스트레이션 작업을 처리하는 추론 엔진으로 Claude Opus 4를 탐구합니다.

OpenClaw 에이전트로 구축된 자율 AI 뉴스레터
한 팀이 OpenClaw 에이전트를 사용하여 AI 에이전트에 관한 완전 자율 주행 뉴스레터를 구축했습니다. 이 시스템은 5개의 에이전트가 3대의 머신(AWS와 2대의 Mac Mini)에 분산되어 인간의 개입 없이 운영됩니다.

실시간 갈등 모니터, Claude API로 뉴스 영향력 분석
한 개발자가 Claude의 API를 활용해 100개 이상의 출처에서 분쟁 뉴스를 읽고, 주제/국가/심각도별로 분류하며, 영향력 점수(1-100)를 생성하고, 3줄짜리 스마트 요약을 만드는 자동화 파이프라인을 구축했습니다.