리눅스에서 vLLM, Claude Code 및 gpt-oss-120b를 사용한 로컬 멀티 에이전트 설정

한 개발자가 Windows에서 Linux로 전환한 후 완전히 로컬에서 병렬 멀티 에이전트 코딩 설정을 구축한 경험을 공유했습니다. 이 구성은 병렬 추론을 위해 vLLM을, 에이전트 오케스트레이션을 위해 Claude Code를, 코딩 작업을 위해 대규모 언어 모델을 사용합니다.
설정 구성 요소
- vLLM Docker 컨테이너: 쉬운 배포와 병렬 추론을 위해 사용됨
- Claude Code: 바이브 코딩과 에이전트 팀 오케스트레이션을 처리하며, 클라우드 제공업체 대신 vLLM 로컬호스트 엔드포인트를 가리키도록 구성됨
- gpt-oss:120b: 코딩 에이전트 역할을 수행
- RTX Pro 6000 Blackwell MaxQ: 작업 부하를 위한 주요 GPU
- 듀얼 부팅 Ubuntu: 운영 체제 설정
성능 및 워크플로우 개선
이 개발자는 이전에 Ollama와 LM Studio를 사용했지만, 요청을 순차적으로 처리하고 여러 메시지 턴과 도구 호출 후 속도 저하를 경험했습니다. vLLM을 사용하여 경험을 "터보차지"한 병렬 처리를 달성했습니다.
테스트에서 이 설정은 비디오 데모에서 보여준 대로 4개의 에이전트가 동시에 협업하는 것을 처리했으며, GPU는 지속적으로 8개의 에이전트를 병렬로 지원할 수 있었습니다. 유일하게 지적된 문제는 처리량 감소였으며, 이는 에이전트에 따라 다릅니다.
이전에 순차적으로 완료하는 데 몇 시간이 걸렸던 에이전트 팀 규모 작업은 이제 프로젝트 범위에 따라 약 30분 안에 완료할 수 있습니다. 이 개발자는 두 번째 MaxQ GPU를 추가하면 시스템이 수십 개의 에이전트를 동시에 처리하도록 확장될 수 있을 것으로 추정합니다.
이 병렬 접근 방식은 로컬에서 여러 프로젝트를 동시에 바이브 코딩할 수 있게 해주지만, 특정 시나리오에서는 약간의 지연 시간 증가를 초래할 수 있습니다. 이 개발자는 이 트레이드오프가 한 번에 하나의 에이전트로 프로젝트를 완료하는 것보다 선호된다고 판단했습니다.
📖 Read the full source: r/LocalLLaMA
👀 See Also

Kepler, 재무 서비스를 위한 검증 가능한 AI 구축: 2,600만 개 이상의 서류 인덱싱, 감사 대비 답변 제공
Kepler의 플랫폼은 14,000개 이상의 기업에서 2,600만 건 이상의 SEC 제출 문서를 색인하고, Claude를 사용한 다단계 추론과 결정론적 검증 계층을 통해 모든 출력이 원본 문서에 연결되도록 보장합니다.

VibecodedHub: 클로드 코드로 완전히 구축된 발견 플랫폼
한 개발자가 Claude Code를 주요 엔지니어로 사용하여 여러 집중 세션을 거쳐 AI로 구축된 프로젝트를 위한 발견 및 런치 플랫폼인 VibecodedHub를 구축했습니다. 이 플랫폼에는 랜딩 페이지, 인증 시스템, 피드, 프로젝트 제출 기능, Stripe 통합, 관리자 패널, SEO 및 OG 이미지가 포함되어 있습니다.

다중 AI 에이전트 조율: 디스코드, 크론 잡, 명확한 위계 구조
개발자가 세 개의 OpenClaw 에이전트를 운영하면서 Discord를 공유 커뮤니케이션 채널로 사용하여 조정 문제를 해결했습니다. Paperclip의 고비용 하트비트 시스템을 에이전트별 cron 작업으로 대체하고, Claude Max와 OpenAI 모델 간에 명확한 리더십 계층을 구축했습니다.

커뮤니티에서 공유된 실용적인 OpenClaw 활용 사례
개발자와 팀들은 OpenClaw를 콜드 아웃리치, SEO 콘텐츠 자동화, 소셜 미디어 관리, 고객 데이터 쿼리, 웹사이트 테스트, 서버 모니터링, 영수증 처리, 자동차 구매 협상, 팟캐스트 챕터 생성, 일일 목표 계획 수립에 활용하고 있습니다.