OpenClaw를 위한 2x 개조 2080 Ti에서의 로컬 vLLM 호스팅: 실제 경험

Reddit 사용자가 r/openclaw에서 두 개의 개조된 22GB 2080 Ti GPU(Alibaba에서 구매)를 NVLink로 연결하고 Ollama 대신 vLLM을 실행하여 텐서 병렬 처리를 활용한 로컬 AI 호스팅 설정을 설명합니다. 이들은 20-30B 파라미터 모델을 목표로 하며, 가벼운 코딩 작업, 홈랩 유지 관리, RAG, 이메일 분류, 문서 작성에 적합한 모델을 커뮤니티에 추천받고 있습니다. 무거운 코딩 작업은 Codex OAuth 서비스에 위임합니다.
게시글의 주요 내용:
- 하드웨어: Alibaba에서 구매한 2x 22GB(개조) 2080 Ti(아마 채굴 카드였을 가능성 높음). NVLink 브리지로 연결.
- 소프트웨어: 두 GPU 간 텐서 병렬 처리를 명시적으로 활용하기 위해 Ollama 대신 vLLM 선택.
- 목표: OpenClaw를 위해 20-30B 파라미터 범위의 로컬 모델 실행. 작업에는 가벼운 코딩, 홈랩 관리, RAG, 이메일 분류, 문서 생성 포함.
- 사용자가 후회감을 표현하며 검증 또는 실용적인 모델 제안을 구함.
아래 링크된 커뮤니티 토론에서는 유사한 설정에 대한 직접 경험, 모델 추천(예: CodeLlama, DeepSeek Coder 또는 Mixtral 8x7B와 같은 범용 모델), vLLM의 메모리 최적화 및 프롬프트 엔지니어링 팁이 제공됩니다. 일부 댓글 작성자는 개조된 GPU의 신뢰성에 주의를 주며 먼저 소형 모델로 테스트할 것을 권장합니다.
📖 전체 소스 읽기: r/openclaw
👀 See Also

OpenClaw로 직접 모바일 문서 수집: iOS에서 Raspberry Pi로의 건강 워크플로우
한 개발자가 iOS 모바일 클라이언트에서 Raspberry Pi의 로컬 OpenClaw 인스턴스로 문서를 직접 푸시하는 아키텍처를 공유합니다. QR 기반 페어링과 건강 기록 처리를 위한 전용 엔드포인트를 사용합니다.

iOS 앱, 비엔지니어가 Claude 코드로 완전히 제작, 앱 스토어 출시 성공
iOS 개발 경험이 없는 제품 매니저가 Claude Code로 완전히 구축된 사진 정렬 앱 SpectraSort를 출시했습니다. 이 앱은 품질 순위 및 개인 취향 학습을 위해 온디바이스 AI를 사용하며, Neural Engine에서 초당 약 10장의 사진을 처리합니다.
로컬 vs VPS OpenClaw 배포: AI 코딩 에이전트를 위한 실질적 차이점
OpenClaw를 로컬에서 실행하면 기존 로그인 세션과 로컬 파일 접근이 가능한 실제 브라우저 접근이 제공되는 반면, VPS 배포는 기본 작업으로 기능이 제한되고 웹사이트 제한에 직면합니다.

Claude Haiku를 게이트키퍼로 활용하여 Sonnet API 비용을 80% 절감하기
한 개발자가 Claude Haiku를 사용해 비정형 텍스트의 85%를 걸러내는 2단계 파이프라인을 구축했습니다. 이로 인해 관련 콘텐츠만 Claude Sonnet으로 전송되어 수천 개의 댓글을 처리할 때 API 비용이 약 80% 절감되었습니다.