매쉬 LLM: 이로에서 분산 AI 컴퓨팅 – 자신의 GPU에서 LLM 실행하기

✍️ OpenClawRadar📅 게시일: July 12, 2026🔗 Source
Ad

Mesh LLM은 여러 머신의 GPU와 메모리를 풀링하여 전체를 http://localhost:9337/v1에서 하나의 OpenAI 호환 API로 노출하는 분산 AI 컴퓨팅 플랫폼입니다. 하나의 노드로 시작하고 나중에 추가할 수 있으며, 메시가 모델을 로컬에서 실행할지, 이미 로드한 피어로 라우팅할지, 여러 머신에 분할할지 결정합니다.

작동 방식

내부적으로 Mesh LLM은 식별(공개 키) 및 네트워킹을 위해 iroh 엔드포인트를 사용합니다. 중앙 서버는 없습니다. iroh는 QUIC 연결을 통해 NAT 트래버설, 홀 펀칭 및 릴레이 폴백을 처리합니다. 프로토콜은 세 가지 ALPN을 정의합니다:

  • mesh-llm/1 – 주요 메시 (가십, 라우팅, HTTP 터널, 플러그인 채널)
  • mesh-llm-control/1 – 소유자 제어 평면 (구성 동기화, 소유권 증명)
  • skippy-stage/2 – 분할 모델을 위한 지연 시간에 민감한 활성화 전송

주 연결 내에서 모든 통신은 단일 선행 바이트로 태그된 양방향 QUIC 스트림을 통해 다중화됩니다:

  • 0x01 GOSSIP – 피어 알림 (모델, GPU, RTT, 기능)
  • 0x04 TUNNEL_HTTP – 피어로 프록시된 추론 요청
  • 0x05 ROUTE_REQUEST – 피어가 호스팅하는 모델 쿼리
  • 0x06 PEER_DOWN – 죽은 피어 알림
  • 0x07 PEER_LEAVING – 정상 종료
  • 0x08 PLUGIN_CHANNEL – 플러그인 RPC
  • 0x0e DIRECT_PATH_REQUEST – NAT 트래버설을 위한 직접 주소 공유
Ad

분할 모드 ("Skippy")

단일 GPU에 너무 큰 모델(예: 235B mixture-of-experts)의 경우 Mesh LLM은 레이어 범위로 모델을 스테이지로 분할하는 분할 모드를 제공합니다. 레이어 0–15는 한 노드에서 실행되고, 16–31은 다음 노드에서 실행됩니다. 활성화는 QUIC 스트림을 통해 한 스테이지에서 다음 스테이지로 흐릅니다. 여러 대의 modest한 머신이 함께 단독으로는 담을 수 없는 모델을 실행할 수 있습니다.

플러그 가능한 아키텍처

플러그인은 매니페스트에서 기능을 선언합니다. 런타임이 이를 시작하고, 호출을 라우팅하며, MCP, HTTP, 추론 및 메시 이벤트를 통해 기능을 노출합니다. 카탈로그에는 노트북에 맞는 5억 매개변수 모델부터 235B 거대 모델까지 40개 이상의 모델이 포함되어 있습니다.

대상 사용자

자체 AI 인프라를 제어하려는 팀: GPU 컴퓨팅을 비공개 또는 공개로 공유하고, 더 큰 하드웨어를 구매하지 않고 더 큰 모델을 실행하며, 벤더 종속을 피하려는 팀. 모든 OpenAI 클라이언트는 localhost:9337을 가리키고 실제 작업이 어디서 이루어지는지 신경 쓸 필요가 없습니다.

📖 전체 소스 읽기: HN LLM Tools

Ad

👀 See Also

LM Studio 파서 버그로 인해 Qwen3.5 도구 호출 및 추론 기능이 중단됩니다
Tools

LM Studio 파서 버그로 인해 Qwen3.5 도구 호출 및 추론 기능이 중단됩니다

LM Studio의 서버 파서에는 도구 호출을 자동으로 중단시키고, 추론 출력을 손상시키며, 모델을 실제보다 더 나쁘게 보이게 만드는 세 가지 상호작용하는 버그가 있습니다. 이러한 문제는 Qwen3.5 및 DeepSeek-R1과 같은 추론 모델에 영향을 미치며, 1년 이상 전에 보고된 버그 하나는 아직 해결되지 않았습니다.

OpenClawRadar
스캐폴드 프레임워크, 클로드 코드 메모리 및 워크플로우 문제 해결
Tools

스캐폴드 프레임워크, 클로드 코드 메모리 및 워크플로우 문제 해결

Scaffold는 지속적 메모리, 결정 강제, 워크플로우 게이트를 제공하는 Claude Code용 17가지 스킬 프레임워크입니다. 토큰 절약을 위한 3계층 모델 라우팅 시스템을 사용하며 Claude Code 플러그인 메뉴를 통해 설치할 수 있습니다.

OpenClawRadar
홈랩 AI 센티널: LLM 통합 자체 호스팅 모니터링 어시스턴트
Tools

홈랩 AI 센티널: LLM 통합 자체 호스팅 모니터링 어시스턴트

Homelab AI Sentinel은 LLM을 통해 모니터링 웹훅을 처리하여 일반 영어로 된 진단을 생성하는 자체 호스팅 도구입니다. 11개의 경고 소스, 10개의 알림 플랫폼을 지원하며, Ollama 및 LM Studio를 포함한 모든 OpenAI 호환 엔드포인트와 함께 작동하여 로컬 추론이 가능합니다.

OpenClawRadar
무료 macOS 메뉴 바 앱, SQLite 쿠키 복호화를 통해 실시간 클로드 사용 통계 표시
Tools

무료 macOS 메뉴 바 앱, SQLite 쿠키 복호화를 통해 실시간 클로드 사용 통계 표시

Claude Usage Tracker는 무료 macOS 메뉴 막대 앱으로, Claude 데스크톱 앱의 암호화된 SQLite 쿠키를 읽고 Keychain을 통해 복호화하여 세션 %, 주간 한도, 지출 및 루틴 실행을 로컬에서 표시합니다. API 키가 필요하지 않습니다.

OpenClawRadar