매쉬 LLM: 이로에서 분산 AI 컴퓨팅 – 자신의 GPU에서 LLM 실행하기

✍️ OpenClawRadar📅 게시일: July 12, 2026🔗 Source
Ad

Mesh LLM은 여러 머신의 GPU와 메모리를 풀링하여 전체를 http://localhost:9337/v1에서 하나의 OpenAI 호환 API로 노출하는 분산 AI 컴퓨팅 플랫폼입니다. 하나의 노드로 시작하고 나중에 추가할 수 있으며, 메시가 모델을 로컬에서 실행할지, 이미 로드한 피어로 라우팅할지, 여러 머신에 분할할지 결정합니다.

작동 방식

내부적으로 Mesh LLM은 식별(공개 키) 및 네트워킹을 위해 iroh 엔드포인트를 사용합니다. 중앙 서버는 없습니다. iroh는 QUIC 연결을 통해 NAT 트래버설, 홀 펀칭 및 릴레이 폴백을 처리합니다. 프로토콜은 세 가지 ALPN을 정의합니다:

  • mesh-llm/1 – 주요 메시 (가십, 라우팅, HTTP 터널, 플러그인 채널)
  • mesh-llm-control/1 – 소유자 제어 평면 (구성 동기화, 소유권 증명)
  • skippy-stage/2 – 분할 모델을 위한 지연 시간에 민감한 활성화 전송

주 연결 내에서 모든 통신은 단일 선행 바이트로 태그된 양방향 QUIC 스트림을 통해 다중화됩니다:

  • 0x01 GOSSIP – 피어 알림 (모델, GPU, RTT, 기능)
  • 0x04 TUNNEL_HTTP – 피어로 프록시된 추론 요청
  • 0x05 ROUTE_REQUEST – 피어가 호스팅하는 모델 쿼리
  • 0x06 PEER_DOWN – 죽은 피어 알림
  • 0x07 PEER_LEAVING – 정상 종료
  • 0x08 PLUGIN_CHANNEL – 플러그인 RPC
  • 0x0e DIRECT_PATH_REQUEST – NAT 트래버설을 위한 직접 주소 공유
Ad

분할 모드 ("Skippy")

단일 GPU에 너무 큰 모델(예: 235B mixture-of-experts)의 경우 Mesh LLM은 레이어 범위로 모델을 스테이지로 분할하는 분할 모드를 제공합니다. 레이어 0–15는 한 노드에서 실행되고, 16–31은 다음 노드에서 실행됩니다. 활성화는 QUIC 스트림을 통해 한 스테이지에서 다음 스테이지로 흐릅니다. 여러 대의 modest한 머신이 함께 단독으로는 담을 수 없는 모델을 실행할 수 있습니다.

플러그 가능한 아키텍처

플러그인은 매니페스트에서 기능을 선언합니다. 런타임이 이를 시작하고, 호출을 라우팅하며, MCP, HTTP, 추론 및 메시 이벤트를 통해 기능을 노출합니다. 카탈로그에는 노트북에 맞는 5억 매개변수 모델부터 235B 거대 모델까지 40개 이상의 모델이 포함되어 있습니다.

대상 사용자

자체 AI 인프라를 제어하려는 팀: GPU 컴퓨팅을 비공개 또는 공개로 공유하고, 더 큰 하드웨어를 구매하지 않고 더 큰 모델을 실행하며, 벤더 종속을 피하려는 팀. 모든 OpenAI 클라이언트는 localhost:9337을 가리키고 실제 작업이 어디서 이루어지는지 신경 쓸 필요가 없습니다.

📖 전체 소스 읽기: HN LLM Tools

Ad

👀 See Also

오픈소스 도구, 로컬 데이터 분석으로 AI 코딩 에이전트 자율성 측정
Tools

오픈소스 도구, 로컬 데이터 분석으로 AI 코딩 에이전트 자율성 측정

Codelens-AI는 Claude Code 세션 파일을 git 기록과 함께 분석하여 자율성 지표(예: 오토파일럿 비율, 자가 치유 점수)를 계산하는 오픈소스 CLI 도구입니다. 이 도구는 npx claude-roi를 사용하여 설정 없이 로컬에서 실행되며 모든 데이터를 사용자의 기기에 보관합니다.

OpenClawRadar
TigrimOS v1.1.0과 Tiger CoWork v0.5.0이 원격 에이전트 군집 및 구성 가능 거버넌스 기능과 함께 출시되었습니다.
Tools

TigrimOS v1.1.0과 Tiger CoWork v0.5.0이 원격 에이전트 군집 및 구성 가능 거버넌스 기능과 함께 출시되었습니다.

오늘 출시된 TigrimOS v1.1.0과 Tiger CoWork v0.5.0은 원격 인스턴스 간의 스웜 대 스웜 통신과 다섯 가지 구성 가능한 거버넌스 프로토콜을 추가했습니다. 두 제품 모두 셀프 호스팅, 무료, 오픈 소스입니다.

OpenClawRadar
XLI: Claude 코드 스타일 터미널 UI를 위한 오픈소스 파이썬 라이브러리
Tools

XLI: Claude 코드 스타일 터미널 UI를 위한 오픈소스 파이썬 라이브러리

코딩 에이전트를 만들고 계신가요? 터미널 UX가 작업의 절반입니다. XLI는 Claude Code의 스트리밍 마크다운, 툴 카드, 인라인 승인, 슬래시 명령을 복제하는 오픈소스 Python 렌더링 엔진으로, 터미널 스크롤백을 방해하지 않습니다.

OpenClawRadar
개발자가 로컬 Whisper와 Coqui-TTS 서버로 1초 미만의 STT/TTS 지연 시간 달성
Tools

개발자가 로컬 Whisper와 Coqui-TTS 서버로 1초 미만의 STT/TTS 지연 시간 달성

한 개발자가 Whisper STT와 Coqui TTS를 위한 로컬 서버 구현체를 오픈소스로 공개했으며, 약 0.2초의 음성-텍스트 변환과 약 250ms의 텍스트-음성 변환 지연 시간을 달성해 클라우드 의존 없이 대화형 AI 에이전트를 가능하게 했습니다.

OpenClawRadar