매쉬 LLM: 이로에서 분산 AI 컴퓨팅 – 자신의 GPU에서 LLM 실행하기
Mesh LLM은 여러 머신의 GPU와 메모리를 풀링하여 전체를 http://localhost:9337/v1에서 하나의 OpenAI 호환 API로 노출하는 분산 AI 컴퓨팅 플랫폼입니다. 하나의 노드로 시작하고 나중에 추가할 수 있으며, 메시가 모델을 로컬에서 실행할지, 이미 로드한 피어로 라우팅할지, 여러 머신에 분할할지 결정합니다.
작동 방식
내부적으로 Mesh LLM은 식별(공개 키) 및 네트워킹을 위해 iroh 엔드포인트를 사용합니다. 중앙 서버는 없습니다. iroh는 QUIC 연결을 통해 NAT 트래버설, 홀 펀칭 및 릴레이 폴백을 처리합니다. 프로토콜은 세 가지 ALPN을 정의합니다:
mesh-llm/1– 주요 메시 (가십, 라우팅, HTTP 터널, 플러그인 채널)mesh-llm-control/1– 소유자 제어 평면 (구성 동기화, 소유권 증명)skippy-stage/2– 분할 모델을 위한 지연 시간에 민감한 활성화 전송
주 연결 내에서 모든 통신은 단일 선행 바이트로 태그된 양방향 QUIC 스트림을 통해 다중화됩니다:
0x01GOSSIP – 피어 알림 (모델, GPU, RTT, 기능)0x04TUNNEL_HTTP – 피어로 프록시된 추론 요청0x05ROUTE_REQUEST – 피어가 호스팅하는 모델 쿼리0x06PEER_DOWN – 죽은 피어 알림0x07PEER_LEAVING – 정상 종료0x08PLUGIN_CHANNEL – 플러그인 RPC0x0eDIRECT_PATH_REQUEST – NAT 트래버설을 위한 직접 주소 공유
분할 모드 ("Skippy")
단일 GPU에 너무 큰 모델(예: 235B mixture-of-experts)의 경우 Mesh LLM은 레이어 범위로 모델을 스테이지로 분할하는 분할 모드를 제공합니다. 레이어 0–15는 한 노드에서 실행되고, 16–31은 다음 노드에서 실행됩니다. 활성화는 QUIC 스트림을 통해 한 스테이지에서 다음 스테이지로 흐릅니다. 여러 대의 modest한 머신이 함께 단독으로는 담을 수 없는 모델을 실행할 수 있습니다.
플러그 가능한 아키텍처
플러그인은 매니페스트에서 기능을 선언합니다. 런타임이 이를 시작하고, 호출을 라우팅하며, MCP, HTTP, 추론 및 메시 이벤트를 통해 기능을 노출합니다. 카탈로그에는 노트북에 맞는 5억 매개변수 모델부터 235B 거대 모델까지 40개 이상의 모델이 포함되어 있습니다.
대상 사용자
자체 AI 인프라를 제어하려는 팀: GPU 컴퓨팅을 비공개 또는 공개로 공유하고, 더 큰 하드웨어를 구매하지 않고 더 큰 모델을 실행하며, 벤더 종속을 피하려는 팀. 모든 OpenAI 클라이언트는 localhost:9337을 가리키고 실제 작업이 어디서 이루어지는지 신경 쓸 필요가 없습니다.
📖 전체 소스 읽기: HN LLM Tools
👀 See Also

개발자, AI 에이전트 메모리 문제 해결 위해 LibraHQ 앱 구축
한 개발자가 챗봇과 코딩 에이전트 간의 공유 메모리 계층 역할을 하는 무료 노트 앱인 LibraHQ를 만들었습니다. 이 앱은 채팅에서 중요한 메모와 결정을 기록하고 향후 세션을 위해 저장하여, AI 에이전트가 이전에 내린 결정을 잊어버리는 문제를 해결합니다.

LLMock: 프로세스 간 결정론적 LLM 테스트를 위한 HTTP 기반 모킹 서버
LLMock는 OpenAI, Claude, Gemini API를 모킹하는 실제 HTTP 서버로, 개발자가 실제 API를 호출하지 않고도 여러 프로세스에서 결정론적 테스트를 실행할 수 있게 해줍니다. SSE 스트리밍, 도구 호출, 조건부 라우팅, 요청 기록을 지원하며 의존성이 전혀 없습니다.

함대 사령관: 다중 클로드 코드 에이전트 팀을 조율하기 위한 오픈소스 대시보드
Fleet Commander는 여러 Claude Code 에이전트 팀을 다양한 이슈에 대해 병렬로 실행하는 로컬 웹 대시보드입니다. '다이아몬드 팀' 구조를 사용하며, Planner, Dev, Reviewer 에이전트가 SendMessage를 통해 피어 투 피어로 통신합니다.

애플 뉴럴 엔진을 역공학하여 MicroGPT 모델 학습하기
한 개발자가 Apple의 Neural Engine 비공개 API를 리버스 엔지니어링하여 110M 파라미터 MicroGPT 모델을 위한 학습 파이프라인을 만들었으며, M4 Mac 하드웨어에서 6.6 TFLOPs/watt의 전력 효율을 달성했습니다.