호마: AI 클러스터 네트워킹을 위한 TCP 대체
호마(Homa)는 데이터센터 및 AI 클러스터 네트워크에서 TCP를 대체하기 위해 설계된 전송 프로토콜로, 바이트 스트림 의미론보다 마이크로초 수준의 테일 레이턴시가 더 중요한 환경에 적합합니다. 이 영상에서는 설계와 그 동기를 살펴봅니다.
호마가 TCP와 다른 점
TCP는 광역 인터넷을 위해 만들어졌으며, 장기간 지속되는 플로우의 대역폭과 공정성에 최적화되어 있습니다. 호마는 수신자 주도(receiver-driven) 방식입니다. 송신자가 용량을 탐색하는 대신, 수신자가 송신자에게 크레딧을 부여하고 SRPT(최단 잔여 처리 시간 우선)를 사용해 들어오는 메시지를 스케줄링합니다. 짧은 메시지—AI 훈련에서 RPC 및 집합 연산의 일반적인 경우—가 대용량 전송보다 우선순위를 갖습니다.
AI 클러스터에서 이것이 중요한 이유
AI 훈련 및 추론 트래픽은 버스트적이고 메시지 지향적입니다. AllReduce, 파라미터 서버 업데이트, KV 캐시 전송은 모두 몇 개의 긴 바이트 스트림이 아니라 많은 작은 메시지처럼 보입니다. TCP의 플로우별 혼잡 제어와 순서 보장 바이트 전달은 대규모에서 작업 완료 시간을 악화시키는 헤드 오브 라인 블로킹과 큐잉 지연을 추가합니다.
Ousterhout 등이 작성한 원래 USENIX ATC '21 논문이 핵심 참고 자료입니다. 이 논문은 데이터센터 워크로드에서 TCP 기반 스택과 비교해 99번째 백분위수 메시지 지연 시간이 수십 배 감소했으며, 많은 짧은 메시지가 패브릭을 공유할 때 처리량이 더 높다고 보고합니다.
현재 상황
링크된 LWN 기사는 호마와 유사한 스케줄링을 Linux 네트워킹 스택에 도입하려는 지속적인 노력을 다룹니다. TCP를 확장할지, 새로운 전송 프로토콜을 추가할지, 아니면 커널 모듈로 구축할지에 대한 오랜 논의입니다. The Register 기사는 스탠퍼드 프로젝트 측면을 다룹니다.
GPU 클러스터를 구축하거나 운영 중이고 작업 완료 시간이 컴퓨팅보다 네트워크 테일 레이턴시에 의해 좌우된다면, 이 주제를 주목할 가치가 있습니다. 논문은 설계를 가장 빠르게 이해하는 방법이며, LWN 스레드는 커널 통합이 실제로 어떤 모습일지 보여줍니다.
📖 전체 출처 읽기: HN LLM Tools
👀 See Also

Claude Code v2.1.98은 Vertex AI 마법사, 보안 수정 사항 및 서브프로세스 샌드박싱을 추가합니다.
Claude Code v2.1.98은 대화형 Google Vertex AI 설정 마법사를 도입하고, Linux에서 PID 네임스페이스 격리를 통한 서브프로세스 샌드박싱을 추가하며, Bash 권한 우회 및 임의 코드 실행 위험을 포함한 여러 보안 취약점을 수정합니다.

클로드의 미니맥스 논쟁 분석과 앤트로픽의 시장 공백
클로드는 MiniMax가 수백만 건의 API 호출을 유료로 구매함으로써 합법적으로 학습 데이터를 획득했다고 주장하며, Anthropic의 제품 라인업에서 저렴한 지속적 오케스트레이터에 대한 공백을 지적합니다.

2026년 LLM API 비용 비교: 자체 호스팅 vs. 클라우드 제공업체
레딧 사용자가 11개 제공업체의 1백만 토큰/일 LLM API 비용을 비교한 결과, vLLM을 사용한 자체 호스팅 비용은 1백만 토큰당 약 $0.05인 반면 GPT-4o는 입력/출력 토큰당 $5/$15로 나타났습니다.

리눅스 커널 관리자가 AI 생성 버그 보고서 품질의 갑작스러운 변화를 보고하다
그렉 크로아-하트만은 약 한 달 전에 리눅스 커널에 대한 AI 생성 버그 리포트가 'AI 쓰레기'에서 합법적인 리포트로 전환되었다고 말하며, 다양한 프로젝트의 오픈 소스 보안 팀들도 동일한 변화를 목격하고 있다고 전했습니다. 커널 팀은 Sashiko와 같은 리뷰 자동화 도구를 활용하여 증가하는 리포트를 처리하고 있습니다.