FairyFuse, CPU에서 삼진 가중치 곱셈 없는 추론을 통해 29.6배 커널 속도 향상 달성
FairyFuse는 상용 CPU에서 삼진법(값이 {-1,0,+1}) LLM을 위한 추론 시스템입니다. 각 광역 선형 레이어의 8개 실수값 서브-GEMV를 마스크된 덧셈과 뺄셈을 사용하여 단일 AVX-512 루프로 융합함으로써 모든 부동소수점 곱셈을 제거합니다. Roofline 분석에 따르면, 16배의 가중치 압축은 대역폭이 제한된 CPU에서 메모리 바운드 GEMV를 컴퓨트 영역으로 이동시켜 기존의 역양자화 및 곱셈 커널보다 29.6배의 커널 속도 향상을 제공합니다. 주목할 점은, 이 접근 방식은 GPU에서는 거의 이점이 없다는 것입니다.
주요 결과
- 종단 간 처리량: 단일 Intel Xeon 8558P에서 초당 32.4 토큰.
- llama.cpp Q4_K_M과 비교: 거의 손실 없는 품질로 1.24배 더 빠름 (WikiText-2 혼란도 5.52 vs. FP16 5.47; 다운스트림 정확도 66.0% vs. FP16 66.0%).
- 가중치 압축: 삼진 표현으로 인해 16배 (가중치당 2비트) — FP로의 역양자화 불필요.
- 기법: 마스크된 덧셈/뺄셈을 사용하여 8개의 서브-GEMV를 단일 AVX-512 루프로 융합 — 부동소수점 곱셈이 전혀 없음.
배경
이전 연구(Fairy2i)는 삼진 LLM이 FP16 품질과 일치할 수 있음을 보여주었지만, 런타임은 구조를 활용하지 못했습니다. FairyFuse는 AVX-512를 탑재한 x86 CPU에서 곱셈 없는 추론으로 재설계함으로써 그 격차를 해소합니다.
📖 전체 소스 읽기: HN LLM Tools
👀 See Also

벤치마크 결과: Apple Silicon 대 AMD GPU에서 ROCm 및 Vulkan을 사용한 Qwen3.5 모델 성능 비교
한 개발자가 Apple Silicon Mac과 AMD GPU 워크스테이션에서 Qwen3.5 모델(35B MoE, 27B dense, 122B MoE)을 벤치마킹하여 ROCm과 Vulkan 백엔드를 컨텍스트 스케일링 테스트와 비교했습니다. 하드웨어에는 M5 Max, M1 Max 및 다양한 PCIe 구성의 세 가지 AMD GPU가 포함되었습니다.

영국 AI 투자 주장 검증 중: 가상 데이터센터와 확인되지 않은 자금
가디언의 조사 결과, 영국의 수십억 파운드 규모 AI 추진 계획에는 임대 데이터센터를 포함한 '유령 투자', 여전히 비계 야드로 운영되는 슈퍼컴퓨터 부지, 그리고 검증되지 않은 일자리 창출 주장이 포함되어 있는 것으로 드러났습니다.
AI 연봉 상승, 샌프란시스코 주택 중간 가격을 기록적인 176만 달러로 끌어올려
2026년 5월, 샌프란시스코 주택 중간 가격이 176만 달러로 사상 최고치를 기록했습니다. 이는 OpenAI와 Anthropic의 AI 근로자 부에 의해 주도되었으며, 일부 판매자는 현금 대신 AI 기업 주식을 받기도 합니다.

인류학 연구, AI 지원 워크플로우에서 인지 능력 저하 발견
Anthropic의 8만 명 사용자를 대상으로 한 글로벌 연구에 따르면, Claude와 Cursor와 같은 AI 도구를 사용할 때 학계 사용자들이 평균보다 2.5배 높은 인지 능력 저하율을 보고했습니다. 출처는 문제의 원인을 사용자들이 작업의 '소화 단계'를 제거하기 때문이라고 지적합니다.