마이크로소프트 BitNet: CPU 및 GPU용 1비트 LLM 추론 프레임워크

✍️ OpenClawRadar📅 게시일: March 11, 2026🔗 Source
마이크로소프트 BitNet: CPU 및 GPU용 1비트 LLM 추론 프레임워크
Ad

BitNet이란 무엇인가

BitNet은 마이크로소프트의 공식 1비트 LLM 추론 프레임워크입니다(예: BitNet b1.58). CPU와 GPU에서 빠르고 무손실 추론을 위한 최적화된 커널을 제공하며, NPU 지원이 계획되어 있습니다. 이 프레임워크는 llama.cpp를 기반으로 구축되었으며 T-MAC의 룩업 테이블 방법론을 사용합니다.

성능 벤치마크

ARM CPU에서: 1.37배에서 5.07배 속도 향상과 55.4%에서 70.0% 에너지 감소. x86 CPU에서: 2.37배에서 6.17배 속도 향상과 71.9%에서 82.2% 에너지 감소. 최신 최적화는 구성 가능한 타일링과 임베딩 양자화 지원을 포함한 병렬 커널 구현을 추가하여 원래 구현 대비 1.15배에서 2.1배의 추가 속도 향상을 달성했습니다.

BitNet은 단일 CPU에서 1000억 파라미터 BitNet b1.58 모델을 인간 읽기 속도와 비슷한 속도(초당 5-7 토큰)로 실행할 수 있습니다.

지원 모델

  • BitNet-b1.58-2B-4T (24억 파라미터) - x86: ✅ I2_S, ❌ TL1, ✅ TL2 | ARM: ✅ I2_S, ✅ TL1, ❌ TL2
  • bitnet_b1_58-large (7억) - x86: ✅ I2_S, ❌ TL1, ✅ TL2 | ARM: ✅ I2_S, ✅ TL1, ❌ TL2
  • bitnet_b1_58-3B (33억) - x86: ❌ I2_S, ❌ TL1, ✅ TL2 | ARM: ❌ I2_S, ✅ TL1, ❌ TL2
  • Llama3-8B-1.58-100B-tokens (80억) - x86: ✅ I2_S, ❌ TL1, ✅ TL2 | ARM: ✅ I2_S, ✅ TL1, ❌ TL2
  • Falcon3 Family (10억-100억) - x86: ✅ I2_S, ❌ TL1, ✅ TL2 | ARM: ✅ I2_S, ✅ TL1, ❌ TL2
  • Falcon-E Family (10억-30억) - x86: ✅ I2_S, ❌ TL1, ✅ TL2 | ARM: ✅ I2_S, ✅ TL1, ❌ TL2
Ad

설치 요구사항

Python≥3.9, CMake≥3.22, Clang≥18. Windows의 경우: Visual Studio 2022 with Desktop development with C++, C++-CMake Tools for Windows, Git for Windows, C++-Clang Compiler for Windows, MS-Build Support for LLVM-Toolset (clang). Debian/Ubuntu의 경우: 자동 설치 스크립트 사용: bash -c "$(wget -O - https://apt.llvm.org/llvm.sh)"

소스에서 빌드

저장소 클론: git clone --recursive https://github.com/microsoft/BitNet.git

디렉토리 변경: cd BitNet

의존성 설치: # (권장) 새 conda 환경 생성

Windows 사용자는 빌드 명령어를 위해 VS2022용 개발자 명령 프롬프트/PowerShell을 사용해야 합니다.

최근 업데이트

  • 2026년 1월 15일: BitNet CPU 추론 최적화
  • 2025년 5월 20일: BitNet 공식 GPU 추론 커널
  • 2025년 4월 14일: BitNet 공식 20억 파라미터 모델 Hugging Face 출시
  • 2025년 2월 18일: Bitnet.cpp: 3진 LLM을 위한 효율적인 엣지 추론
  • 2024년 11월 8일: BitNet a4.8: 1비트 LLM을 위한 4비트 활성화
  • 2024년 10월 21일: 1비트 AI 인프라: 파트 1.1, CPU에서 빠르고 무손실 BitNet b1.58 추론
  • 2024년 10월 17일: bitnet.cpp 1.0 출시

📖 Read the full source: HN AI Agents

Ad

👀 See Also

피아스트 게이트: LLM 데이터 익명화를 위한 오픈소스 API 프록시
Tools

피아스트 게이트: LLM 데이터 익명화를 위한 오픈소스 API 프록시

Piast Gate는 민감한 데이터를 LLM에 전송하기 전 익명화하고 응답에서 원본 데이터를 복원하는 오픈소스 API 프록시입니다. 현재 MVP는 Google Gemini API, 폴란드어, 로컬 실행을 지원하며, LLM 처리 없이 텍스트나 Word 문서를 익명화할 수 있습니다.

OpenClawRadar
로컬 AI 에이전트 워크플로우: OpenCode, FastMCP, DeepSeek-r1 활용
Tools

로컬 AI 에이전트 워크플로우: OpenCode, FastMCP, DeepSeek-r1 활용

한 개발자가 OpenCode와 AGENTS.md 파일을 사용해 결정론적 시스템 프롬프트를 구성하고, FastMCP로 로컬 함수를 노출하며, Ollama의 DeepSeek-r1을 테스트 같은 특정 하위 에이전트에 활용하는 로컬 AI 에이전트 설정을 공유했습니다.

OpenClawRadar
코딩 에이전트 구축을 위한 8K 컨텍스트: 플래너/실행기 분할, 토큰 예산 및 병렬 실행
Tools

코딩 에이전트 구축을 위한 8K 컨텍스트: 플래너/실행기 분할, 토큰 예산 및 병렬 실행

8K 토큰 제한에 맞춰 설계된 CLI 코딩 에이전트의 상세 분석: 플래너/실행자 아키텍처, 엄격한 토크 예산, 병렬 작업 실행을 사용합니다.

OpenClawRadar
OpenClaw 플러그인은 Engram 서버를 통해 영구 메모리를 추가합니다.
Tools

OpenClaw 플러그인은 Engram 서버를 통해 영구 메모리를 추가합니다.

한 개발자가 OpenClaw 에이전트를 Engram에 연결하는 TypeScript 플러그인을 만들었습니다. Engram은 SQLite와 FTS5 검색을 사용하는 Go 기반의 경량 메모리 서버입니다. 이 플러그인은 에이전트 턴마다 프롬프트에 관련 메모리를 자동으로 주입하는 11개의 도구, 4개의 라이프사이클 훅, 자동 회상 기능을 제공합니다.

OpenClawRadar