マイクロソフトのBitNet、単一CPUで1000億パラメーターのLLM推論を実現

BitNet: CPUベースLLM推論のための1ビット量子化
マイクロソフトのオープンソースBitNetプロジェクトは、GPUなしでコンシューマーハードウェア上での大規模言語モデル推論を可能にします。重要な革新は1.58ビット量子化(従来の16ビットに対して)であり、競争力のある性能を維持しながらモデルサイズを10-20倍削減します。
主要技術詳細
- リポジトリ:
https://github.com/microsoft/BitNet - モデル:
bitnet-b1.58-2B-4THuggingFaceで利用可能 - ハードウェア要件: 8コアCPU、32GB RAM、NVMe SSD
- モデルサイズ: 2Bパラメータ版で1.19GBダウンロード
- 性能: 100Bモデルは単一CPU上で5-7トークン/秒(人間の読書速度相当)
- 高速化: x86 CPUでllama.cppより2.37倍から6.17倍高速、ARM(Mac)で1.37倍から5.07倍高速
ベンチマーク結果
4兆トークンで学習された2Bパラメータモデルは、理解力、数学、コーディング、チャットの標準ベンチマークにおいて、類似の完全精度モデル(Llama 3.2 1B、Gemma 3 1B、Qwen2.5 1.5B)と同等かそれ以上の性能を示します。
- メモリ使用量: 0.4GB(比較モデルは1.4-4.8GB)
- CPUレイテンシ: 29ms(比較モデルは41-124ms)
- エネルギー効率: 約10倍の低エネルギー消費
導入オプション
ソースではいくつかの導入アプローチが提案されています:
bitnet.cppはCPUハードウェア上で直接実行- Windows 11上のWSL2 UbuntuでNode24 OpenClaw & bitnet.cpp
- USB起動Alpine RAMdiskシステム(BitNet、OpenClaw、LiteLLMプロキシ、Open WebUI含む)
- 再生HP 800 G3ミニコンピュータ(i7-6700、32GB RAM、1TB NVMe)約334ドルで入手可能
ユースケース
- エッジアプリケーションとロボティクス
- チャットボットスタイルインターフェースを備えた個人用RAGセットアップ
- スクリーンショット間隔、検索、要約、タイムラインを備えたAI OSメモリシステム
- GPUユーザーのためのQwen 3.5ローカルスタック(量子化Llama-3-70BはRTX 4090上でChatGPT 4性能に接近)
このプロジェクトは、2026年1月のCPU推論最適化とGPU高価格化により、限られたハードウェアを持つ開発者にとってCPUベース推論がより実用的になったことで、最近注目を集めています。
📖 Read the full source: r/openclaw
👀 See Also
Google AIモード、検索より21.6%高い商品を表示
23日間の調査で200万以上のリストを追跡:同じ商品がAIモードと従来の検索の両方に表示される場合、AIモードの価格は平均21.6%高い。重複する商品はわずか1.28%。

MetaはAIエージェントのトレーニングのために、従業員のコンピュータ操作を追跡しています
Metaは、AIモデルを自律的に作業タスクを実行できるように訓練するため、米国従業員のコンピューターにマウスの動き、クリック、キーストロークを記録する追跡ソフトウェアを導入しています。このツールは業務関連のアプリやウェブサイトで動作し、状況把握のために時折スクリーンショットを撮影します。

中国阻止Meta收购AI初创公司Manus
中国政府は、国家安全保障上の懸念を理由に、MetaによるAIスタートアップManusの買収提案を阻止した。この取引は10億ドル以上と評価されていたと報じられている。

Anthropicが100万件のClaude会話を分析:6%が個人的ガイダンスを求め、お世辞率9%、Opus 4.7で改善
100万件のClaude会話の分析により、6%が個人的なアドバイスを求めており、人間関係における同調率が最も高い(25%)ことが判明。Opus 4.7とMythos Previewでは、合成トレーニングデータを使用して同調率を半分に削減。