針:完全不需要前馈网络构建的2600万参数工具调用模型
Needleは、単発の関数呼び出しに特化して設計された2600万パラメータのモデルです。ツール呼び出しは推論ではなく、検索と組み立て(クエリをツール名にマッチさせ、引数の値を抽出し、JSONを出力する)であるという洞察に基づき、クロスアテンションとゲーティング層のみで構成され、FFNは一切使用していません。コンシューマデバイス上で6000トークン/秒のプリフィルと1200トークン/秒のデコードを実現します。
トレーニング詳細
- 16台のTPU v6e上で2000億トークンで事前学習(27時間)
- 合成された20億トークンの関数呼び出しデータで追加学習(45分)
- データはGeminiを使用して、15のツールカテゴリ(タイマー、メッセージング、ナビゲーション、スマートホームなど)で合成
アーキテクチャ:シンプルアテンションネットワーク
モデル全体はアテンションとゲーティングのみで構成され、MLPは一切ありません。著者らは、このスケールのツール呼び出しではFFNパラメータは無駄であり、「FFNなし」という発見は、モデルが外部の構造化知識にアクセスできる任意のタスク(RAG、ツール使用、検索拡張生成)に一般化できると主張しています。入力に事実が提供されていれば、モデルはFFNの重みに事実を記憶する必要はありません。
ベンチマーク
Needleは、単発の関数呼び出しにおいてFunctionGemma-270M、Qwen-0.6B、Granite-350M、LFM2.5-350Mを上回りますが、これらのモデルは会話設定においてより多くのキャパシティを持っています。
使用方法
# プレイグラウンドでモデルをテストするか、Mac/PCでファインチューニング
git clone https://github.com/cactus-compute/needle
- GitHub: github.com/cactus-compute/needle
- 重み: huggingface.co/Cactus-Compute/needle
- アーキテクチャ解説: Simple Attention Networks docs
- モバイル/ウェアラブル向け推論エンジン(Cactus): github.com/cactus-compute/cactus
すべてMITライセンスです。
📖 全文ソースを読む: r/LocalLLaMA
👀 See Also

OpenClawの自己更新型翻訳システムは、ドメイン用語集を自動的に維持します。
PythonスクリプトがKimi2.5 APIをラップして、ブロックインデックス、タイムスタンプ、セグメンテーションを保持しながら.srtファイルを翻訳します。このシステムは、glossary.json、style.md、memory.jsonlファイルを含むプロジェクトプロファイルを使用し、6時間ごとに公式ソースをスキャンして用語を更新するcronジョブを含みます。

Vibe Hosting:AI支援デプロイのためのClaude Code MCP統合
NameOceanのVibe Hostingプラットフォームは、Claude Code MCPを統合し、自然言語コマンドを通じてプロジェクトの構築とデプロイを可能にします。このサービスは、静的サイト、Node.js、Python、Django、Goアプリケーション向けに、無料のSSL、ドメイン、DNS、VPSセットアップを提供します。

アルフレッド・ベータ版リリース:非技術ユーザーのための簡易OpenClaw代替ツール
Alfredは、OpenClawの機能の約70%を、大幅に削減された複雑さで提供する新しいベータツールです。アプリ接続、メモリ、使用モード、インフラストラクチャに関するシンプルなデフォルト設定を備えながら、カスタマイズも可能です。

マイクロソフト BitNet: CPUとGPU向けの1ビットLLM推論フレームワーク
マイクロソフトは、1ビットLLM向けの推論フレームワーク「BitNet」をリリースしました。CPUで1.37倍から6.17倍の高速化を実現し、エネルギー消費を55.4%から82.2%削減します。1000億パラメータのモデルを単一のCPUで秒間5〜7トークンの速度で実行可能です。