Nadel: Ein 26M-Parameter-Funktionsaufrufmodell mit 6000 Tok/s auf Mobilgeräten

✍️ OpenClawRadar📅 Veröffentlicht: 12. Mai 2026🔗 Source
Ad

Cactus hat Needle als Open Source veröffentlicht, ein 26M-Parameter-Modell für Funktionsaufrufe, das auf günstigen Handys, Uhren und Brillen laufen soll. Es erreicht 6000 tok/s Prefill und 1200 tok/s Decodierung auf Verbrauchergeräten mit der eigenen Inferenz-Engine Cactus.

Architektur: Simple Attention Networks

Needle verwendet ein Simple Attention Network – nirgendwo MLPs. Das gesamte Modell besteht aus Attention- und Gating-Schichten. Schlüsseldesign: d=512, 8H/4KV, BPE=8192, mit einer Encoder-Decoder-Struktur (12 Encoder-Layer, 8 Decoder-Layer) unter Verwendung von Cross-Attention, maskiertem Self-Attention mit RoPE und gebundenen Embeddings.

Trainingsdetails

  • Vortraining auf 200B Tokens auf 16 TPU v6e (27 Stunden)
  • Nachtraining auf 2B Tokens synthetisierter Funktionsaufrufdaten (45 Minuten)
  • Daten synthetisiert über Gemini mit 15 Tool-Kategorien (Timer, Messaging, Navigation, Smart Home usw.)

Benchmark-Ergebnisse

Needle schlägt FunctionGemma-270M, Qwen-0.6B, Granite-350M und LFM2.5-350M bei einmaligen Funktionsaufrufen. Diese Modelle haben jedoch mehr Umfang/Kapazität und zeichnen sich in Konversationsumgebungen aus.

Ad

Schnellstart

git clone https://github.com/cactus-compute/needle.git
cd needle && source ./setup
needle playground

Öffnet eine Weboberfläche unter http://127.0.0.1:7860 zum Testen und Feintuning mit eigenen Tools.

Verwendung (Python)

from needle import SimpleAttentionNetwork, load_checkpoint, generate, get_tokenizer

params, config = load_checkpoint("checkpoints/needle.pkl") model = SimpleAttentionNetwork(config) tokenizer = get_tokenizer()

result = generate( model, params, tokenizer, query="Wie ist das Wetter in San Francisco?", tools='[{"name":"get_weather","parameters":{"location":"string"}}]', stream=False ) print(result)

[{"name":"get_weather","arguments":{"location":"San Francisco"}}]

Lokales Feintuning

# über Playground (generiert automatisch Daten via Gemini)

needle playground

oder eigene Daten bereitstellen

needle finetune data.jsonl

Verfügbarkeit

Gewichte sind auf Hugging Face: Cactus-Compute/needle. Alles ist MIT-lizenziert.

📖 Vollständige Quelle lesen: HN AI Agents

Ad

👀 Siehe auch

Claude Code UltraPlan Workflow-Änderungen und Leistungsbeobachtungen
Werkzeuge

Claude Code UltraPlan Workflow-Änderungen und Leistungsbeobachtungen

Claude Code UltraPlan stellt einen cloudbasierten Planungsworkflow mit Terminalstart, Browser-Review-Oberfläche und Ausführungsoptionen vor. Tests zeigten etwa 2x schnellere Wiederholungsläufe als lokale Planung, mit gemischten Qualitätsverbesserungen.

OpenClawRadar
CodeLedger und Vibecop Updates für Multi-Agent AI-Codierungskosten- und Qualitätsverfolgung
Werkzeuge

CodeLedger und Vibecop Updates für Multi-Agent AI-Codierungskosten- und Qualitätsverfolgung

CodeLedger verfolgt jetzt Ausgaben über Claude Code, Codex CLI, Cline und Gemini CLI, indem es lokale Sitzungsdateien ausliest, während Vibecop automatisierte Qualitätsprüfungen mit neuen LLM-spezifischen Detektoren und einem Ein-Befehl-Setup für mehrere KI-Codierungstools hinzufügt.

OpenClawRadar
Eä: Ein SIMD-Compiler für Python, geschrieben in Rust
Werkzeuge

Eä: Ein SIMD-Compiler für Python, geschrieben in Rust

Ein Entwickler hat Eä erstellt, einen Compiler für SIMD-Kernel in etwa 12.000 Zeilen Rust-Code, der aus .ea-Dateien Shared Libraries und Python-Wrapper generiert und dabei 6,6-fache Geschwindigkeitssteigerungen gegenüber NumPy ohne ctypes oder Build-Systeme erzielt.

OpenClawRadar
ProofShot CLI verleiht KI-Codierungsagenten Browser-Verifizierungsfunktionen
Werkzeuge

ProofShot CLI verleiht KI-Codierungsagenten Browser-Verifizierungsfunktionen

ProofShot ist ein Open-Source-CLI-Tool, das KI-Coding-Agents ermöglicht, UI-Funktionen zu überprüfen, indem es Browser-Sitzungen aufzeichnet, Screenshots erfasst und Konsolenfehler sammelt. Es funktioniert mit jedem Agenten, der Shell-Befehle ausführen kann, und erstellt eigenständige HTML-Berichte zur menschlichen Überprüfung.

OpenClawRadar