Nadel: Ein 26M-Parameter-Funktionsaufrufmodell mit 6000 Tok/s auf Mobilgeräten
Cactus hat Needle als Open Source veröffentlicht, ein 26M-Parameter-Modell für Funktionsaufrufe, das auf günstigen Handys, Uhren und Brillen laufen soll. Es erreicht 6000 tok/s Prefill und 1200 tok/s Decodierung auf Verbrauchergeräten mit der eigenen Inferenz-Engine Cactus.
Architektur: Simple Attention Networks
Needle verwendet ein Simple Attention Network – nirgendwo MLPs. Das gesamte Modell besteht aus Attention- und Gating-Schichten. Schlüsseldesign: d=512, 8H/4KV, BPE=8192, mit einer Encoder-Decoder-Struktur (12 Encoder-Layer, 8 Decoder-Layer) unter Verwendung von Cross-Attention, maskiertem Self-Attention mit RoPE und gebundenen Embeddings.
Trainingsdetails
- Vortraining auf 200B Tokens auf 16 TPU v6e (27 Stunden)
- Nachtraining auf 2B Tokens synthetisierter Funktionsaufrufdaten (45 Minuten)
- Daten synthetisiert über Gemini mit 15 Tool-Kategorien (Timer, Messaging, Navigation, Smart Home usw.)
Benchmark-Ergebnisse
Needle schlägt FunctionGemma-270M, Qwen-0.6B, Granite-350M und LFM2.5-350M bei einmaligen Funktionsaufrufen. Diese Modelle haben jedoch mehr Umfang/Kapazität und zeichnen sich in Konversationsumgebungen aus.
Schnellstart
git clone https://github.com/cactus-compute/needle.git
cd needle && source ./setup
needle playgroundÖffnet eine Weboberfläche unter http://127.0.0.1:7860 zum Testen und Feintuning mit eigenen Tools.
Verwendung (Python)
from needle import SimpleAttentionNetwork, load_checkpoint, generate, get_tokenizer
params, config = load_checkpoint("checkpoints/needle.pkl")
model = SimpleAttentionNetwork(config)
tokenizer = get_tokenizer()
result = generate(
model, params, tokenizer,
query="Wie ist das Wetter in San Francisco?",
tools='[{"name":"get_weather","parameters":{"location":"string"}}]',
stream=False
)
print(result)
[{"name":"get_weather","arguments":{"location":"San Francisco"}}]
Lokales Feintuning
# über Playground (generiert automatisch Daten via Gemini)
needle playground
oder eigene Daten bereitstellen
needle finetune data.jsonl
Verfügbarkeit
Gewichte sind auf Hugging Face: Cactus-Compute/needle. Alles ist MIT-lizenziert.
📖 Vollständige Quelle lesen: HN AI Agents
👀 Siehe auch

Claude Code UltraPlan Workflow-Änderungen und Leistungsbeobachtungen
Claude Code UltraPlan stellt einen cloudbasierten Planungsworkflow mit Terminalstart, Browser-Review-Oberfläche und Ausführungsoptionen vor. Tests zeigten etwa 2x schnellere Wiederholungsläufe als lokale Planung, mit gemischten Qualitätsverbesserungen.

CodeLedger und Vibecop Updates für Multi-Agent AI-Codierungskosten- und Qualitätsverfolgung
CodeLedger verfolgt jetzt Ausgaben über Claude Code, Codex CLI, Cline und Gemini CLI, indem es lokale Sitzungsdateien ausliest, während Vibecop automatisierte Qualitätsprüfungen mit neuen LLM-spezifischen Detektoren und einem Ein-Befehl-Setup für mehrere KI-Codierungstools hinzufügt.

Eä: Ein SIMD-Compiler für Python, geschrieben in Rust
Ein Entwickler hat Eä erstellt, einen Compiler für SIMD-Kernel in etwa 12.000 Zeilen Rust-Code, der aus .ea-Dateien Shared Libraries und Python-Wrapper generiert und dabei 6,6-fache Geschwindigkeitssteigerungen gegenüber NumPy ohne ctypes oder Build-Systeme erzielt.

ProofShot CLI verleiht KI-Codierungsagenten Browser-Verifizierungsfunktionen
ProofShot ist ein Open-Source-CLI-Tool, das KI-Coding-Agents ermöglicht, UI-Funktionen zu überprüfen, indem es Browser-Sitzungen aufzeichnet, Screenshots erfasst und Konsolenfehler sammelt. Es funktioniert mit jedem Agenten, der Shell-Befehle ausführen kann, und erstellt eigenständige HTML-Berichte zur menschlichen Überprüfung.