Needle: Ein Tool-Calling-Modell mit 26 Millionen Parametern, vollständig ohne FFNs aufgebaut
Needle ist ein 26M-Parameter-Modell, das speziell für einmalige Funktionsaufrufe entwickelt wurde. Es verwendet Cross-Attention und Gating-Layer ohne FFNs, basierend auf der Erkenntnis, dass Tool-Aufrufe Abruf und Zusammenstellung sind (Query mit Tool-Namen abgleichen, Argumentwerte extrahieren, JSON ausgeben) und nicht logisches Denken. Das Modell erreicht auf Endgeräten 6000 tok/s Prefill und 1200 tok/s Decode.
Trainingsdetails
- Vorab trainiert auf 200B Tokens über 16 TPU v6e (27 Stunden)
- Nachtrainiert auf 2B Tokens synthetischer Funktionsaufrufdaten (45 Minuten)
- Daten über Gemini mit 15 Tool-Kategorien (Timer, Nachrichten, Navigation, Smart Home usw.) synthetisiert
Architektur: Simple Attention Networks
Das gesamte Modell besteht nur aus Attention und Gating – keinerlei MLPs. Die Autoren argumentieren, dass FFN-Parameter in dieser Größenordnung für Tool-Aufrufe verschwendet sind und dass der 'No-FFN'-Befund auf jede Aufgabe verallgemeinerbar ist, bei der das Modell Zugriff auf externes strukturiertes Wissen hat (RAG, Tool-Nutzung, retrieval-gestützte Generierung). Das Modell muss keine Fakten in FFN-Gewichten speichern, wenn die Fakten in der Eingabe bereitgestellt werden.
Benchmarks
Needle schlägt FunctionGemma-270M, Qwen-0.6B, Granite-350M und LFM2.5-350M beim einmaligen Funktionsaufruf, obwohl diese Modelle mehr Kapazität für Unterhaltungsszenarien haben.
Verwendung
# Testen Sie das Modell über die Spielwiese oder verfeinern Sie es auf Ihrem Mac/PC
git clone https://github.com/cactus-compute/needle
- GitHub: github.com/cactus-compute/needle
- Gewichte: huggingface.co/Cactus-Compute/needle
- Architekturbeschreibung: Simple Attention Networks docs
- Inferenz-Engine für Mobilgeräte/Wearables (Cactus): github.com/cactus-compute/cactus
Alles ist MIT-lizenziert.
📖 Lesen Sie die vollständige Quelle: r/LocalLLaMA
👀 Siehe auch

Crit: Lokal-first, Single-Binary CLI zur Überprüfung von Agentenplänen und Diffs
Crit ist ein Single-Binary-CLI-Tool, das Dateien oder Diffs mit einer von GitHub inspirierten Benutzeroberfläche im Browser öffnet und mehrstufige Feedback-Schleifen mit KI-Coding-Agenten ermöglicht – kein Konto erforderlich.

Watchtower: Ein lokaler Proxy zur Überwachung des Claude Code API-Datenverkehrs
Watchtower ist ein kostenloses, Open-Source-Tool, das als lokaler HTTP-Proxy und Echtzeit-Web-Dashboard fungiert, um den gesamten API-Verkehr zwischen Claude Code (oder Codex CLI) und deren APIs abzufangen und anzuzeigen. Es zeigt Anfragen, SSE-Streams, Tool-Definitionen, System-Prompts, Token-Verbrauch und Rate-Limits.

Pilot-Protokoll: Ein P2P-Netzwerk-Stack für KI-Agenten, entwickelt mit Claude
Ein Entwickler hat das Pilot Protocol entwickelt, einen reinen User-Space-Peer-to-Peer-Virtual-Network-Stack in Go, speziell für autonome KI-Agenten, der direkte Kommunikation ohne zentrale Infrastruktur ermöglicht. Das Protokoll nutzt UDP-Multiplexing, NAT-Traversal und Ende-zu-Ende-Verschlüsselung, mit Benchmarks, die einen lokalen Durchsatz von 89 MB/s und einen transkontinentalen WAN-Durchsatz von 2,1 MB/s zeigen.

Browser-natives Echtzeit-Kohärenzkontrollsystem für Claude mit SDE-Bändern und Kalman-Filterung
Ein Entwickler hat ein Echtzeit-Kohärenzsteuerungssystem erstellt, das vollständig als Claude-Artefakt im Browser läuft. Dabei wird Konversation als stochastischer Prozess behandelt, der Live-Monte-Carlo-SDE-Pfade, duale Kalman-Filterung und Verhaltenssignalerfassung nutzt.