SpruceChat läuft mit 0,5B LLM direkt auf Miyoo-Handhelds über llama.cpp

Was das ist
SpruceChat ist ein Projekt, das das Sprachmodell Qwen2.5-0.5B vollständig auf dem Gerät auf mehreren Handheld-Spielkonsolen mit llama.cpp ausführt. Nach der Erstinstallation benötigt es keine Cloud-Verbindung oder WiFi.
Wichtige Details
Das Modell befindet sich nach dem ersten Start im RAM, und Token werden während der Generierung einzeln eingelesen. Es läuft auf dem Miyoo A30, Miyoo Flip, Trimui Brick und Trimui Smart Pro.
Leistung auf dem Miyoo A30 (der einen Cortex-A7 Quad-Core-Prozessor hat):
- Modellladen: ~60 Sekunden beim ersten Start
- Generierungsgeschwindigkeit: ~1-2 Token pro Sekunde
- Prompt-Auswertung: ~3 Token pro Sekunde
Der Entwickler merkt an, dass es nicht schnell ist, aber es streamt, sodass man ihm beim Denken zusehen kann. Er erwähnt, dass 64-Bit-Geräte schneller sind.
Die KI wird als "mit der Persönlichkeit einer Fichte: geduldig, gelassen, still erstaunt über alles" beschrieben.
Wenn das Gerät mit WiFi verbunden ist, kann man auch den llama-Server über einen Browser auf einem Telefon oder Laptop aufrufen, um mit einer echten Tastatur zu chatten.
Das Repository befindet sich unter https://github.com/RED-BASE/SpruceChat. Das Projekt wurde mit Hilfe von Claude erstellt, und es arbeitet bereits ein Mitarbeiter daran, die Geräteunterstützung zu erweitern. Die erste Version ist mit sowohl armhf- als auch aarch64-Binärdateien verfügbar, und das Modell ist enthalten.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch
Ballon, der platzt, wenn Claude fertig ist: Physical Agent UI mit whisper.cpp
Ein Desktop-Ballon wird größer, während Sie eine Aufgabe sprechen, und schwebt dann über den Bildschirm, während Claude Code den Agenten ausführt. Die Transkription erfolgt lokal über whisper.cpp, die Agenten nutzen Ihren bestehenden Claude-Code-Login. Open Source.

Merlin: Lokaler LLM-Kontext-Dedup – misst bis zu 71% Chunk-Überlappung, kostenlos & Open-Core
Merlin ist ein lokales Deduplizierungswerkzeug für LLM-Kontextfenster, das bei 22 Millionen Passagen aus echten Agenten- und RAG-Sitzungen eine Überlappung von 22-71% gemessen hat. Es wird als HTTP-Proxy (Ollama/vLLM/SGLang/llama.cpp), MCP-Server (Claude/Cursor/OpenClaw) oder eigenständiges CLI ausgeliefert. MIT-Open-Core mit täglichen Nutzungsbeschränkungen.

OpenClaw Multi-Agent Buchschreibfähigkeit veröffentlicht
Ein auf OpenClaw basierendes Multi-Agenten-Buchschreibsystem wurde als Skill veröffentlicht, das DeepWiki-MCP-Verbindung, GLM-Bildgenerierung für Illustrationen, Budgetschätzung und kapitelweise Überarbeitung umfasst. Zwei Kapitel des OpenClaw Paradigm Book wurden mit diesem Tool aktualisiert.

LamBench: Eine Lambda-Kalkül-Benchmark-Suite für KI-Codierungsagenten
LamBench ist eine Benchmark-Suite, die KI-Agenten anhand von Lambda-Kalkül-Aufgaben bewertet und Intelligenz, Geschwindigkeit und Eleganz misst. Die v1-Veröffentlichung umfasst Probleme und eine Bewertungsmatrix.