Show HN: WUPHF — Karpathy-artiges LLM-Wiki mit Markdown + Git als Quelle der Wahrheit

WUPHF ist ein quelloffenes kollaboratives Büro für KI-Agenten (Claude Code, Codex, OpenClaw, lokale LLMs via OpenCode), das eine Karpathy-ähnliche Wiki-Schicht enthält. Das Wiki verwendet Markdown und Git als Quelle der Wahrheit, gespeichert unter ~/.wuphf/wiki/, mit einem bleve (BM25) + SQLite-Index darüber. Noch wird keine Vektor- oder Graph-DB verwendet – das Ziel ist zu sehen, wie weit Markdown + Git kommen, bevor schwerere Infrastruktur hinzugefügt wird.
Hauptmerkmale
- Jeder Agent erhält ein privates Notizbuch unter
agents/{slug}/notebook/sowie ein gemeinsames Team-Wiki unterteam/. - Workflow zum Hochstufen von Entwürfen ins Wiki: Notizbuch-Einträge werden (vom Agenten oder Menschen) überprüft und mit Rückverweisen ins kanonische Wiki übernommen. Eine Zustandsmaschine verwaltet Ablauf und automatische Archivierung.
- Entity-Fact-Log pro Entität: Append-only JSONL unter
team/entities/{kind}-{slug}.facts.jsonl. Ein Synthese-Worker erstellt alle N Fakten eine aktuelle Entitäten-Kurzfassung. - Commits werden einer eindeutigen Git-Identität („Pam the Archivist“) zugeordnet, um die Herkunft via
git lognachvollziehen zu können. - [[Wikilinks]] mit Erkennung toter Links (rot dargestellt).
- Täglicher Lint-Cron für Widersprüche, veraltete Einträge und defekte Wikilinks.
- Slash-Befehl
/lookup+ MCP-Tool für beleggestützte Abrufe. Ein heuristischer Klassifizierer leitet kurze Anfragen an BM25 und narrative Anfragen an eine beleggestützte Antwortschleife weiter.
Sucheinstellungen
Aktuelle Benchmarks mit 500 Artefakten und 50 Anfragen erreichen 85 % Recall@20 allein mit BM25, was die interne Freigabeschwelle ist. Sollte eine Anfrageklasse darunter fallen, ist sqlite-vec der vorab festgelegte Fallback.
Substrat-Auswahl
- Markdown für Haltbarkeit – das Wiki überlebt die Laufzeit; Benutzer können
git cloneausführen und mit jedem Byte gehen. - Bleve für BM25.
- SQLite für strukturierte Metadaten (Fakten, Entitäten, Kanten, Weiterleitungen, Überholungen).
- Kanonische IDs sind erstklassig: Fact-IDs sind deterministisch (enthalten Satz-Offset), Slugs werden einmal vergeben und nie umbenannt (Redirect-Stubs werden verwendet). Ein Wiederaufbau ist logisch identisch, nicht byte-identisch.
Bekannte Grenzen
- 85 % Recall ist keine universelle Garantie – Optimierung läuft.
- Die Synthesequalität hängt von der Qualität der Agentenbeobachtungen ab. Der Lint-Durchlauf hilft, ist aber keine Bewertungsinstanz.
- Einzelbüro-Bereich; noch keine bureauübergreifende Föderation.
Demo & Installation
Ein 5-minütiger Terminal-Walkthrough ist verfügbar auf asciinema (Skript unter ./scripts/demo-entity-synthesis.sh).
Installation mit: npx wuphf@latest
Aus dem Quellcode bauen: git clone https://github.com/nex-crm/wuphf.git; go build -o wuphf ./cmd/wuphf
Das Wiki wird als Teil von WUPHF ausgeliefert, kann aber eigenständig verwendet werden. MIT-Lizenz, selbst gehostet, eigene Schlüssel mitbringen.
📖 Vollständige Quelle lesen: HN LLM Tools
👀 Siehe auch

Vektoris Speicherarchitektur: Prinzipien aus Claudes geleaktem System
Vektori implementiert einen dreischichtigen hierarchischen Satzgraphen für KI-Erinnerung, inspiriert von durchgesickerten Prinzipien aus Claudes Architektur. Das System verwendet strenge Qualitätsfilter, skeptisches Abrufen mit einer Mindestpunktzahl von 0,3 und bewahrt Korrekturverläufe über Sitzungen hinweg.

TinySearch v0.2.0: Leichte Websuche für lokale LLMs jetzt mit SearXNG-Unterstützung
TinySearch v0.2.0 wechselt von DuckDuckGo zu SearXNG als Such-Backend. Es durchsucht das Web, crawlt Seiten und liefert kompakten Kontext (8k Tokens) für lokale LLMs wie Qwen3.5-9B.

FOMOE ermöglicht die Inferenz des 397B Qwen3.5-Modells auf Desktop-Hardware für 2.100 US-Dollar
FOMOE (Fast Opportunistic Mixture of Experts) ermöglicht es, Qwen3.5s Flaggschiffmodell mit 397 Milliarden Parametern mit einer Geschwindigkeit von 5-9 Tokens/Sekunde auf Consumer-Hardware zu betreiben, und zwar mit zwei 500-Dollar-GPUs, 32 GB RAM und einem NVMe-Laufwerk unter Verwendung von Q4_K_M-Quantisierung.

Lokaler KI-Agent erreicht Sub-Sekunden-STT- und TTS-Latenz mit Open-Source-Servern
Ein Entwickler erreichte ~0,2s STT-Latenz mit Whisper large-v3-turbo in einer hybriden, thread-verwalteten GPU-Architektur und ~250ms TTS-Latenz mit Coqui-TTS, optimiert für synthese mit geringer Latenz. Beide Implementierungen sind vollständig selbst gehostet und quelloffen.