Lokales RAG-Tool, erstellt mit Nemotron Nano 9B v2 und vLLM-Tool-Aufrufen

Technische Implementierungsdetails
Ein Entwickler hat seinen Ansatz zum Aufbau eines lokalen RAG-Forschungstools geteilt, das vollständig auf einer einzelnen GPU läuft. Das gesamte Backend ist in einer einzigen app.py-Datei enthalten.
Stack und Konfiguration
Das Tool verwendet Nemotron Nano 9B v2 Japanese auf vLLM mit FP16-Quantisierung und läuft auf einer RTX 5090 GPU. Das Backend kombiniert FastAPI + SQLite FTS5 + Jinja2. Für Tool-Aufrufe verwendet der Entwickler die offiziellen Parser-Plugins von NVIDIA, speziell --tool-call-parser nemotron_json und --tool-parser-plugin, wobei er darauf hinweist, dass Nemotron v2 benutzerdefinierte Parser-Plugins erfordert und nicht die integrierten vLLM-Parser (die für v3 sind).
Wichtige Designentscheidungen
Das System implementiert einen Extraktion → Ausführung zweistufigen Flow:
- Wenn eine Frage gestellt wird, extrahiert das System zunächst zweisprachige Schlüsselwörter (Englisch und Japanisch) über LLM
- Führt FTS5-Suche auf lokalen Quellen UND DuckDuckGo-Websuche parallel aus
- Zeigt Ergebnisse mit Kontrollkästchen zur Benutzerauswahl an
- Erst nach der Benutzerauswahl generiert es die endgültige Antwort
Dieser Ansatz vermeidet das Ausspucken von über 100k+ Token Kontext und die Hoffnung, dass das Modell es herausfindet.
Leistung und Funktionen
- Tool-Aufrufe: Das Modell entscheidet autonom, wann es das Web durchsuchen soll, funktioniert überraschend gut bei Temperatur 0.1
- Prefix-Cache-Warmup: Anstatt alles beim Laden der Quelle zu cachen, wird der KV-Cache aufgewärmt, wenn der Benutzer die Quellenvorschau sieht. Wenn sie auf Ausführen klicken, ist das Präfix bereits mit
--enable-prefix-cachingauf vLLM gecacht - Zweisprachige FTS5-Suche: Benutzeranfrage → Nemotron extrahiert Schlüsselwörter in Englisch und Japanisch → OR-verknüpfte FTS5 MATCH-Abfrage, effektiv für mehrsprachige Patent-/Forschungsdaten
Leistungszahlen
- ~80-120 tok/s Ausgabe
- 8192 maximale Tokens
- Quellenextraktion: ~3-5s (Schlüsselwortextraktion + FTS5 + DDG parallel)
- Vollständige Antwort mit 5 Quellen + 3 Web-Ergebnissen: ~50s für eine detaillierte Antwort auf RTX 5090
Einrichtung und Source
Der Quellcode ist verfügbar unter https://github.com/soy-tuber/SoyLM. Es handelt sich um eine Einzeldatei-Anwendung, die mit uv pip install -r requirements.txt installiert werden kann. Beachten Sie, dass vLLM mit den Nemotron-Parser-Plugins separat benötigt wird.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

Qwen3.5-9B-Claude-4.6-Opus-Uncensored-v2-Modell mit LM Studio-Konfiguration veröffentlicht
Ein zusammengeführtes unzensiertes Modell, das die Qwen3.5-9B-Architektur mit Claude-4.6-Opus-Trainingsdaten kombiniert, ist jetzt verfügbar. Für optimale Leistung werden spezifische LM-Studio-0.4.7-Einstellungen bereitgestellt, einschließlich Temperatur 0.7 und Top-K-Sampling 20.

Claude Code v2.1.144: Hintergrundsitzungen, /model-Scoping und 15-Sekunden-Startzeitüberschreitung
Claude Code v2.1.144 fügt /resume für Hintergrundsitzungen hinzu, beschränkt /model auf die aktuelle Sitzung und behebt einen 75s-Start-Hang, wenn api.anthropic.com nicht erreichbar ist, mit einem 15s-Timeout.

Werld: Offene künstliche Lebenssimulation mit sich entwickelnden neuronalen Netzen
Werld ist eine Echtzeit-Simulation künstlichen Lebens, bei der Agenten mit NEAT-Neuronalen Netzen ihre eigene neuronale Architektur, sensorische Verarbeitung und Verhaltensweisen entwickeln, ohne fest kodierte Regeln oder Belohnungsfunktionen. Die Simulation beginnt mit 30 Agenten auf einem Watts-Strogatz-Kleinstwelt-Graphen mit 64 sensorischen Kanälen, 7 kontinuierlichen Motorfunktionen und 29 vererbbaren Genommerkmalen.

Anthropics Multi-Agent-Harness-Design zur Verbesserung der Codequalität von Claude
Anthropics Blogbeitrag beschreibt ein Harness-Design mit mehreren Agenten, um Claudes Kontextangst und Selbstbewertungsverzerrung anzugehen, mit spezifischen Agentenrollen und Bewertungskriterien für Frontend- und Full-Stack-Entwicklung.