VoidLLM: Zero-Knowledge-Proxy für Ollama und vLLM mit Team-Zugriffskontrolle

VoidLLM ist ein Proxy-Server, der zwischen Ihren Anwendungen und lokalen LLM-Servern wie Ollama und vLLM sitzt. Er fügt Organisations- und Team-Zugriffskontrolle, API-Schlüsselverwaltung, Nutzungsverfolgung und Ratenbegrenzung hinzu, ohne jemals Ihre Prompts oder Inhalte einzusehen.
Hauptmerkmale
- OpenAI-kompatibel – funktioniert mit jedem SDK, das das OpenAI-API-Format unterstützt
- Provider-Adapter für Ollama, vLLM, Anthropic, Azure und OpenAI
- <2ms Proxy-Overhead
- Ratenbegrenzung pro Organisation, Team oder API-Schlüssel (verteilt über Redis)
- Kostenverfolgung und Analyse-Dashboard
- Keine Inhaltsprotokollierung – nur Metadaten (wer hat auf welches Modell zugegriffen und wie viele Tokens wurden verwendet)
Anwendungsfall
Wenn Sie Ollama oder vLLM lokal betreiben und es mit einem Team mit ordnungsgemäßer Zugriffskontrolle und Nutzungssichtbarkeit teilen möchten, bietet dieser Proxy diese Funktionen, während die Privatsphäre durch seine Zero-Knowledge-Architektur gewahrt bleibt.
Das Tool ist auf GitHub verfügbar unter github.com/voidmind-io/voidllm.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

Coding-Flashcards: 800+ Anki-Karten für Rust, SQLite, Godot und Wolfram Language
Über 800 Markdown-Karteikarten, die Rust, SQLite, Godot und die Wolfram Language von Grund auf behandeln, mit Skripten zur Konvertierung in Anki-Decks oder PDFs.

OpenClaw auf einem VPS mit einem Ein-Befehl-CLI bereitstellen.
Ein Reddit-Nutzer behauptet, eine CLI entwickelt zu haben, die OpenClaw mit einem einzigen Befehl auf einem VPS für 4,99 $/Monat bereitstellt und eine kostengünstige Alternative zu Mac Minis bietet.

OmniCoder-9B-Fine-Tuning zeigt eine starke Leistung für agentenbasiertes Codieren auf Systemen mit 8 GB VRAM.
Ein Reddit-Nutzer testete OmniCoder-9B, eine Feinabstimmung von Qwen3.5-9B auf Opus-Traces, mit OpenCode und berichtete von Geschwindigkeiten von über 40 Tokens pro Sekunde unter Verwendung der Q4_K_M GGUF-Quantisierung bei einer Kontextlänge von 100k auf einem System mit 8GB VRAM.

Multi-Operator Claude Code: Hub-basierte Architektur für Multi-Agent-Sessions
Ein Hub-basiertes Setup für Claude Code ermöglicht mehreren Personen, an derselben Sitzung teilzunehmen, Teilaufgaben über Repos zu verteilen und headless Agents in Docker-Containern auszuführen.