VoidLLM: Zero-Knowledge-Proxy für Ollama und vLLM mit Team-Zugriffskontrolle

VoidLLM ist ein Proxy-Server, der zwischen Ihren Anwendungen und lokalen LLM-Servern wie Ollama und vLLM sitzt. Er fügt Organisations- und Team-Zugriffskontrolle, API-Schlüsselverwaltung, Nutzungsverfolgung und Ratenbegrenzung hinzu, ohne jemals Ihre Prompts oder Inhalte einzusehen.
Hauptmerkmale
- OpenAI-kompatibel – funktioniert mit jedem SDK, das das OpenAI-API-Format unterstützt
- Provider-Adapter für Ollama, vLLM, Anthropic, Azure und OpenAI
- <2ms Proxy-Overhead
- Ratenbegrenzung pro Organisation, Team oder API-Schlüssel (verteilt über Redis)
- Kostenverfolgung und Analyse-Dashboard
- Keine Inhaltsprotokollierung – nur Metadaten (wer hat auf welches Modell zugegriffen und wie viele Tokens wurden verwendet)
Anwendungsfall
Wenn Sie Ollama oder vLLM lokal betreiben und es mit einem Team mit ordnungsgemäßer Zugriffskontrolle und Nutzungssichtbarkeit teilen möchten, bietet dieser Proxy diese Funktionen, während die Privatsphäre durch seine Zero-Knowledge-Architektur gewahrt bleibt.
Das Tool ist auf GitHub verfügbar unter github.com/voidmind-io/voidllm.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

Lokale-First Filmzusammenfassungspipeline mit Whisper + CLIP + Ollama
Eine vollständig lokale Pipeline, die automatisch erzählte Film-Zusammenfassungsvideos erstellt – mit Whisper, CLIP, Ollama, Edge TTS und FFmpeg. Filmdatei reinwerfen, in etwa 15 Minuten eine erzählte Zusammenfassung erhalten.

**Claude Code Routines: Planen und Ausführen von Agenten-Aufgaben wie mit Cron, inkl. logischer Entscheidungsfindung** Oder kürzer und prägnanter: **Claude Code Routines: Agenten-Aufgaben wie mit Cron planen – mit logischer Entscheidungsfindung**
Mit Claude Code Routines können Sie Agentenaufgaben planen, ohne eine Sitzung offen halten zu müssen. Ein Reddit-Nutzer teilt konkrete Beispiele: nächtliche Commit-Überprüfung, wöchentlicher Abhängigkeitscheck, tägliche Fehlerlog-Analyse – mit KI-Schlussfolgerungen statt roher Skriptausgabe.

Persistente Indizes gegenüber Extraktion: Architektur für einen YouTube-MCP-Server
Ein Entwickler teilt Architektur-Notizen für den Aufbau eines YouTube-MCP-Servers, der anstelle des gängigen "Extrahieren-und-Vergessen"-Ansatzes auf persistente lokale Indizes setzt. Zu den Kernentscheidungen gehören ein dreistufiges Fallback-System, SQLite + sqlite-vec für die Vektorspeicherung, eine Abstraktion für Embedding-Provider und ein separater visueller Suchindex.

devcontainer-mcp: Gib KI-Agenten ihre eigene Entwicklungsumgebung, nicht deine
devcontainer-mcp ist ein MCP-Server, der 45 Tools für KI-Agenten bereitstellt, um Dev-Container zu erstellen, zu verwalten und darin zu arbeiten – unterstützt durch Docker, DevPod oder GitHub Codespaces – und dabei die Host-Rechner sauber hält.