VoidLLM: Proxy de Conhecimento Zero para Ollama e vLLM com Controle de Acesso por Equipe

VoidLLM é um servidor proxy que fica entre suas aplicações e servidores locais de LLM como Ollama e vLLM. Ele adiciona controle de acesso por organização e equipe, gerenciamento de chaves de API, rastreamento de uso e limitação de taxa sem nunca ver seus prompts ou conteúdo.
Principais Recursos
- Compatível com OpenAI — funciona com qualquer SDK que suporte o formato da API OpenAI
- Adaptadores para provedores Ollama, vLLM, Anthropic, Azure e OpenAI
- Sobrecarga de proxy <2ms
- Limitação de taxa por organização, equipe ou chave de API (distribuída via Redis)
- Rastreamento de custos e painel de análises
- Zero registro de conteúdo — apenas metadados (quem acessou qual modelo e quantos tokens foram usados)
Caso de Uso
Se você está executando Ollama ou vLLM localmente e deseja compartilhá-lo com uma equipe com controle de acesso adequado e visibilidade de uso, este proxy fornece essas capacidades enquanto mantém a privacidade através de sua arquitetura de conhecimento zero.
A ferramenta está disponível no GitHub em github.com/voidmind-io/voidllm.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

hipEngine: Inferência Nativa Rápida do Qwen 3.6 para RDNA3 (Strix Halo, 7900 XTX)
hipEngine é um novo mecanismo de inferência nativo ROCm (AGPLv3) para Qwen 3.6 MoE em GPUs RDNA3. Benchmarks mostram prefill de até 2718 tok/s em 7900 XTX, competitivo com llama.cpp, e cache KV INT8 permitindo contexto completo de 256K em menos de 24 GB.

ClawControl v1.7.1 corrige problemas de uso diário no cliente OpenClaw
ClawControl v1.7.1 é um cliente de código aberto para OpenClaw disponível no Windows, Mac, Linux, iOS e Android. Esta versão se concentra em corrigir problemas do tipo 'por que está fazendo isso?' encontrados durante o uso diário do OpenClaw.

Recuperação de código para agentes de IA: Por que embeddings vetoriais falham e gráficos LLM por arquivo vencem
Após um ano construindo um sistema de indexação de código, a equipe por trás do Bytebell descobriu que embeddings vetoriais em chunks de código e ASTs do Tree-sitter ambos ficaram aquém, enquanto resumos LLM por arquivo armazenados em um grafo Neo4j com busca semântica de texto completo melhoraram significativamente a precisão da recuperação.

Linha de Status Personalizada para Claude Code Mostra Uso de Contexto, Custo e Branch do Git
Um usuário do Reddit criou um script bash que utiliza a configuração statusLine do Claude Code para exibir informações em tempo real, incluindo uso da janela de contexto, custo da sessão, modelo ativo e branch atual do git. O script requer jq e está disponível no GitHub.