VoidLLM:OllamaとvLLMのためのゼロ知識プロキシ、チームアクセス制御付き

VoidLLMは、OllamaやvLLMなどのローカルLLMサーバーとアプリケーションの間に位置するプロキシサーバーです。組織やチームのアクセス制御、APIキー管理、使用状況の追跡、レート制限を追加しますが、プロンプトやコンテンツを閲覧することはありません。
主な機能
- OpenAI互換 — OpenAI APIフォーマットをサポートする任意のSDKで動作
- Ollama、vLLM、Anthropic、Azure、OpenAI用のプロバイダーアダプター
- プロキシオーバーヘッド2ミリ秒未満
- 組織、チーム、またはAPIキーごとのレート制限(Redisによる分散)
- コスト追跡と分析ダッシュボード
- コンテンツロギングなし — メタデータのみ(誰がどのモデルにアクセスし、何トークン使用したか)
ユースケース
ローカルでOllamaやvLLMを実行しており、適切なアクセス制御と使用状況の可視化を備えてチーム全体で共有したい場合、このプロキシはゼロ知識アーキテクチャによるプライバシーを維持しながら、これらの機能を提供します。
このツールはGitHubで利用可能です: github.com/voidmind-io/voidllm。
📖 Read the full source: r/LocalLLaMA
👀 See Also

Gemma 4 26B対Qwen 3.5 27B:RTX 4090でのローカル業務ワークフローベンチマーク
ある開発者がRTX 4090ワークステーションでGemma 4 26BとQwen 3.5 27Bを18の実践的なビジネスオペレータータスクでテストしました。Gemmaが13勝5敗で勝利し、日常の実行作業ではより高速で規律正しい結果を示した一方、Qwenはより広範な戦略的思考で優れていました。

AIサブルーチン:ゼロトークンコストでの決定論的ブラウザ自動化
rtrvr.aiのAIサブルーチンは、ブラウザタスクを一度記録して呼び出し可能なツールとして保存し、認証情報を自動的に伝播させた状態でウェブページコンテキスト内で再生します。これにより、繰り返しタスクにおけるLLM推論コストと非決定性を排除します。

Memtrace: Claudeコードエージェントのための永続的で時間認識型のコードベースメモリ
Memtraceは、Tree-sitter AST解析とハイブリッド検索(BM25 + Jina-code埋め込み)を使用し、インデックス作成中にLLM推論コストをゼロに保ちながら、Claude Codeエージェントに常に新鮮なスナップショットと二時間軸リプレイを提供します。

マイクロソフト BitNet: CPUとGPU向けの1ビットLLM推論フレームワーク
マイクロソフトは、1ビットLLM向けの推論フレームワーク「BitNet」をリリースしました。CPUで1.37倍から6.17倍の高速化を実現し、エネルギー消費を55.4%から82.2%削減します。1000億パラメータのモデルを単一のCPUで秒間5〜7トークンの速度で実行可能です。