Caliby:面向AI代理的开源嵌入式向量数据库,支持文本+向量混合存储

Calibyがオープンソースになりました。AIエージェントおよびRAGワークロード向けに設計された、組み込み型のインプロセスベクトルデータベースです。MITデータベースグループ(Michael Stonebrakerのチーム)のPhDを含むチームとSea-Land AIによって開発され、Pythonバインディングを持つ単一のC++ライブラリです。
なぜ別のベクトルDBが必要なのか?
チームは、エージェント/LLMのユースケースにおいて既存のソリューションに欠点があると感じました:
- FAISS:純粋なインメモリで永続性がなく、再起動でインデックスが消える。
- pgvector:PostgreSQLに依存するため、パフォーマンスに上限がある。
- Chroma / Qdrant / Milvus:別サービスの起動が必要で、組み込みシナリオには重すぎる。
- LanceDB:組み込み型だが、DiskANNのような高度なインデックスがなく、パフォーマンスにボトルネックがある。
Calibyは、DuckDBのように軽量で組み込み可能なデータエンジンを目指していますが、ベクトル+テキストストレージ向けです。
アーキテクチャ:ハイブリッドテキスト+ベクトルストレージ
Calibyはテキストデータとベクトルデータを単一のシステムに統合します。ベクトルDBとリレーショナルDBを行き来する代わりに、埋め込み、生テキスト、メタデータを1つのライブラリに保存します。アーキテクチャは、永続性のためにページ編成のバッファプールを使用します。
サポートされるインデックス
- HNSW:汎用の高性能検索、CPU最適化。
- DiskANN(Vamana Graph):ディスクシナリオ向けに設計されており、ディスク上でFAISSを上回る。
- IVF+PQ:製品量子化を使用した転置ファイルで、コンパクトなインデックスを実現。
CalibyはSIMD(AVX-512、AVX2、SSE)距離関数(L2、内積、コサイン)を用いたブルートフォース検索もサポートしています。
パフォーマンスの主張
Calibyはpgvectorを4倍上回り、ディスクストレージシナリオではFAISSを大幅に凌駕します。別サービスの起動を必要とせず、数百万から数千万のベクトルをディスク上で処理できます。
始め方
パッケージをインストールするだけです:
pip install caliby
Python APIは、pybind11を介してHnswIndex、DiskANN、IVFPQIndexクラスを公開します。依存関係なし、サーバー設定不要、DevOps不要です。
対象ユーザー
組み込み型でインフラ不要の、ハイブリッドテキスト+ベクトル機能と本番グレードのパフォーマンスを備えたベクトルデータベースを求める、AIエージェント開発者やRAGパイプラインビルダー。
📖 全文ソース: r/LocalLLaMA
👀 See Also

Claude VS Code拡張機能の推論努力スライダーが一貫性のない値を送信する
Claude VS Code拡張機能の推論努力スライダーは、モデルに一貫性のない数値を送信するバグがあり、非単調なマッピングにより、スライダーを上に動かすと実際にはより低い数値が送信される可能性があります。

LiteParse: AIエージェント向け高速オープンソース文書パーサー
LiteParseは、バウンディングボックスによる空間テキスト解析を提供し、GPUなしでローカルで動作し、PDF、Office文書、画像をサポートするオープンソースのドキュメントパーサーです。Claude Code、Cursor、OpenClawを含む40以上のAIエージェント向けスキルとしてインストール可能です。

MemRosettaは、たった一つのコマンド設定でClaude Codeに永続メモリを追加します。
MemRosetta v0.2.4は、単一のnpmインストールコマンドでClaude Codeにセッション間のメモリを提供します。このツールには6つのメモリツールを備えたMCPサーバー、自動セッションキャプチャ、およびCursorと共有可能なローカルSQLiteストレージが含まれています。

Roam-Code CLIの紹介:コード探索のためのより高速で決定論的な代替手段
Roam-Code CLIは、Claude Codeの探索フェーズを、より高速で決定論的な代替手段に置き換えるもので、コードベースをインデックス化して効率を向上させます。