Caliby: Base de datos vectorial embebida de código abierto para agentes de IA con almacenamiento híbrido de texto+vector

Caliby ahora es de código abierto: una base de datos vectorial incrustada y en proceso diseñada para cargas de trabajo de IA Agente y RAG. Desarrollado por un equipo que incluye a un doctor del Grupo de Bases de Datos del MIT (equipo de Michael Stonebraker) y Sea-Land AI, es una única biblioteca en C++ con enlaces a Python.
¿Por qué otro vector DB?
El equipo encontró que las soluciones existentes no eran suficientes para casos de uso de agentes/LLM:
- FAISS: Puramente en memoria, sin persistencia — reiniciar borra el índice.
- pgvector: Techo de rendimiento debido a la dependencia de PostgreSQL.
- Chroma / Qdrant / Milvus: Requieren servicios separados, demasiado pesados para escenarios incrustados.
- LanceDB: Incrustado pero carece de índices avanzados como DiskANN, cuellos de botella de rendimiento.
Caliby aspira a ser un motor de datos ligero e incrustable como DuckDB, pero para almacenamiento de vectores + texto.
Arquitectura: Almacenamiento Híbrido Texto + Vectores
Caliby unifica datos de texto y vectores en un solo sistema. En lugar de lidiar con una base de datos vectorial y una relacional, almacenas embeddings, texto sin formato y metadatos en una sola biblioteca. La arquitectura usa un pool de buffers organizado por páginas para la persistencia.
Índices Soportados
- HNSW: Recuperación general de alto rendimiento, optimizado para CPU.
- DiskANN (Vamana Graph): Diseñado para escenarios en disco, supera a FAISS en disco.
- IVF+PQ: Archivo invertido con cuantificación de producto para índices compactos.
Caliby también soporta búsqueda por fuerza bruta con funciones de distancia SIMD (AVX-512, AVX2, SSE) (L2, Producto Interno, Coseno).
Afirmaciones de Rendimiento
Caliby supera a pgvector por 4x y supera significativamente a FAISS en escenarios de almacenamiento en disco. Maneja millones a decenas de millones de vectores en disco sin requerir un servicio separado.
Primeros Pasos
Simplemente instala el paquete:
pip install caliby
La API de Python expone las clases HnswIndex, DiskANN y IVFPQIndex a través de pybind11. Sin dependencias, sin configuración de servidor, sin DevOps.
Para Quién Es
Desarrolladores de IA Agente y constructores de pipelines RAG que quieren una base de datos vectorial incrustada, sin infraestructura, con capacidades híbridas de texto+vectores y rendimiento de nivel productivo.
📖 Leer la fuente completa: r/LocalLLaMA
👀 Ver también

agent-recall: MCP local de SQLite para memoria de código persistente de Claude
agent-recall es un servidor MCP que proporciona a Claude Code memoria persistente entre sesiones utilizando un archivo SQLite local. Ofrece 9 herramientas MCP para guardar entidades, relaciones y observaciones, con resúmenes generados por LLM al inicio de cada sesión en lugar de volcados de datos crudos.

Capa de Identidad y Reputación para Agentes OpenClaw
Un equipo de desarrolladores construyó MCP-I e IdentiClaw para resolver la pérdida de identidad en flujos de trabajo de agentes de múltiples pasos, además de knowthat.ai como un registro de reputación. Donaron la especificación MCP-I a la Decentralized Identity Foundation.

uimax-mcp: Servidor MCP gratuito para revisión y corrección automatizada de código frontend con Claude Code
uimax-mcp es un servidor MCP gratuito que automatiza la revisión y corrección de código frontend utilizando Claude Code. Con un solo comando, captura capturas de pantalla, ejecuta auditorías de Lighthouse y accesibilidad, escanea en busca de antipatrones y genera correcciones automatizadas.

Rukuzu: Migrando una Base de Datos de Grafos de 200,000 Líneas de C++ a Rust con Pruebas Sistemáticas
El proyecto Rukuzu describe un flujo de trabajo para portar la base de datos de grafos embebida kuzu, escrita en C++ con 200,000 líneas de código, a Rust, utilizando un comando personalizado de Claude Code para mantener ambas versiones simultáneamente y verificar la corrección mediante más de 2,700 pruebas.