RAG Híbrido para Memoria de Agente Local con OpenClaw, Ollama y nomic-embed-text

Problema: Recuperación, no almacenamiento
El desarrollador tenía meses de registros de memoria diarios almacenados en archivos markdown, lo que funcionaba para guardar información pero no para encontrarla nuevamente. Cuando el agente necesitaba contexto pasado, recurría a ejecutar ls, abriendo archivos uno por uno, gastando tokens y a veces perdiendo información relevante. El problema era la recuperación por significado, no el almacenamiento.
Solución: RAG híbrido con incrustaciones locales
El desarrollador habilitó memorySearch en OpenClaw usando Ollama como proveedor y nomic-embed-text para incrustaciones locales, ejecutándose en modo híbrido. Híbrido significa 70% de similitud vectorial (coseno mediante nomic-embed-text) combinado con 30% de coincidencia de palabras clave BM25. Los vectores manejan proximidad semántica mientras que BM25 maneja nombres exactos, versiones e IDs. MMR reduce resultados redundantes y el decaimiento temporal da más peso a los registros recientes. Todo se ejecuta localmente sin APIs externas.
Configuración
"memorySearch": {
"provider": "ollama",
"query": {
"hybrid": {
"enabled": true,
"vectorWeight": 0.7,
"textWeight": 0.3,
"mmr": {
"enabled": true,
"lambda": 0.7
},
"temporalDecay": {
"enabled": true,
"halfLifeDays": 30
}
}
}
}Instrucciones de configuración
- OpenClaw detecta Ollama automáticamente en localhost:11434
- No es necesario especificar baseUrl o modelo - detecta nomic-embed-text si se descargó
- Ejecuta
ollama pull nomic-embed-textprimero, luego reinicia el gateway - Evita configurar
provider: "openai"y apuntar baseUrl a Ollama - usaprovider: "ollama"directamente
Cambio de comportamiento requerido
Habilitar la herramienta no fue suficiente. Sin instrucciones explícitas para usar memorySearch antes de leer archivos directamente, el agente lo omitiría y tomaría la ruta más lenta y costosa en tokens. El desarrollador escribió una regla tanto en AGENTS.md como en MEMORY.md en el espacio de trabajo para hacer que la búsqueda de memoria sea parte del flujo de trabajo normal del agente.
Resultados antes vs después
- Antes: Navegar carpetas, abrir archivos ciegamente, esperar que coincida la redacción, desperdiciar tokens, perder contexto
- Después: Ejecutar
memory_searchcon consulta semántica, recuperar resultados clasificados con puntuaciones de similitud, abrir la mejor coincidencia, responder desde notas pasadas reales - Las puntuaciones de similitud para resultados relevantes típicamente oscilan entre 0.45 y 0.48 para nomic-embed-text en registros en prosa
Notas prácticas
- nomic-embed-text tiene un límite de contexto de 2048 tokens por defecto, no 8192 - archivos grandes pueden truncarse al indexar
- Los archivos de memoria en español funcionan bien - nomic-embed-text maneja español sin problemas
- La calidad de recuperación depende de la calidad de las notas - registros vagos aún causan dificultades en búsqueda semántica
Stack tecnológico
- OpenClaw (local, autoalojado)
- Ollama + nomic-embed-text:latest
- SQLite con sqlite-vec y FTS5 (creado automáticamente por OpenClaw en el primer uso)
- Mac mini M4, 16GB de memoria unificada
📖 Leer la fuente completa: r/openclaw
👀 Ver también

OpenClaw + Claude Code/Codex en tándem: un ejemplo real del mejor de ambos mundos
Una arquitectura práctica para usar Claude Code/Codex para construir y OpenClaw para ejecutar un motor de generación de prospectos y alcance. Elección específica de herramientas, desglose de costos y diseño de agentes.

Claude Orquestrador de Agentes de Código: Colas de Trabajo, Generación de Agentes, Puertas de Verificación
Una publicación en Reddit de r/clawdbot detalla cómo los agentes Claude Code operan una tienda gestionada por IA, manejando diseño, marketing, control de calidad y operaciones 30 veces al día. Enlaza con el Episodio 9 de una serie de blog que explica la canalización del orquestador en producción, incluyendo problemas que no se muestran en las demostraciones.

El quemado de tokens Opus de $2,500 por parte de un desarrollador en OpenClaw: flujos de trabajo reales vs herramientas
El dueño de una tienda de software relata cómo gastó $2,500 en tokens de Opus a través de OpenClaw, usándolo para corregir errores, automatización visual y administración de servidores, pero cuestiona qué significa realmente un 'workflow'.

Desarrollador Construye Motor de Simulación de Béisbol con IA Usando Claude Code en Dos Semanas
Un desarrollador utilizó Claude Code para construir un sistema completo de simulación de béisbol con 30 equipos de la MLB gestionados por IA, resúmenes de partidos, conferencias de prensa y podcasts de audio. El proyecto costó $50 en créditos de API e incluye un motor de simulación, una canalización de contenido, un bot de Discord y un sitio web.