Pali v0.1: Infraestrutura de Memória de Código Aberto para LLMs com Benchmarks Reproduzíveis

O que é o Pali
Pali é uma infraestrutura de memória de código aberto para LLMs com foco em infraestrutura. É construído em Go como um único binário pronto para uso, com configurações para anexos plug-and-play como qdrant, neo4j, ollama e openrouter. O projeto tem licença MIT e é totalmente auto-hospedável.
Principais Recursos
- APIs de memória multi-inquilino com isolamento por inquilino
- Recuperação híbrida através de métodos léxicos, densos, de fusão, reranking e expansão multi-hop opcional
- Servidor MCP com ferramentas de memória-first e resolução consciente do inquilino
- API REST com respectivos pacotes Python e JavaScript disponíveis
- Painel para operadores inspecionarem inquilinos, memórias e estado do sistema
- Pontos de extensão plug-and-play para armazenamentos vetoriais, embedders, backends de entidades/fatos e pontuação/roteamento
Abordagem de Benchmark
O criador aborda problemas comuns em benchmarks de pilhas de memória implementando uma abordagem reproduzível:
- Cada execução armazena os arquivos de configuração exatos usados (perfil + renderizado)
- Hardware totalmente divulgado (CPU, GPU, RAM, versões dos modelos)
- Apenas comparações pareadas — mesmo fixture/avaliação/top_k em todos os perfis
- Faixas de velocidade e faixas de qualidade de recuperação são mantidas separadas
Números de Desempenho
Benchmarks de testes em um Ryzen 9 7950X + RTX 5070:
- sqlite + léxico: 208 operações de armazenamento/s, Top1=0.32, Recall@5=0.54
- qdrant + ollama (all-minilm): 98 operações de armazenamento/s, Top1=0.34, Recall@5=0.52
- parser+graph (faixa de estresse de memória estruturada): 2.4 operações de armazenamento/s — lento devido ao custo de extração estruturada, mas atinge ~30 média no LoCoMo com picos temporários em torno de ~40
Esclarecimento Importante
Pali não é memória de LLM no sentido SaaS. Ele retorna resultados brutos de recuperação que você otimiza para seu próprio fluxo de trabalho — sem pontuação de caixa preta, sem decisões de provedor bloqueadas. Você pode trocar backends vetoriais, embedders e pontuadores através de configuração sem alterar o contrato do seu aplicativo.
Status do Projeto
A versão 0.1 foi recentemente lançada com um conjunto adequado de benchmarks adicionado. O criador está procurando por contribuidores.
📖 Read the full source: r/LocalLLaMA
👀 See Also

Watchtower: Um Proxy Local para Monitorar o Tráfego da API de Código Claude
Watchtower é uma ferramenta gratuita e de código aberto que atua como um proxy HTTP local e painel web em tempo real para interceptar e exibir todo o tráfego de API entre o Claude Code (ou Codex CLI) e suas APIs. Ele mostra requisições, fluxos SSE, definições de ferramentas, prompts do sistema, uso de tokens e limites de taxa.
Imposto de Habilidades do Claude Code: 2.596 Habilidades Instaladas, 40 Usadas, $91/Mês Desperdiçados
Cada habilidade do Claude Code instalada carrega no prompt do sistema de cada sessão. Um usuário mediu 102.651 tokens carregados por sessão, com 98,6% nunca usados, custando ~$91/mês. Uma ferramenta de código aberto, skill-tax, audita uso e custo.

Ops Dashboard OpenClaw: Dashboard Local-Primeiro para Desenvolvedores Solo com Múltiplos Repos
Um desenvolvedor solo criou o ops-dashboard, um aplicativo local-first que indexa vaults do Obsidian, repositórios e logs em um único painel consultável. BYOK, licença MIT, sem necessidade de nuvem.

SigMap v8.9: Camada de Contexto Determinística Reduz Uso de Tokens em 97% para Agentes de Codificação de IA
SigMap v8.9 atinge redução de 97% no uso de tokens, 88% de precisão no hit@5 e 49% menos prompts por tarefa. Funciona com Copilot, Claude Code, Cursor, Windsurf, Codex, OpenCode, Gemini CLI. Zero dependências, totalmente offline.