agentcache: Biblioteca Python para Cache de Prefixo de LLM Multi-Agente

agentcache é uma biblioteca Python projetada para otimizar sistemas LLM multiagente implementando o cache de prefixos como um recurso central. A biblioteca aborda o problema comum em que frameworks como CrewAI, AutoGen e open-multi-agent criam sessões novas para cada worker, resultando em zero acertos no cache e custos duplicados de prompt.
Como Funciona
A biblioteca opera com uma abordagem baseada em fork em vez de criar sessões separadas:
- Inicie uma sessão com um prompt de sistema compartilhado
- Faça a primeira chamada - o provedor calcula e armazena em cache o prefixo
- Quando você precisa de N workers, faça fork em vez de criar N novas sessões
- Sessão pai: [sistema, msg1, msg2, ...]
- Sessão com fork: [sistema, msg1, msg2, ..., TAREFA_DO_WORKER]
- Prefixo exatamente igual = acerto no cache
Recursos Principais
- Forks seguros para cache: Mantém prefixos idênticos entre sessões de workers
- Detecção de quebra de cache: Compara snapshots e relata exatamente o que mudou quando os acertos no cache caem
- Compactação segura para cache: Para sessões de longa duração, verifica saídas antigas de ferramentas antes de cada chamada e substitui resultados grandes por marcadores determinísticos para manter contexto menor enquanto preserva prefixos armazenáveis em cache
- Congelamento de parâmetros: Congela parâmetros relevantes para o cache antes do fork (prompt do sistema, modelo, ferramentas, mensagens, configuração de raciocínio)
- Agendamento de DAG de tarefas: Permite workers paralelos a partir de uma sessão em cache
Resultados de Desempenho
Em um teste direto com GPT-4o-mini (coordenador + 3 workers, mesma tarefa):
- Injeção de texto / sessões separadas: 0% de acertos no cache, 85,7 segundos
- Forks de prefixo: 75,8% de acertos no cache, 37,4 segundos
- As taxas de acerto no cache por worker normalmente variam de 80-99%
Instalação e Uso
Instale via pip:
pip install "git+https://github.com/masteragentcoder/agentcache.git@main"
A biblioteca está disponível no GitHub em github.com/masteragentcoder/agentcache.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

Voygr Lança API de Validação de Negócios para Inteligência de Localização Atualizada
A API de Validação de Negócios da Voygr verifica se as empresas estão operando, fechadas, rebatizadas ou inválidas, agregando múltiplas fontes de dados e detectando sinais conflitantes. A equipe está construindo um perfil de local infinito e consultável que combina dados precisos de locais com contexto web atualizado, como notícias, artigos e eventos.

Motor de Jogo de Aventura de Texto para Claude Desktop
Um motor de jogo de aventura de texto roda inteiramente dentro do Claude Desktop como uma habilidade, sem servidores, aplicativos ou código para executar. Inclui mecânicas completas de RPG, renderização de dados 3D, 19 módulos de expansão e arquivos de salvamento portáteis.

altRAG: Substitua o Vector DB RAG por Arquivos de Ponte de 2KB para Agentes de IA de Codificação
altRAG é uma ferramenta Python que substitui o RAG de banco de dados vetorial por arquivos de ponteiro leves. Ele escaneia arquivos de habilidades em Markdown/YAML para criar um arquivo esqueleto de 2KB que mapeia seções para números de linha exatos e deslocamentos de bytes, permitindo que agentes de IA leiam apenas as seções necessárias em vez de arquivos inteiros.

AutoDream: Sistema de memória com 11 ganchos para Claude Code com recursos de segurança
AutoDream é uma ferramenta de código aberto que adiciona persistência de memória do projeto e segurança de comandos ao Claude Code. Ele usa 11 hooks em 6 eventos para injetar contexto, bloquear comandos perigosos e sobreviver à operação /compact.