agentcache: Biblioteca Python para Cache de Prefixo de LLM Multi-Agente

✍️ OpenClawRadar📅 Publicado: April 13, 2026🔗 Source
agentcache: Biblioteca Python para Cache de Prefixo de LLM Multi-Agente
Ad

agentcache é uma biblioteca Python projetada para otimizar sistemas LLM multiagente implementando o cache de prefixos como um recurso central. A biblioteca aborda o problema comum em que frameworks como CrewAI, AutoGen e open-multi-agent criam sessões novas para cada worker, resultando em zero acertos no cache e custos duplicados de prompt.

Como Funciona

A biblioteca opera com uma abordagem baseada em fork em vez de criar sessões separadas:

  • Inicie uma sessão com um prompt de sistema compartilhado
  • Faça a primeira chamada - o provedor calcula e armazena em cache o prefixo
  • Quando você precisa de N workers, faça fork em vez de criar N novas sessões
  • Sessão pai: [sistema, msg1, msg2, ...]
  • Sessão com fork: [sistema, msg1, msg2, ..., TAREFA_DO_WORKER]
  • Prefixo exatamente igual = acerto no cache
Ad

Recursos Principais

  • Forks seguros para cache: Mantém prefixos idênticos entre sessões de workers
  • Detecção de quebra de cache: Compara snapshots e relata exatamente o que mudou quando os acertos no cache caem
  • Compactação segura para cache: Para sessões de longa duração, verifica saídas antigas de ferramentas antes de cada chamada e substitui resultados grandes por marcadores determinísticos para manter contexto menor enquanto preserva prefixos armazenáveis em cache
  • Congelamento de parâmetros: Congela parâmetros relevantes para o cache antes do fork (prompt do sistema, modelo, ferramentas, mensagens, configuração de raciocínio)
  • Agendamento de DAG de tarefas: Permite workers paralelos a partir de uma sessão em cache

Resultados de Desempenho

Em um teste direto com GPT-4o-mini (coordenador + 3 workers, mesma tarefa):

  • Injeção de texto / sessões separadas: 0% de acertos no cache, 85,7 segundos
  • Forks de prefixo: 75,8% de acertos no cache, 37,4 segundos
  • As taxas de acerto no cache por worker normalmente variam de 80-99%

Instalação e Uso

Instale via pip:

pip install "git+https://github.com/masteragentcoder/agentcache.git@main"

A biblioteca está disponível no GitHub em github.com/masteragentcoder/agentcache.

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also

Claude Code v2.1.126: Seletor de Modelo, Limpeza de Projeto, Correções no OAuth e Melhorias de Segurança
Tools

Claude Code v2.1.126: Seletor de Modelo, Limpeza de Projeto, Correções no OAuth e Melhorias de Segurança

Claude Code v2.1.126 adiciona um seletor /model para gateways compatíveis com Anthropic, um novo comando claude project purge, corrige o login OAuth em WSL2/SSH/containers e corrige problemas de segurança com configurações gerenciadas e exposição da área de transferência no Windows.

OpenClawRadar
FlowBoard v5: O Espaço de Trabalho de Projeto onde Seus Agentes de IA Realmente Funcionam
Tools

FlowBoard v5: O Espaço de Trabalho de Projeto onde Seus Agentes de IA Realmente Funcionam

O FlowBoard v5 é um espaço de trabalho baseado em React para agentes de IA. Inclui um armazenamento de tarefas orientado a eventos (SQLite), suporte a múltiplos agentes, ciclo de ideias para especificações e widgets modulares de visão geral.

OpenClawRadar
Extensão OpenClaw Claude Atualizada para Usar o SDK do Agent Após Mudanças na Cobrança da Anthropic
Tools

Extensão OpenClaw Claude Atualizada para Usar o SDK do Agent Após Mudanças na Cobrança da Anthropic

Um desenvolvedor de extensão do OpenClaw reescreveu sua integração CLI do Claude para usar o claude-agent-sdk oficial depois que a Anthropic começou a detectar e reclassificar o uso da CLI como uso de aplicativo de terceiros, que fatura contra um pool de créditos separado em vez dos limites do plano Max.

OpenClawRadar
Servidor MCP Soul Adiciona Memória Persistente e Segurança para LLMs Locais
Tools

Servidor MCP Soul Adiciona Memória Persistente e Segurança para LLMs Locais

Soul é um servidor MCP de código aberto que fornece memória persistente entre sessões para LLMs locais com dois comandos: n2_boot no início e n2_work_end no final. Inclui recursos de segurança Ark que bloqueiam comandos perigosos como rm -rf e DROP DATABASE sem custo de tokens, além de configuração de armazenamento em nuvem.

OpenClawRadar