onWatch: Rastreador de cota de API local de código aberto com armazenamento SQLite

onWatch é uma ferramenta de código aberto para rastrear cotas de API de IA localmente, projetada especificamente para a comunidade de software local-first. Mantém todos os dados na sua máquina sem dependências externas.
Detalhes Principais
A abordagem local-first da ferramenta inclui:
- Todos os dados armazenados em banco de dados SQLite local
- Sem serviço em nuvem, sem criação de conta, sem telemetria
- Binário único (~13MB) - sem dependências de runtime
- Daemon em segundo plano, uso de RAM <50MB
- Painel servido localmente no localhost
onWatch atualmente rastreia 6 provedores de API em nuvem: Anthropic, Codex, Copilot, Synthetic, Z.ai e Antigravity. Isso é útil para desenvolvedores que usam APIs em nuvem junto com modelos locais e querem visibilidade sobre seus gastos em nuvem.
O desenvolvedor menciona possíveis recursos futuros, incluindo monitoramento de modelos locais, como uso de recursos do ollama e rastreamento de VRAM, se houver interesse da comunidade.
A ferramenta está disponível no GitHub em https://github.com/onllm-dev/onwatch.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

altRAG: Substitua o Vector DB RAG por Arquivos de Ponte de 2KB para Agentes de IA de Codificação
altRAG é uma ferramenta Python que substitui o RAG de banco de dados vetorial por arquivos de ponteiro leves. Ele escaneia arquivos de habilidades em Markdown/YAML para criar um arquivo esqueleto de 2KB que mapeia seções para números de linha exatos e deslocamentos de bytes, permitindo que agentes de IA leiam apenas as seções necessárias em vez de arquivos inteiros.

cortex-engine MCP server adiciona suporte a memória persistente e multiagente
cortex-engine v0.4.0 é um servidor MCP de código aberto que fornece aos agentes de IA memória de longo prazo persistente com ferramentas como observe(), query(), believe() e dream(). Agora ele suporta múltiplos agentes com namespaces de memória isolados.

LightMem: Sistema de Memória Leve para Agentes LLM com Ganhos de 10×+ e Custo 100× Menor
LightMem é um sistema de memória modular para agentes LLM que alcança uma melhoria de precisão de até 10,9%, enquanto reduz tokens em até 117×, chamadas de API em até 159× e tempo de execução em mais de 12×. Ele foi projetado para raciocínio de contexto longo escalável em fluxos de trabalho de agentes.

Um Padrão para Executar Claude Code em Sessões Noturnas Não Supervisionadas Sem Desvio
Um framework de três peças — executor da cadeia, supervisor e um único contrato de handoff — resolve o problema de desvio do ciclo de feedback em sessões autônomas de várias horas do Claude Code.