Oodle.ai lança Observabilidade de Agentes a US$ 10/Milhão de Traços

A Oodle.ai (por Kiran e Vijay) lançou um produto de Observabilidade de Agentes ao preço de US$ 10 por milhão de spans, com latência de consulta P99 inferior a um segundo e zero amostragem. O serviço armazena rastreamentos em S3 usando um formato colunar tipo Parquet personalizado, consultado via AWS Lambda.
Detalhes principais do lançamento no HN:
- Motor de armazenamento colunar personalizado desenvolvido por dois anos para logs, métricas e rastreamentos, agora aplicado a rastreamentos de agentes LLM.
- Rastreamentos podem ter de MB a GB; armazenados em S3 em um formato proprietário tipo parquet, consultados serverless com Lambda.
- Análise determinística por span antes de avaliações LLM: detecta falhas de ferramentas, repetições, loops, uso anormal de tokens, regressões de latência, violações de esquema, sentimento e outros sinais de produção.
- Preços: US$ 10 por milhão de spans. Ingestão US$ 0,30/GB, retenção US$ 0,001/GB/mês (exemplo: 1200 GB/mês + 90 dias de retenção = US$ 362/mês).
- Insights prontos: Falhas de Recuperação de Erros, Alta Duração, Baixa Satisfação do Usuário, Otimização de Custos de Modelo, Ineficiência de Cache, Excesso de Interações LLM.
- Autores usaram anteriormente Langfuse (6x mais caro). Atualmente processam 3M+ rastreamentos de agentes/dia com zero amostragem.
Como funciona: A Oodle armazena todos os rastreamentos sem amostragem, analisa cada span deterministicamente em busca de sinais de falha e, opcionalmente, executa avaliações baseadas em LLM nos rastreamentos sinalizados. As consultas em todos os dados retidos são uniformemente rápidas — sem camadas quentes/frias.
Para quem é: Equipes de engenharia que implantam agentes de IA em produção e precisam de rastreamento acessível e de alta fidelidade, sem amostragem.
📖 Leia a fonte completa: HN AI Agents
👀 See Also

Modelo de Raciocínio Estruturado Melhora a Precisão da Revisão de Código por IA
Um usuário do Reddit compartilha um modelo de raciocínio estruturado adaptado de uma pesquisa da Meta que força modelos de IA a completar etapas analíticas específicas antes de gerar revisões de código, melhorando a precisão em 5 a 12 pontos percentuais de acordo com arXiv:2603.01896.

Bot do Telegram para Gerenciar Canais Headless do Claude Code via tmux
Um bot Telegram sem dependências externas que inicia, para e monitora sessões do Claude Code Channels no tmux em um servidor headless, com reinicialização automática via watchdog.

Teste de LLMs locais para geração autônoma de código: Benchmark de qualidade versus velocidade
Um desenvolvedor criou uma estrutura de teste para avaliar LLMs locais em tarefas reais de geração de código Go, medindo sucesso de compilação, precisão na extração de campos e taxa de transferência. Os resultados comparam modelos em termos de qualidade e velocidade.

agentcache: Biblioteca Python para Cache de Prefixo de LLM Multi-Agente
agentcache é uma biblioteca Python que permite que frameworks de LLM multiagente compartilhem prefixos de prompt em cache, alcançando até 76% de taxas de acerto no cache e reduzindo o tempo de inferência pela metade em testes com GPT-4o-mini.