Atualização do AgentCrawl Adiciona Recursos e Melhorias Críticas ao Rastreador

A última atualização do AgentCrawl aprimora sua funcionalidade como um scraper/rastreador TypeScript, introduzindo vários recursos importantes para desenvolvedores que usam agentes de IA. Esta versão foca na prontidão para produção integrando correção e cortesia do rastreador, mecanismos de cache, rastreamentos retomáveis e capacidades aprimoradas de extração de dados.
Detalhes Principais
- Adaptadores de Ferramentas Removidos: A atualização elimina os adaptadores de ferramentas para o SDK de agentes e o Vercel AI SDK, permitindo que os usuários definam suas ferramentas independentemente.
- Bibliotecas Atualizadas: O pacote agora inclui a versão mais recente do Zod para melhor validação de dados.
- Correção do Rastreador: A conformidade com robots.txt agora é opcional e suporta diretivas Disallow/Allow e Crawl-delay. A semeadura opcional de sitemap a partir de
/sitemap.xmltambém está disponível. - Normalização de URL: A normalização de URL aprimorada remove abrangentemente parâmetros de rastreamento e pode lidar com normalização canônica.
- Opções de Limitação: O rastreador suporta limitação por host com
perHostConcurrencyeminDelayMsconfiguráveis. - Cache: Um cache HTTP em disco opcional para buscas estáticas implementa suporte a ETag e Last-Modified. O sistema armazena em cache a limpeza pós-processamento e conversão para markdown de
ScrapedPagee pode lidar com respostas do servidor com status 304 servindo corpos em cache. - Rastreamentos Retomáveis: Uma nova persistência opcional de crawlState salva a fronteira do rastreamento, incluindo a fila, páginas visitadas, itens enfileirados, erros e profundidade máxima, o que permite rastreamentos retomáveis sem re-visitar páginas.
- Melhorias na Extração de Dados: O scraper agora suporta extração estruturada de metadados, incluindo URL Canônica, OpenGraph, cartões do Twitter e JSON-LD, mantidos em
metadata.structured. - Divisão para Agentes: A funcionalidade opcional de divisão retorna
page.chunks[]com um tamanho aproximado de token, caminho de cabeçalho e âncora de citação, o que é benéfico para loops RAG/ferramentas.
Para Quem É
Esta atualização é particularmente benéfica para desenvolvedores que utilizam agentes de IA que requerem capacidades de raspagem web eficientes e estruturadas.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

Por que Fluxos de Trabalho Determinísticos Superam a Orquestração Baseada em IA para Sistemas de Agentes
Um desenvolvedor com um ano de experiência construindo sistemas de agentes compartilha que a orquestração orientada por IA falhou de forma confiável devido ao roteamento não determinístico, erros cumulativos, explosão de custos e depuração impossível. Mudar para fluxos de trabalho determinísticos com orquestração baseada em código eliminou as falhas de orquestração.

Ctxpact: Proxy de Compactação de Contexto para LLMs Locais
Ctxpact é um proxy compatível com OpenAI que comprime entradas excessivamente grandes para LLMs locais com janelas de contexto de 16k, usando um pipeline de 3 etapas que inclui estratégias de DCP, sumarização e extração. Benchmarks mostram 110k tokens comprimidos para 12k com 8/8 de precisão em compreensão de leitura.

Limonada por AMD: Servidor Local de LLM de Código Aberto para GPU e NPU
Lemonade é um servidor de IA local de código aberto que executa modelos de texto, imagem e fala em GPUs e NPUs. É compatível com a API da OpenAI, suporta múltiplos modelos simultaneamente e possui um backend nativo em C++ de apenas 2MB.

Especialista em código aberto: o adaptador de despacho delega tarefas complexas para o Claude Code
expert-dispatch é um script bash de aproximadamente 500 linhas que permite que um assistente de IA barato delegue tarefas complexas de programação para o Claude Code CLI. Ele usa comandos como dispatch-cc run para enviar tarefas e mantém diretórios por projeto com CLAUDE.md para contexto persistente.