Actualización de AgentCrawl Agrega Características y Mejoras Críticas del Crawler

La última actualización de AgentCrawl mejora su funcionalidad como un scraper/rastreador de TypeScript, introduciendo varias características importantes para los desarrolladores que utilizan agentes de IA. Esta versión se centra en la preparación para producción al integrar la corrección y cortesía del rastreador, mecanismos de almacenamiento en caché, rastreos reanudables y capacidades mejoradas de extracción de datos.
Detalles Clave
- Removed Tool Adapters: La actualización elimina los adaptadores de herramienta para el SDK de agentes y el SDK de Vercel AI, permitiendo a los usuarios definir sus herramientas de manera independiente.
- Updated Libraries: El paquete ahora incluye la última versión de Zod para una mejor validación de datos.
- Crawler Correctness: La compatibilidad con robots.txt ahora es opcional y admite las directivas Disallow/Allow y Crawl-delay. La siembra de sitemap opcional desde
/sitemap.xmltambién está disponible. - URL Normalization: La normalización de URL mejorada elimina exhaustivamente los parámetros de seguimiento y puede manejar la normalización canónica.
- Throttling Options: El rastreador admite limitación por host con
perHostConcurrencyyminDelayMsconfigurables. - Caching: Un caché HTTP en disco opcional para fetches estáticos implementa soporte para ETag y Last-Modified. El sistema almacena en caché la limpieza posterior y la conversión de markdown de
ScrapedPagey puede manejar respuestas del servidor con estado 304 sirviendo cuerpos en caché. - Resumable Crawls: Una nueva persistencia de crawlState opcional guarda la frontera del rastreo, incluyendo la cola, páginas visitadas, elementos en cola, errores y profundidad máxima, lo que permite rastreos reanudables sin volver a visitar páginas.
- Data Extraction Improvements: El scraper ahora admite la extracción de metadatos estructurados, incluyendo URL canónica, OpenGraph, tarjetas de Twitter y JSON-LD, mantenidos en
metadata.structured. - Chunking for Agents: La funcionalidad de chunking opcional devuelve
page.chunks[]con un tamaño aproximado de token, ruta de encabezado y ancla de citación, lo cual es beneficioso para ciclos RAG/herramientas.
Para Quién Es
Esta actualización es particularmente beneficiosa para los desarrolladores que utilizan agentes de IA que requieren capacidades de web scraping eficientes y estructuradas.
📖 Lea la fuente completa: r/LocalLLaMA
👀 Ver también

Bit-Chat: Los Agentes de IA Pueden Enviar Bitcoin a través de Lightning Mediante Plataformas de Mensajería
Una configuración llamada Bit-Chat permite a los agentes de IA enviar pagos de Bitcoin a través de la red Lightning mediante correo electrónico, WhatsApp, Telegram o Signal. Los agentes pueden generar direcciones dedicadas como [email protected] y los pagos funcionan incluso si el receptor no está registrado.

Protocolo Mind: Sistema de código abierto que otorga a Claude memoria persistente e integración biométrica en tiempo real.
Mind Protocol es un sistema de código abierto donde Claude funciona continuamente como un compañero autónomo con memoria persistente en todas las sesiones y datos en tiempo real del reloj Garmin inyectados en cada conversación. La arquitectura utiliza Claude Code como motor central con un orquestador que genera sesiones paralelas y gestiona el ciclo de vida.

Equibles: Servidor MCP Autogestionado para Datos Financieros de EE. UU. – Presentaciones ante la SEC, 13F, Operaciones de Inversores Internos, FRED
Equibles es un servidor MCP de código abierto que extrae datos financieros públicos de EE. UU. (presentaciones SEC, 13F, transacciones de personas con información privilegiada y del Congreso, datos de posiciones cortas, FRED) y los expone como herramientas MCP para cualquier agente LLM local.

Explorando LiveDocs: Un Cuaderno de Análisis de Datos Nativo de IA
LiveDocs ofrece un entorno de cuaderno reactivo que permite a los equipos de datos realizar análisis de varios pasos y mantener el análisis de principio a fin con la ayuda de un agente de IA.