Actualización de AgentCrawl Agrega Características y Mejoras Críticas del Crawler

La última actualización de AgentCrawl mejora su funcionalidad como un scraper/rastreador de TypeScript, introduciendo varias características importantes para los desarrolladores que utilizan agentes de IA. Esta versión se centra en la preparación para producción al integrar la corrección y cortesía del rastreador, mecanismos de almacenamiento en caché, rastreos reanudables y capacidades mejoradas de extracción de datos.
Detalles Clave
- Removed Tool Adapters: La actualización elimina los adaptadores de herramienta para el SDK de agentes y el SDK de Vercel AI, permitiendo a los usuarios definir sus herramientas de manera independiente.
- Updated Libraries: El paquete ahora incluye la última versión de Zod para una mejor validación de datos.
- Crawler Correctness: La compatibilidad con robots.txt ahora es opcional y admite las directivas Disallow/Allow y Crawl-delay. La siembra de sitemap opcional desde
/sitemap.xmltambién está disponible. - URL Normalization: La normalización de URL mejorada elimina exhaustivamente los parámetros de seguimiento y puede manejar la normalización canónica.
- Throttling Options: El rastreador admite limitación por host con
perHostConcurrencyyminDelayMsconfigurables. - Caching: Un caché HTTP en disco opcional para fetches estáticos implementa soporte para ETag y Last-Modified. El sistema almacena en caché la limpieza posterior y la conversión de markdown de
ScrapedPagey puede manejar respuestas del servidor con estado 304 sirviendo cuerpos en caché. - Resumable Crawls: Una nueva persistencia de crawlState opcional guarda la frontera del rastreo, incluyendo la cola, páginas visitadas, elementos en cola, errores y profundidad máxima, lo que permite rastreos reanudables sin volver a visitar páginas.
- Data Extraction Improvements: El scraper ahora admite la extracción de metadatos estructurados, incluyendo URL canónica, OpenGraph, tarjetas de Twitter y JSON-LD, mantenidos en
metadata.structured. - Chunking for Agents: La funcionalidad de chunking opcional devuelve
page.chunks[]con un tamaño aproximado de token, ruta de encabezado y ancla de citación, lo cual es beneficioso para ciclos RAG/herramientas.
Para Quién Es
Esta actualización es particularmente beneficiosa para los desarrolladores que utilizan agentes de IA que requieren capacidades de web scraping eficientes y estructuradas.
📖 Lea la fuente completa: r/LocalLLaMA
👀 Ver también

Clooks: Un Entorno de Ejecución de Hooks Persistente para Claude Code
Clooks es un demonio HTTP persistente que maneja el despacho de ganchos de Claude Code sin generar procesos, reduciendo la latencia de ~34.6ms a ~0.31ms por invocación. Incluye migración automática, manejadores LLM con plantillas de prompts, resolución de dependencias y empaquetado de complementos.

Supra-50M-Razonamiento: Modelo Tiny de Código Abierto con Pensamiento en Cadena
SupraLabs lanza Supra-50M-Reasoning, un modelo de 50M de parámetros ajustado para producir una cadena de pensamiento completa antes de las respuestas. Dataset de 500 muestras escrito a mano, completamente open source.

ClawMetry añade monitoreo remoto con cifrado de extremo a extremo para agentes OpenClaw.
ClawMetry v0.1.0 ahora incluye sincronización en la nube para el monitoreo remoto de agentes OpenClaw desde cualquier navegador o aplicación de la barra de menús de Mac, con cifrado de extremo a extremo que mantiene los datos encriptados hasta que llegan a tu cliente.

Codebase Memory MCP: Exploración de código basada en grafos para Claude Code
Un desarrollador construyó un servidor MCP que indexa bases de código en un grafo de conocimiento persistente usando Tree-sitter y SQLite, reduciendo el uso de tokens en promedio 20 veces para consultas estructurales como rastreo de llamadas y detección de código muerto.