La mise à jour d'AgentCrawl ajoute des fonctionnalités et améliorations essentielles pour le crawler.

La dernière mise à jour de AgentCrawl améliore ses fonctionnalités en tant que scraper/crawler TypeScript, introduisant plusieurs caractéristiques importantes pour les développeurs utilisant des agents IA. Cette version se concentre sur la préparation à la production en intégrant la correction et la politesse du crawler, les mécanismes de cache, les crawls reprises et des capacités d'extraction de données améliorées.
Détails clés
- Suppression des adaptateurs d'outils : La mise à jour élimine les adaptateurs d'outils pour le SDK agents et le SDK Vercel AI, permettant aux utilisateurs de définir leurs outils indépendamment.
- Bibliothèques mises à jour : Le package inclut désormais la dernière version de Zod pour une meilleure validation des données.
- Correction du crawler : La conformité robots.txt est désormais optionnelle et prend en charge les directives Disallow/Allow et Crawl-delay. L'ensemencement optionnel à partir de
/sitemap.xmlest également disponible. - Normalisation des URL : La normalisation des URL améliorée supprime de manière exhaustive les paramètres de suivi et peut gérer la normalisation canonique.
- Options de limitation : Le crawler prend en charge la limitation par hôte avec
perHostConcurrencyetminDelayMsconfigurables. - Cache : Un cache HTTP disque optionnel pour les récupérations statiques implémente la prise en charge d'ETag et Last-Modified. Le système met en cache après nettoyage et conversion markdown de
ScrapedPageet peut gérer les réponses serveur avec statut 304 en servant les corps mis en cache. - Crawls reprises : Une nouvelle persistance optionnelle de l'état de crawl sauvegarde la frontière du crawl, y compris la file d'attente, les pages visitées, les éléments en file d'attente, les erreurs et la profondeur maximale, ce qui permet des crawls reprises sans revisiter les pages.
- Améliorations de l'extraction de données : Le scraper prend désormais en charge l'extraction de métadonnées structurées, y compris l'URL canonique, OpenGraph, les cartes Twitter et JSON-LD, conservées dans
metadata.structured. - Découpage pour les agents : La fonctionnalité optionnelle de découpage renvoie
page.chunks[]avec une taille approximative de tokens, un chemin de titre et une ancre de citation, ce qui est bénéfique pour les boucles RAG/outils.
Pour qui c'est
Cette mise à jour est particulièrement bénéfique pour les développeurs utilisant des agents IA nécessitant des capacités de scraping web efficaces et structurées.
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

companion-capture : L'outil sauvegarde les bulles de parole éphémères de Claude Code
companion-capture est un outil open-source qui capture les bulles de dialogue du personnage compagnon de Claude Code avant qu'elles ne disparaissent du terminal. Il enregistre les messages dans des fichiers markdown et SQLite pour la recherche, en utilisant l'analyse du tampon d'écran VT100 pour suivre les positions du curseur.

Mémoire relationnelle pour LLM : un système à trois couches modélise les relations utilisateur
Un outil Python open-source qui ajoute une mémoire relationnelle aux LLM en modélisant les relations utilisateur-IA à travers sept dimensions psychologiques, utilisant une structure narrative à trois couches au lieu d'un stockage plat de faits.

ClawControl 1.7.1 améliore la fiabilité des messages et la prise en charge des médias pour OpenClaw.
ClawControl 1.7.1 corrige plusieurs problèmes côté client, notamment l'accumulation incontrôlée de texte, les messages fantômes et les problèmes de gestion des médias. La mise à jour maintient la compatibilité avec OpenClaw jusqu'à la version 3.28.

Le flux de travail de codage autonome livre 163 000 lignes de code en une nuit grâce à Claude Code.
Un développeur a créé un flux de travail autonome qui a accompli 72 tâches en une nuit, générant 163 643 lignes de code et plus de 6 400 tests réussis avec un taux de réussite de 85 % dès la première tentative.