AgentCrawl-Update fügt wichtige Crawler-Funktionen und -Verbesserungen hinzu.

Das neueste Update von AgentCrawl verbessert die Funktionalität als TypeScript-Scraper/Crawler und führt mehrere wichtige Funktionen für Entwickler ein, die KI-Agenten verwenden. Dieses Release konzentriert sich auf die Produktionsbereitschaft, indem die Korrektheit und Höflichkeit von Crawlern, Caching-Mechanismen, fortsetzbare Crawls und verbesserte Datenextraktionsfähigkeiten integriert werden.
Wichtige Details
- Entfernte Tool-Adapter: Das Update entfernt die Tool-Adapter für das Agents SDK und das Vercel AI SDK, sodass Benutzer ihre Tools unabhängig definieren können.
- Aktualisierte Bibliotheken: Das Paket enthält jetzt die neueste Version von Zod für eine bessere Datenvalidierung.
- Korrektheit des Crawlers: Die Einhaltung von robots.txt ist jetzt optional und unterstützt die Direktiven Disallow/Allow und Crawl-delay. Optionales Sitemap-Seeding aus
/sitemap.xmlist ebenfalls verfügbar. - URL-Normalisierung: Die verbesserte URL-Normalisierung entfernt umfassend Tracking-Parameter und kann die kanonische Normalisierung verarbeiten.
- Drosselungsoptionen: Der Crawler unterstützt die Drosselung pro Host mit konfigurierbarer
perHostConcurrencyundminDelayMs. - Caching: Ein optionaler Disk-HTTP-Cache für statische Abrufe implementiert ETag- und Last-Modified-Unterstützung. Das System cached die Nachbearbeitung und Markdown-Konvertierung von
ScrapedPageund kann Serverantworten mit dem Status 304 verarbeiten, indem es zwischengespeicherte Inhalte bereitstellt. - Fortsetzbare Crawls: Eine neue optionale crawlState-Persistenz speichert die Grenze des Crawls, einschließlich der Warteschlange, besuchter Seiten, geordneter Elemente, Fehler und maximaler Tiefe, was fortsetzbare Crawls ohne erneutes Besuchen von Seiten ermöglicht.
- Verbesserungen der Datenextraktion: Der Scraper unterstützt jetzt die strukturierte Extraktion von Metadaten, einschließlich kanonischer URL, OpenGraph, Twitter-Karten und JSON-LD, die in
metadata.structuredgespeichert werden. - Chunking für Agenten: Die optionale Chunking-Funktionalität gibt
page.chunks[]mit einer ungefähren Token-Größe, Überschriftspfad und Zitationsanker zurück, was für RAG/Tool-Schleifen vorteilhaft ist.
Für wen es gedacht ist
Dieses Update ist besonders vorteilhaft für Entwickler, die KI-Agenten nutzen und effiziente sowie strukturierte Web-Scraping-Fähigkeiten benötigen.
📖 Den vollständigen Source lesen: r/LocalLLaMA
👀 Siehe auch

CRMy: Open-Source-CRM und Customer-Context-Engine für OpenClaw
CRMy ist eine Open-Source-CRM- und Customer-Context-Engine, die speziell für OpenClaw-Agenten entwickelt wurde. Sie umfasst eine vollständige CLI, ein OpenClaw-Plugin mit 12 CRM-Tools, ein PostgreSQL-Backend und eine Self-Hosted-Bereitstellung mit zwei Befehlen.

Zwei neue Open-Source-Tools für KI-Agenten-Sicherheit und -Optimierung
Für KI-Agenten-Entwickler stehen zwei Open-Source-Tools zur Verfügung: AI Agent Defense Kit bietet Laufzeitsicherheitsfähigkeiten, und AgentGuard (in Entwicklung) bietet Kostenverfolgung, Sicherheitsscans und Aktivitätsüberwachung.

Blackwell LLM Toolkit: NVFP4-Konfigurationen, Räder und Benchmarks für TensorRT-LLM auf RTX Pro 6000
Ein Community-Repository bietet TensorRT-LLM-Konfigurationen, vorgebaute LMCache-Räder mit sm_120-Unterstützung und Benchmarks für Blackwell-GPUs. Nemotron-3-Nano-Omni V3 erreicht 270 tok/s bei 8k Kontext auf einer einzelnen RTX Pro 6000.

Erstellen von syntaqlite: Ein SQLite-Entwicklungswerkzeug-Projekt, das mit KI-Unterstützung erstellt wurde
Lalit Maganti baute syntaqlite, eine Reihe von Entwicklertools für SQLite, in drei Monaten mithilfe von KI-Codierungsagenten, nachdem er es acht Jahre lang gewollt hatte. Das Projekt erforderte das genaue Parsen von SQL wie SQLite, was die Anpassung von SQLites dichtem C-Codebase mit über 400 Grammatikregeln beinhaltet.