AgentCrawl-Update fügt wichtige Crawler-Funktionen und -Verbesserungen hinzu.

Das neueste Update von AgentCrawl verbessert die Funktionalität als TypeScript-Scraper/Crawler und führt mehrere wichtige Funktionen für Entwickler ein, die KI-Agenten verwenden. Dieses Release konzentriert sich auf die Produktionsbereitschaft, indem die Korrektheit und Höflichkeit von Crawlern, Caching-Mechanismen, fortsetzbare Crawls und verbesserte Datenextraktionsfähigkeiten integriert werden.
Wichtige Details
- Entfernte Tool-Adapter: Das Update entfernt die Tool-Adapter für das Agents SDK und das Vercel AI SDK, sodass Benutzer ihre Tools unabhängig definieren können.
- Aktualisierte Bibliotheken: Das Paket enthält jetzt die neueste Version von Zod für eine bessere Datenvalidierung.
- Korrektheit des Crawlers: Die Einhaltung von robots.txt ist jetzt optional und unterstützt die Direktiven Disallow/Allow und Crawl-delay. Optionales Sitemap-Seeding aus
/sitemap.xmlist ebenfalls verfügbar. - URL-Normalisierung: Die verbesserte URL-Normalisierung entfernt umfassend Tracking-Parameter und kann die kanonische Normalisierung verarbeiten.
- Drosselungsoptionen: Der Crawler unterstützt die Drosselung pro Host mit konfigurierbarer
perHostConcurrencyundminDelayMs. - Caching: Ein optionaler Disk-HTTP-Cache für statische Abrufe implementiert ETag- und Last-Modified-Unterstützung. Das System cached die Nachbearbeitung und Markdown-Konvertierung von
ScrapedPageund kann Serverantworten mit dem Status 304 verarbeiten, indem es zwischengespeicherte Inhalte bereitstellt. - Fortsetzbare Crawls: Eine neue optionale crawlState-Persistenz speichert die Grenze des Crawls, einschließlich der Warteschlange, besuchter Seiten, geordneter Elemente, Fehler und maximaler Tiefe, was fortsetzbare Crawls ohne erneutes Besuchen von Seiten ermöglicht.
- Verbesserungen der Datenextraktion: Der Scraper unterstützt jetzt die strukturierte Extraktion von Metadaten, einschließlich kanonischer URL, OpenGraph, Twitter-Karten und JSON-LD, die in
metadata.structuredgespeichert werden. - Chunking für Agenten: Die optionale Chunking-Funktionalität gibt
page.chunks[]mit einer ungefähren Token-Größe, Überschriftspfad und Zitationsanker zurück, was für RAG/Tool-Schleifen vorteilhaft ist.
Für wen es gedacht ist
Dieses Update ist besonders vorteilhaft für Entwickler, die KI-Agenten nutzen und effiziente sowie strukturierte Web-Scraping-Fähigkeiten benötigen.
📖 Den vollständigen Source lesen: r/LocalLLaMA
👀 Siehe auch

NarrateAI MCP Server Demo zeigt, wie Claude Videos mit Voiceover versieht
Eine Live-Demo zeigt, wie Claude den NarrateAI MCP-Server nutzt, um Videos automatisch von einer URL zu erzählen, asynchrone Abfragen verarbeitet und eine Erzählung durch die Analyse von stummen Bildschirmaufnahmen generiert.

Sitefire automatisiert die KI-Suchoptimierung mit Content Agents.
Die Plattform von Sitefire überwacht KI-Suchergebnisse, analysiert, welche Seiten zitiert werden, und nutzt Content-Agenten, um Verbesserungen zu entwerfen oder neue Seiten zu erstellen, die direkt in das CMS der Kunden übertragen werden. Ein Kunde verzeichnete einen Anstieg der KI-Bot-Anfragen von ~200/Tag auf ~570/Tag innerhalb von zehn Tagen.

OpenJet v0.4: Lokaler Coding-Agent ohne Konfiguration mit llama.cpp-Backend
OpenJet v0.4 ist ein quelloffener Terminal-Coding-Agent für lokale LLMs, der Hardware automatisch erkennt, llama.cpp konfiguriert und einen Claude-Code-ähnlichen Workflow ohne API-Schlüssel bietet.

Erstellen eines lokalen Sprach-KI-Assistenten mit SwiftUI und CSM-1B auf Apple Silicon
Ein Entwickler hat mobiGlas entwickelt, eine SwiftUI-App, die mit OpenClaw zusammenarbeitet, um freihändige Gespräche über AirPods zu ermöglichen. Dabei kommt lokale Sprachklontechnologie (CSM-1B auf M2 Ultra) zum Einsatz, ohne Cloud-APIs.