Kreuzberg v4.7.0 fügt Code-Intelligenz für 248 Sprachen und verbesserte Markdown-Extraktion hinzu.

✍️ OpenClawRadar📅 Veröffentlicht: 14. April 2026🔗 Source
Kreuzberg v4.7.0 fügt Code-Intelligenz für 248 Sprachen und verbesserte Markdown-Extraktion hinzu.
Ad

Kreuzberg v4.7.0 ist jetzt verfügbar. Dies ist eine Rust-basierte Dokumentenintelligenz-Bibliothek, die mit Python, TypeScript/Node.js, Go, Ruby, Java, C#, PHP, Elixir, R, C und WASM arbeitet.

Code-Intelligenz und -Extraktion

Das Hauptmerkmal ist die Code-Intelligenz und -Extraktion. Kreuzberg unterstützt nun 248 Formate über die tree-sitter-language-pack-Bibliothek. Dies ermöglicht effizientes Code-Parsing für die direkte Integration als Bibliothek für Agents und über MCP. Agents können mit Code-Repositories arbeiten, Pull-Requests überprüfen, Codebasen indexieren und Quelldateien analysieren.

Kreuzberg extrahiert auf AST-Ebene:

  • Funktionen
  • Klassen
  • Imports
  • Exports
  • Symbole
  • Docstrings

mit Code-Chunking, das Scope-Grenzen respektiert.

Verbesserungen der Markdown-Qualität

Schlechte Dokumentenextraktion kann zu Problemen in der Pipeline führen. Das Team erstellte einen Benchmark-Harness mit Structural F1 und Text F1 Scoring über mehr als 350 Dokumente und 23 Formate und optimierte darauf basierend.

Spezifische Verbesserungen:

  • LaTeX: verbessert von 0 % auf 100 % SF1
  • XLSX: erhöht von 30 % auf 100 % SF1
  • PDF-Tabellen-SF1: stieg von 15,5 % auf 53,7 %

Alle 23 Formate liegen nun bei über 80 % SF1. Die Ausgabe, die Pipelines erhalten, ist nun standardmäßig strukturell korrekt.

Ad

Weitere wichtige Funktionen

  • Neue Markdown-Rendering-Schicht und neue HTML-Ausgabeunterstützung
  • OpenWebUI-Integration als Dokumentenextraktions-Backend
  • Optionen für docling-serve-Kompatibilität oder direkte Verbindung
  • Einheitliche Architektur, bei der jeder Extractor eine standardisierte typisierte Dokumentendarstellung erstellt
  • TOON-Wire-Format - eine kompakte Dokumentencodierung, die die LLM-Prompt-Token-Nutzung um 30 bis 50 % reduziert
  • Semantische Chunk-Kennzeichnung
  • JSON-Ausgabe
  • Strenge Konfigurationsvalidierung
  • Verbesserte Sicherheit

Verfügbarkeit

Kreuzberg ist auf GitHub verfügbar: https://github.com/kreuzberg-dev/kreuzberg

Kreuzberg Cloud wird bald verfügbar sein - eine gehostete Version für Teams, die die gleiche Extraktionsqualität ohne Infrastrukturverwaltung wünschen. Weitere Informationen unter: https://kreuzberg.dev

Beiträge sind willkommen.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch

Claude-Skill-MCP-Checker: Deterministische Prüfung bahnbrechender Änderungen vom 28.07.2026
Werkzeuge

Claude-Skill-MCP-Checker: Deterministische Prüfung bahnbrechender Änderungen vom 28.07.2026

Ein kostenloses Claude-Skill und eine Web-Demo führen 7 deterministische Regeln aus, um MCP-Server zu erkennen, die durch die zustandslosen Transport- und OAuth-2.1-Änderungen vom 2026-07-28 defekt sind. Der Autor teilt mit, wie eine Regel falsch war und wie er den Fehler eingegrenzt hat.

OpenClawRadar
Entwicklung einer Programmiersprache mit Claude Code: Das Cutlet-Experiment
Werkzeuge

Entwicklung einer Programmiersprache mit Claude Code: Das Cutlet-Experiment

Ankur Sethi entwickelte in vier Wochen eine vollständige Programmiersprache namens Cutlet mithilfe von Claude Code, wobei die KI jede Codezeile generierte, während er sich auf Sicherheitsvorkehrungen und Tests konzentrierte. Die Sprache bietet dynamische Typisierung, vektorisierte Operationen und eine REPL und läuft auf macOS und Linux.

OpenClawRadar
devcontainer-mcp: Gib KI-Agenten ihre eigene Entwicklungsumgebung, nicht deine
Werkzeuge

devcontainer-mcp: Gib KI-Agenten ihre eigene Entwicklungsumgebung, nicht deine

devcontainer-mcp ist ein MCP-Server, der 45 Tools für KI-Agenten bereitstellt, um Dev-Container zu erstellen, zu verwalten und darin zu arbeiten – unterstützt durch Docker, DevPod oder GitHub Codespaces – und dabei die Host-Rechner sauber hält.

OpenClawRadar
Spec27: Spezifikationsgesteuerte Validierung für KI-Agenten – API-Level-Tests ohne internen Zugriff
Werkzeuge

Spec27: Spezifikationsgesteuerte Validierung für KI-Agenten – API-Level-Tests ohne internen Zugriff

Spec27 ist ein neues Tool von Safe Intelligence für spezifikationsgesteuerte Validierung von KI-Agenten. Es testet das Verhalten von Agenten von außen nach innen, führt adversarielle und Robustheitsprüfungen gegen primäre Schnittstellen durch, ohne SDKs, Gateways oder interne Ablaufverfolgung zu benötigen.

OpenClawRadar