Kreuzberg v4.7.0 fügt Code-Intelligenz für 248 Sprachen und verbesserte Markdown-Extraktion hinzu.

✍️ OpenClawRadar📅 Veröffentlicht: 14. April 2026🔗 Source
Kreuzberg v4.7.0 fügt Code-Intelligenz für 248 Sprachen und verbesserte Markdown-Extraktion hinzu.
Ad

Kreuzberg v4.7.0 ist jetzt verfügbar. Dies ist eine Rust-basierte Dokumentenintelligenz-Bibliothek, die mit Python, TypeScript/Node.js, Go, Ruby, Java, C#, PHP, Elixir, R, C und WASM arbeitet.

Code-Intelligenz und -Extraktion

Das Hauptmerkmal ist die Code-Intelligenz und -Extraktion. Kreuzberg unterstützt nun 248 Formate über die tree-sitter-language-pack-Bibliothek. Dies ermöglicht effizientes Code-Parsing für die direkte Integration als Bibliothek für Agents und über MCP. Agents können mit Code-Repositories arbeiten, Pull-Requests überprüfen, Codebasen indexieren und Quelldateien analysieren.

Kreuzberg extrahiert auf AST-Ebene:

  • Funktionen
  • Klassen
  • Imports
  • Exports
  • Symbole
  • Docstrings

mit Code-Chunking, das Scope-Grenzen respektiert.

Verbesserungen der Markdown-Qualität

Schlechte Dokumentenextraktion kann zu Problemen in der Pipeline führen. Das Team erstellte einen Benchmark-Harness mit Structural F1 und Text F1 Scoring über mehr als 350 Dokumente und 23 Formate und optimierte darauf basierend.

Spezifische Verbesserungen:

  • LaTeX: verbessert von 0 % auf 100 % SF1
  • XLSX: erhöht von 30 % auf 100 % SF1
  • PDF-Tabellen-SF1: stieg von 15,5 % auf 53,7 %

Alle 23 Formate liegen nun bei über 80 % SF1. Die Ausgabe, die Pipelines erhalten, ist nun standardmäßig strukturell korrekt.

Ad

Weitere wichtige Funktionen

  • Neue Markdown-Rendering-Schicht und neue HTML-Ausgabeunterstützung
  • OpenWebUI-Integration als Dokumentenextraktions-Backend
  • Optionen für docling-serve-Kompatibilität oder direkte Verbindung
  • Einheitliche Architektur, bei der jeder Extractor eine standardisierte typisierte Dokumentendarstellung erstellt
  • TOON-Wire-Format - eine kompakte Dokumentencodierung, die die LLM-Prompt-Token-Nutzung um 30 bis 50 % reduziert
  • Semantische Chunk-Kennzeichnung
  • JSON-Ausgabe
  • Strenge Konfigurationsvalidierung
  • Verbesserte Sicherheit

Verfügbarkeit

Kreuzberg ist auf GitHub verfügbar: https://github.com/kreuzberg-dev/kreuzberg

Kreuzberg Cloud wird bald verfügbar sein - eine gehostete Version für Teams, die die gleiche Extraktionsqualität ohne Infrastrukturverwaltung wünschen. Weitere Informationen unter: https://kreuzberg.dev

Beiträge sind willkommen.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Siehe auch

Memex: Open-Source Memory-Plugin für Claude Cowork
Werkzeuge

Memex: Open-Source Memory-Plugin für Claude Cowork

Memex ist ein Open-Source-Plugin, das Claude Cowork über Sitzungen hinweg persistenten Speicher mittels eines gestaffelten Kontextladungssystems verleiht. Nach einmaligem Ausführen von /memex:init fasst sich Claude pro Sitzung in etwa 20 Sekunden selbst zusammen und setzt dort fort, wo Sie aufgehört haben.

OpenClawRadar
Lokale LLM-Leistungsbenchmarks auf dem Mac Mini mit OpenClaw und LM Studio
Werkzeuge

Lokale LLM-Leistungsbenchmarks auf dem Mac Mini mit OpenClaw und LM Studio

Ein Reddit-Nutzer veröffentlichte Leistungsdaten für das lokale Ausführen des Unsloth gpt-oss-20b-Q4_K_S.gguf-Modells auf einem Mac Mini mit 32 GB RAM und erreichte 34 Token/Sekunde mit einer Zeit bis zum ersten Token von 0,7 Sekunden unter Verwendung von OpenClaw 2026.3.8 und LM Studio 0.4.6+1.

OpenClawRadar
Screenbox: Open-Source-Virtuelle Desktops für KI-Agenten, vollständig per Sprache erstellt
Werkzeuge

Screenbox: Open-Source-Virtuelle Desktops für KI-Agenten, vollständig per Sprache erstellt

Screenbox bietet isolierte Linux-Desktops in Docker für KI-Agenten und löst Konflikte, wenn mehrere Agenten parallel laufen. Das Projekt wurde vollständig mit Sprachbefehlen über Claude Code erstellt, und der Ersteller hat keine einzige Codezeile gesehen.

OpenClawRadar
Claude Codes plan-skeptischer Sub-Agent identifiziert Sicherheitslücken in generierten Plänen
Werkzeuge

Claude Codes plan-skeptischer Sub-Agent identifiziert Sicherheitslücken in generierten Plänen

Ein Entwickler entdeckte den Plan-Skeptiker-Subagenten von Claude Code, der Lücken und Probleme in KI-generierten Entwicklungsplänen identifiziert, insbesondere Sicherheitsbedenken aufdeckt, die zunächst nicht offensichtlich waren. Der Agent arbeitet neben dem bereits bekannten Security-Sheriff-Subagenten zusammen, um die Planqualität zu verbessern.

OpenClawRadar