Kreuzberg v4.7.0 fügt Code-Intelligenz für 248 Sprachen und verbesserte Markdown-Extraktion hinzu.

Kreuzberg v4.7.0 ist jetzt verfügbar. Dies ist eine Rust-basierte Dokumentenintelligenz-Bibliothek, die mit Python, TypeScript/Node.js, Go, Ruby, Java, C#, PHP, Elixir, R, C und WASM arbeitet.
Code-Intelligenz und -Extraktion
Das Hauptmerkmal ist die Code-Intelligenz und -Extraktion. Kreuzberg unterstützt nun 248 Formate über die tree-sitter-language-pack-Bibliothek. Dies ermöglicht effizientes Code-Parsing für die direkte Integration als Bibliothek für Agents und über MCP. Agents können mit Code-Repositories arbeiten, Pull-Requests überprüfen, Codebasen indexieren und Quelldateien analysieren.
Kreuzberg extrahiert auf AST-Ebene:
- Funktionen
- Klassen
- Imports
- Exports
- Symbole
- Docstrings
mit Code-Chunking, das Scope-Grenzen respektiert.
Verbesserungen der Markdown-Qualität
Schlechte Dokumentenextraktion kann zu Problemen in der Pipeline führen. Das Team erstellte einen Benchmark-Harness mit Structural F1 und Text F1 Scoring über mehr als 350 Dokumente und 23 Formate und optimierte darauf basierend.
Spezifische Verbesserungen:
- LaTeX: verbessert von 0 % auf 100 % SF1
- XLSX: erhöht von 30 % auf 100 % SF1
- PDF-Tabellen-SF1: stieg von 15,5 % auf 53,7 %
Alle 23 Formate liegen nun bei über 80 % SF1. Die Ausgabe, die Pipelines erhalten, ist nun standardmäßig strukturell korrekt.
Weitere wichtige Funktionen
- Neue Markdown-Rendering-Schicht und neue HTML-Ausgabeunterstützung
- OpenWebUI-Integration als Dokumentenextraktions-Backend
- Optionen für docling-serve-Kompatibilität oder direkte Verbindung
- Einheitliche Architektur, bei der jeder Extractor eine standardisierte typisierte Dokumentendarstellung erstellt
- TOON-Wire-Format - eine kompakte Dokumentencodierung, die die LLM-Prompt-Token-Nutzung um 30 bis 50 % reduziert
- Semantische Chunk-Kennzeichnung
- JSON-Ausgabe
- Strenge Konfigurationsvalidierung
- Verbesserte Sicherheit
Verfügbarkeit
Kreuzberg ist auf GitHub verfügbar: https://github.com/kreuzberg-dev/kreuzberg
Kreuzberg Cloud wird bald verfügbar sein - eine gehostete Version für Teams, die die gleiche Extraktionsqualität ohne Infrastrukturverwaltung wünschen. Weitere Informationen unter: https://kreuzberg.dev
Beiträge sind willkommen.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

Memex: Open-Source Memory-Plugin für Claude Cowork
Memex ist ein Open-Source-Plugin, das Claude Cowork über Sitzungen hinweg persistenten Speicher mittels eines gestaffelten Kontextladungssystems verleiht. Nach einmaligem Ausführen von /memex:init fasst sich Claude pro Sitzung in etwa 20 Sekunden selbst zusammen und setzt dort fort, wo Sie aufgehört haben.

Lokale LLM-Leistungsbenchmarks auf dem Mac Mini mit OpenClaw und LM Studio
Ein Reddit-Nutzer veröffentlichte Leistungsdaten für das lokale Ausführen des Unsloth gpt-oss-20b-Q4_K_S.gguf-Modells auf einem Mac Mini mit 32 GB RAM und erreichte 34 Token/Sekunde mit einer Zeit bis zum ersten Token von 0,7 Sekunden unter Verwendung von OpenClaw 2026.3.8 und LM Studio 0.4.6+1.

Screenbox: Open-Source-Virtuelle Desktops für KI-Agenten, vollständig per Sprache erstellt
Screenbox bietet isolierte Linux-Desktops in Docker für KI-Agenten und löst Konflikte, wenn mehrere Agenten parallel laufen. Das Projekt wurde vollständig mit Sprachbefehlen über Claude Code erstellt, und der Ersteller hat keine einzige Codezeile gesehen.

Claude Codes plan-skeptischer Sub-Agent identifiziert Sicherheitslücken in generierten Plänen
Ein Entwickler entdeckte den Plan-Skeptiker-Subagenten von Claude Code, der Lücken und Probleme in KI-generierten Entwicklungsplänen identifiziert, insbesondere Sicherheitsbedenken aufdeckt, die zunächst nicht offensichtlich waren. Der Agent arbeitet neben dem bereits bekannten Security-Sheriff-Subagenten zusammen, um die Planqualität zu verbessern.