Kreuzberg v4.7.0 ajoute l'intelligence du code pour 248 langues et une extraction markdown améliorée.

✍️ OpenClawRadar📅 Publié: April 14, 2026🔗 Source
Kreuzberg v4.7.0 ajoute l'intelligence du code pour 248 langues et une extraction markdown améliorée.
Ad

Kreuzberg v4.7.0 est désormais disponible. Il s'agit d'une bibliothèque d'intelligence documentaire basée sur Rust qui fonctionne avec Python, TypeScript/Node.js, Go, Ruby, Java, C#, PHP, Elixir, R, C et WASM.

Intelligence et extraction de code

Le point principal est l'intelligence et l'extraction de code. Kreuzberg prend désormais en charge 248 formats grâce à la bibliothèque tree-sitter-language-pack. Cela permet un analyse efficace du code pour une intégration directe en tant que bibliothèque pour les agents et via MCP. Les agents peuvent travailler avec des dépôts de code, examiner les demandes de fusion, indexer les bases de code et analyser les fichiers sources.

Kreuzberg extrait au niveau de l'AST :

  • Fonctions
  • Classes
  • Imports
  • Exports
  • Symboles
  • Docstrings

avec un découpage du code qui respecte les limites de portée.

Améliorations de la qualité du Markdown

Une mauvaise extraction de document peut entraîner des problèmes en aval. L'équipe a créé un banc d'essai utilisant les scores F1 structurel et F1 texte sur plus de 350 documents et 23 formats, puis a optimisé en fonction de cela.

Améliorations spécifiques :

  • LaTeX : amélioré de 0 % à 100 % SF1
  • XLSX : augmenté de 30 % à 100 % SF1
  • SF1 des tableaux PDF : passé de 15,5 % à 53,7 %

Tous les 23 formats sont désormais à plus de 80 % SF1. Les pipelines de sortie reçoivent désormais par défaut des structures correctes.

Ad

Autres fonctionnalités clés

  • Nouvelle couche de rendu markdown et nouvelle prise en charge de la sortie HTML
  • Intégration OpenWebUI en tant que backend d'extraction de documents
  • Options pour la compatibilité docling-serve ou connexion directe
  • Architecture unifiée où chaque extracteur crée une représentation de document typée standard
  • Format filaire TOON - un encodage de document compact qui réduit l'utilisation de tokens de prompt LLM de 30 à 50 %
  • Étiquetage sémantique des segments
  • Sortie JSON
  • Validation stricte de la configuration
  • Sécurité améliorée

Disponibilité

Kreuzberg est disponible sur GitHub : https://github.com/kreuzberg-dev/kreuzberg

Kreuzberg Cloud sera bientôt disponible - une version hébergée pour les équipes qui souhaitent la même qualité d'extraction sans gérer l'infrastructure. Plus d'informations sur : https://kreuzberg.dev

Les contributions sont les bienvenues.

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

Jean-Claude : Un frontal LLM satirique se moquant de la régulation européenne de l'IA, avec 412 partenaires cookies et des factures de TVA toutes les 5 messages
Tools

Jean-Claude : Un frontal LLM satirique se moquant de la régulation européenne de l'IA, avec 412 partenaires cookies et des factures de TVA toutes les 5 messages

Jean-Claude est une interface satirique pour LLM qui pousse la bureaucratie de type UE à son extrême : 412 partenaires cookies, principe des quatre yeux nécessitant une co-signature, suivi CO₂ par token avec offset € obligatoire, factures TVA toutes les 5 messages, et un centre de conformité avec de fausses métriques RGPD/AI Act.

OpenClawRadar
Atlarix v5.1 ajoute des niveaux de stockage cloud tout en conservant la prise en charge du codage IA local.
Tools

Atlarix v5.1 ajoute des niveaux de stockage cloud tout en conservant la prise en charge du codage IA local.

Atlarix v5.1.0 introduit les niveaux de service cloud Compass pour une utilisation immédiate tout en conservant un support complet pour Ollama et LM Studio. L'IDE utilise un graphe SQLite persistant appelé Blueprint pour fournir un contexte précis aux modèles locaux.

OpenClawRadar
Claude Code prend désormais en charge plus de 240 modèles via la passerelle NVIDIA NIM — dont Nemotron-3 120B pour le codage agentique
Tools

Claude Code prend désormais en charge plus de 240 modèles via la passerelle NVIDIA NIM — dont Nemotron-3 120B pour le codage agentique

Claude Code peut basculer en cours de session vers plus de 240 modèles NVIDIA NIM via la commande /model. La variante de réflexion Nemotron-3 Super 120B montre d'excellents résultats pour le refactoring multi-fichiers et les tâches agentiques.

OpenClawRadar
Serveur MCP pour les fichiers XMind locaux publié
Tools

Serveur MCP pour les fichiers XMind locaux publié

Un développeur a publié un serveur MCP qui fournit 22 outils pour lire et écrire des fichiers de cartes mentales XMind locaux. Le serveur fonctionne avec des clients IA compatibles MCP comme Claude Desktop et Cursor.

OpenClawRadar