Kreuzberg v4.7.0 añade inteligencia de código para 248 idiomas y una extracción de markdown mejorada.

Kreuzberg v4.7.0 ya está disponible. Esta es una biblioteca de inteligencia de documentos con núcleo en Rust que funciona con Python, TypeScript/Node.js, Go, Ruby, Java, C#, PHP, Elixir, R, C y WASM.
Inteligencia y Extracción de Código
El principal punto destacado es la inteligencia y extracción de código. Kreuzberg ahora admite 248 formatos a través de la biblioteca tree-sitter-language-pack. Esto permite un análisis eficiente del código para una integración directa como biblioteca para agentes y mediante MCP. Los agentes pueden trabajar con repositorios de código, revisar solicitudes de extracción, indexar bases de código y analizar archivos fuente.
Kreuzberg extrae a nivel de AST:
- Funciones
- Clases
- Importaciones
- Exportaciones
- Símbolos
- Docstrings
con fragmentación de código que respeta los límites de alcance.
Mejoras en la Calidad de Markdown
Una extracción deficiente de documentos puede generar problemas en el flujo de trabajo posterior. El equipo creó un sistema de evaluación comparativa utilizando puntuaciones Structural F1 y Text F1 en más de 350 documentos y 23 formatos, y luego optimizó en base a eso.
Mejoras específicas:
- LaTeX: mejoró del 0% al 100% SF1
- XLSX: aumentó del 30% al 100% SF1
- Tablas PDF SF1: pasó del 15.5% al 53.7%
Todos los 23 formatos ahora están por encima del 80% SF1. Los flujos de salida que recibe el pipeline ahora son estructuralmente correctos por defecto.
Otras Características Clave
- Nueva capa de renderizado de markdown y nuevo soporte de salida HTML
- Integración con OpenWebUI como backend de extracción de documentos
- Opciones para compatibilidad con docling-serve o conexión directa
- Arquitectura unificada donde cada extractor crea una representación de documento tipada estándar
- Formato de cable TOON: una codificación de documento compacta que reduce el uso de tokens de prompt en LLM entre un 30% y un 50%
- Etiquetado semántico de fragmentos
- Salida JSON
- Validación estricta de configuración
- Seguridad mejorada
Disponibilidad
Kreuzberg está disponible en GitHub: https://github.com/kreuzberg-dev/kreuzberg
Kreuzberg Cloud estará disponible pronto: una versión alojada para equipos que desean la misma calidad de extracción sin gestionar infraestructura. Más información en: https://kreuzberg.dev
Las contribuciones son bienvenidas.
📖 Read the full source: r/LocalLLaMA
👀 Ver también

SpruceChat ejecuta un modelo de lenguaje de 0.5B en el dispositivo en las consolas portátiles Miyoo mediante llama.cpp.
SpruceChat ejecuta Qwen2.5-0.5B completamente en el dispositivo en consolas de juegos portátiles usando llama.cpp, sin necesidad de nube o WiFi. En un Miyoo A30 (Cortex-A7 de cuatro núcleos), se carga en ~60 segundos y genera a ~1-2 tokens/segundo.

Mi Agente Construyó Su Propio Sistema de Interocepción — Ahora Tiene Deseos

El Servidor MCP de ZuckerBot Permite que los Agentes de OpenClaw Ejecuten Campañas de Anuncios de Meta
ZuckerBot es un servidor MCP que otorga a los agentes de OpenClaw control directo sobre los anuncios de Meta, permitiéndoles ejecutar ciclos completos de campañas sin intervención humana. Más de 50 agentes únicos ya lo utilizan para extraer anuncios de la competencia, generar segmentación, lanzar campañas y ajustar el rendimiento mediante código.

VidLens Servidor MCP: Base de Conocimiento Persistente de YouTube para Claude
VidLens es un servidor MCP gratuito y de código abierto que indexa contenido de YouTube localmente con incrustaciones semánticas, tratando los videos como una base de conocimiento persistente en lugar de extraer transcripciones temporales. Proporciona 41 herramientas en 10 módulos para buscar, analizar y recuperar contenido de video.