LiteParse: Analizador de Documentos Rápido y de Código Abierto para Agentes de IA

LiteParse es un analizador de documentos de código abierto centrado en el análisis local rápido con extracción espacial de texto y cuadros delimitadores. Se ejecuta completamente de forma local sin dependencias de la nube ni requisitos de GPU, procesando cientos de páginas en segundos.
Características Principales
- Herramienta de código abierto con licencia Apache 2.0
- Análisis espacial de texto con cuadros delimitadores para posicionamiento preciso del texto
- Sin dependencia de VLMs (Modelos de Lenguaje Visual) locales o de vanguardia
- Se ejecuta en cualquier máquina sin requisitos de GPU
- Admite múltiples formatos de archivo: PDF, documentos de Office, imágenes
- Mayor precisión que herramientas similares como PyPDF, PyMuPDF, MarkItDown
- Instalación de una línea como habilidad para más de 40 agentes de IA, incluidos Claude Code, Cursor, OpenClaw, Windsurf
Opciones de Instalación
Instalación de Herramienta CLI:
npm i -g @llamaindex/liteparse
Luego usar:
lit parse document.pdf
lit screenshot document.pdf
Para macOS y Linux vía Homebrew:
brew tap run-llama/liteparse
brew install llamaindex-liteparse
Instalación de Habilidad para Agentes:
npx skills add run-llama/llamaparse-agent-skills --skill liteparse
Ejemplos de Uso
Análisis básico:
lit parse document.pdf
lit parse document.pdf --format json -o output.md
lit parse document.pdf --target-pages "1-5,10,15-20"
lit parse document.pdf --no-ocr
Análisis por lotes:
lit batch-parse ./input-directory ./output-directory
Generación de capturas de pantalla (útil para agentes LLM):
lit screenshot document.pdf -o ./screenshots
lit screenshot document.pdf --target-pages "1,3,5" -o ./screenshots
lit screenshot document.pdf --dpi 300 -o ./screenshots
lit screenshot document.pdf --target-pages "1-10" -o ./screenshots
Uso como Biblioteca
Instalar como dependencia:
npm install @llamaindex/liteparse
# o
pnpm add @llamaindex/liteparse
Uso básico:
import { LiteParse } from '@llamaindex/liteparse';
const parser = new LiteParse({ ocrEnabled: true });
const result = await parser.parse('document.pdf');
console.log(result.text);
Entrada Buffer/Uint8Array (sin E/S de disco):
import { LiteParse } from '@llamaindex/liteparse';
import { readFile } from 'fs/promises';
const parser = new LiteParse();
const pdfBytes = await readFile('document.pdf');
const result = await parser.parse(pdfBytes);
Detalles Técnicos
- Sistema OCR flexible con Tesseract.js incorporado (configuración cero)
- Admite servidores HTTP para OCR (EasyOCR, PaddleOCR, personalizados)
- Especificación estándar de API OCR
- Múltiples formatos de salida: JSON y Texto
- Binario independiente sin dependencias de la nube
- Soporte multiplataforma: Linux, macOS (Intel/ARM), Windows
Para documentos complejos con tablas densas, diseños de varias columnas, gráficos, texto manuscrito o PDF escaneados, los creadores recomiendan LlamaParse, su analizador de documentos basado en la nube diseñado para flujos de trabajo de documentos en producción.
📖 Leer la fuente completa: HN AI Agents
👀 Ver también

Reduzca los costos de sesiones de codificación con IA en un 90% mediante la indexación de código basada en grafos
Un desarrollador creó una base de datos de grafos local que indexa un código fuente utilizando resúmenes generados por LLM, reduciendo los costos de las sesiones de Claude Code de $6-10 a centavos al evitar la relectura redundante de archivos.

ClawClone: Herramienta de Copia de Seguridad en la Nube para Espacios de Trabajo de OpenClaw
ClawClone es una herramienta que respalda los espacios de trabajo de OpenClaw en la nube con un solo comando y los restaura con otro. Fue creada después de que un desarrollador perdiera un mes de datos de entrenamiento.

LORE.md: Un estándar abierto para extraer conocimiento estructurado de conversaciones con IA
LORE.md es un estándar abierto para extraer conocimiento duradero de conversaciones con IA en un formato estructurado. Captura decisiones con su fundamentación, ideas clave, patrones, preguntas abiertas y próximos pasos, vinculando todo entre sesiones.

agentmemory V4 logra un 96.2% en el benchmark LongMemEval, superando a los sistemas de memoria de IA comerciales.
agentmemory V4 obtuvo un puntaje del 96.2% en LongMemEval, superando a varias empresas de memoria de IA con financiamiento, incluyendo PwC Chronos (95.6%), Mastra (94.87%) y OMEGA (93.2%). El sistema fue construido por una sola persona en 16 días en una PC de gama media con un presupuesto de $1,000.