Merlin: Локальное первое дедупликация контекста LLM – измерение до 71% перекрытия чанков, бесплатно и с открытым ядром

✍️ OpenClawRadar📅 Опубликовано: 13 мая 2026 г.🔗 Source
Merlin: Локальное первое дедупликация контекста LLM – измерение до 71% перекрытия чанков, бесплатно и с открытым ядром
Ad

Автор выпустил Merlin — локальный инструмент дедупликации для контекстных окон LLM. Тестирование на 22 миллионах пассажей из реальных сессий агентов и пайплайнов RAG показало 22% дублированного контента в типичном контексте агента и до 71% в запросах с интенсивным RAG. Для локальных моделей с контекстом 8K/16K/32K удаление избыточности означает, что больше полезных токенов помещается до усечения.

Три режима интеграции

1. Режим HTTP-прокси

Лучше всего подходит для Ollama, vLLM, SGLang, OpenWebUI, llama.cpp server или чего-либо с совместимым с OpenAI эндпоинтом. Запустите прокси локально и укажите клиенту http://localhost:8787/v1 вместо вашего сервера моделей. Дедупликация на уровне чанков происходит в исходящем запросе до отправки модели.

По умолчанию включен режим с учетом кэша: префикс беседы остается нетронутым (так что prefix-caching vLLM/SGLang по-прежнему работает), и дедуплицируется только последнее сообщение пользователя. Есть опциональный агрессивный режим, если частота попаданий в кэш уже низкая.

2. MCP-сервер

Для Claude Desktop, Claude Code, OpenClaw, Cursor. Предоставляет инструменты:

  • merlin_dedupe — дедупликация текста
  • merlin_dedupe_file — дедупликация содержимого файла
  • merlin_savings_summary — отображение статистики
  • merlin_status — проверка сервиса

Эти инструменты не вызываются автоматически; необходимо дать модели инструкцию вызывать их для больших вставок.

3. Автономный CLI

Для конвейеров оболочки и предварительной обработки. Однопоточный, бинарник ~250 КБ, без зависимостей времени выполнения, без сетевых вызовов. Принимает входной файл в аргументе и записывает дедуплицированные строки через --output-dedup=path.txt.

Ad

Установка (одна команда на конфигурацию)

curl -LO https://github.com/corbenicai/merlin-community/releases/latest/download/merlin-community.zip
unzip merlin-community.zip && cd merlin-community
python shared/install_helpers.py <integration> enable

Где <integration> может быть claude_desktop, claude_code, openclaw, cursor или proxy.

Измерения и компромиссы

  • Статьи: arXiv:2605.09611 (архитектура), arXiv:2605.09990 (измерение на 22M пассажах), Zenodo: 10.5281/zenodo.20090991
  • Лимиты сообщества: 50 МБ за запуск, 200 МБ в день, 2 ГБ в месяц. Четко отклоняет слишком большую работу (проверено на файле 51 МБ). Для любительского использования подходит.
  • Открытое ядро: Публичный репозиторий — это community edition; отдельный закрытый движок Pro существует для высокопроизводительных серверов.
  • Не исправляет фрагментацию сессии, когда весь разговор воспроизводится каждый раз — это проблема оркестровки, выходящая за рамки данного инструмента.
  • Доступность бинарников: Windows x64 в v0.2.1. Linux + macOS CI пайплайн в разработке.

Для кого это

Для пользователей локальных LLM, запускающих агентов или RAG с Ollama, vLLM, SGLang, llama.cpp или любым совместимым с OpenAI бэкендом, которые хотят уместить больше реальных токенов в ограниченные контекстные окна.

📖 Читать полный источник: r/LocalLLaMA

Ad

👀 Смотрите также

Caliby: С открытым исходным кодом встроенная векторная база данных для AI-агентов с гибридным текстово-векторным хранением
Инструменты

Caliby: С открытым исходным кодом встроенная векторная база данных для AI-агентов с гибридным текстово-векторным хранением

Caliby — это встроенная векторная база данных на C++ с привязками к Python (pip install caliby), которая поддерживает индексы HNSW, DiskANN и IVF+PQ, заявляет о 4-кратной производительности по сравнению с pgvector и нативно хранит текст вместе с векторами для случаев использования AI Agent и RAG.

OpenClawRadar
Toolport: локальный шлюз для управления MCP-серверами в одном месте для всех приложений
Инструменты

Toolport: локальный шлюз для управления MCP-серверами в одном месте для всех приложений

Toolport — это бесплатное десктопное приложение с открытым исходным кодом и локальный шлюз, который централизует конфигурации MCP-серверов, хранит API-ключи в связке ключей ОС и добавляет уровни безопасности для ИИ-агентов.

OpenClawRadar
Четыре навыка ClawHub для работы с данными поиска в реальном времени в AI-агентах
Инструменты

Четыре навыка ClawHub для работы с данными поиска в реальном времени в AI-агентах

Четыре навыка ClawHub предоставляют структурированные возможности поиска для ИИ-агентов: Google (веб, новости, изображения, карты), Amazon (поиск товаров на 12 торговых площадках), Walmart (поиск товаров с фильтрами доставки) и YouTube (поиск видео с транскриптами). Установка через команды clawhub install с одним API-ключом.

OpenClawRadar
ClamBot: ИИ-агент выполняет код, сгенерированный LLM, в песочнице WASM для обеспечения безопасности
Инструменты

ClamBot: ИИ-агент выполняет код, сгенерированный LLM, в песочнице WASM для обеспечения безопасности

ClamBot — это фреймворк для AI-агентов, который выполняет весь код, сгенерированный LLM, в песочнице WebAssembly с использованием QuickJS в Wasmtime, устраняя необходимость в вызовах exec() или подпроцессов. Он включает шлюз одобрения для вызовов инструментов, постоянное кэширование скриптов в виде «clams» и поддерживает несколько провайдеров LLM.

OpenClawRadar