Сжатие LLM без потерь с использованием Codebook: сокращение оперативной памяти на 10-25% с помощью побитовой упаковки

Разработчик опубликовал код для концептуальной демонстрации сжатия LLM без потерь, который сокращает использование памяти на 10-25% за счет битовой общей упаковки индексированных весов. Техника жертвует некоторой скоростью вывода ради уменьшения размера модели, что позволяет запускать более крупные модели на оборудовании с ограниченной видеопамятью.
Как это работает
Разработчик начал с вопроса о том, сколько уникальных значений фактически существует в слоях LLM. Анализ показал, что хотя fp16 использует 16 бит, большинство моделей задействуют только около 12-13 бит уникальных значений. Упаковывая эти значения в блоки, техника достигает сжатия без потери точности.
Характеристики производительности
- Сокращение оперативной памяти: 10-25%+ на протестированных моделях
- Влияние на скорость: Скорость вывода примерно вдвое ниже в тестовых примерах
- Тестовое оборудование: NVIDIA P2200 (5 ГБ) и процессор, с разработкой обновлений для AMD MI50 (32 ГБ)
Детали реализации
Разработчик работал над этим проектом несколько недель с помощью ИИ-ассистентов для программирования, включая Claude, Qwen и Gemini. Репозиторий содержит как версию без потерь, так и версию с потерями/сбалансированную, хотя версия с потерями ещё не прошла всестороннего тестирования.
Разработчик предполагает, что этот подход к сжатию может служить способом измерения «компактности» модели — насколько эффективно она использует своё пространство параметров.
Доступность кода
Код для концептуальной демонстрации доступен на GitHub: https://github.com/bigattichouse/Codebook-Quantization
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

Локальная система мониторинга поведения с конвейером MCP и кодом Claude
Разработчик создал локальную систему мониторинга поведения под названием BRAIN, которая отслеживает переключения между приложениями, операции с файлами и сессии разработки, передавая данные через пользовательский MCP-сервер в Claude Code. Система работает на 100% локально без какой-либо зависимости от облачных сервисов.

Сервер MCP с открытым исходным кодом добавляет встроенную память сессий для Claude Desktop.
Разработчик создал сервер MCP на TypeScript со встроенной сессионной памятью для сохранения контекста между сеансами кодирования в Claude Desktop, устраняя необходимость в отдельной инфраструктуре памяти. Сервер включает функции сохранения/загрузки сессий и дополнительные инструменты, такие как интеграция с Brave Search и Google Gemini.

Qwen 3.6 27B F16 проходит тест программирования Pacman, но 8-битные квантизации проваливаются — ключевые уроки по шаблонам и спекулятивному декодированию MTP
Пользователь с одного раза заставляет клон Pacman работать с Qwen 3.6 27B F16 — две из трех попыток дают почти идеальные игры. 8-битные квантизации полностью проваливаются. Подробные заметки о настройке шаблона чата и ускорении декодирования с MTP.

Открытая система поиска работы на основе ИИ, созданная с помощью Claude Code, оценивает предложения и генерирует адаптированные резюме
Разработчик открыл исходный код проекта Claude Code, который превращает ваш терминал в командный центр поиска работы. Система оценивает предложения о работе по 10 параметрам, генерирует PDF-резюме, оптимизированные для систем отслеживания кандидатов, сканирует более 45 страниц карьеры компаний и включает 14 режимов навыков.