Toroidal Logit Bias: простой трюк на инференсе снижает галлюцинации на 40%

Исследователи разработали простой метод логит-бая, который снижает фактические галлюцинации без дообучения или RAG. Техника может быть применена к любой локальной модели во время вывода.
Как это работает
Метод отображает идентификаторы токенов на тор (тороидальную поверхность) размером 12x12, затем увеличивает логиты для токенов, которые "близки" к недавним токенам в этом тороидальном пространстве. Только первые 1-3K токенов подвергаются баю — применение его к полному словарю ухудшает производительность.
Результаты
- Qwen 2.5-7B: на 40% меньше фактических ошибок
- OLMo 1.7-7B: на 15.4% меньше фактических ошибок
- TruthfulQA (817 запросов): +6.8% улучшение по сравнению с Qwen
- Стоимость производительности: ~5% медленнее генерация
Реализация
Основная логика состоит примерно из 30 строк Python. Каждая модель требует своих гиперпараметров — Qwen работает лучше всего с alpha=0.3, radius=2.0, N=1440, в то время как OLMo нуждается в alpha=0.2, radius=3.0, N=3000.
Демо: huggingface.co/spaces/paraxiom-research/topological-coherence
Статья: doi.org/10.5281/zenodo.18516477
Почему это важно
Это достижение в методах логит-бая имеет значительное значение для экосистемы AI-агентов, так как оно решает критическую проблему фактических галлюцинаций, которая была основным препятствием для развертывания надежных AI-моделей. Улучшая точность выводов без обширного переобучения, этот метод может привести к более надежным AI-приложениям в различных областях, от обслуживания клиентов до генерации контента.
Ключевые выводы
- Этот метод может значительно снизить фактические ошибки, при этом Qwen демонстрирует 40% улучшение.
- Он работает во время вывода, что делает его простым в реализации без необходимости сложного дообучения.
- Подход адаптируем к различным моделям, каждая из которых требует специфических гиперпараметров для оптимальной производительности.
- Хотя он эффективен, существует небольшая компенсация в скорости производительности, с увеличением времени генерации на ~5%.
Как начать
Чтобы реализовать метод тороидального логит-бая, начните с доступа к предоставленному репозиторию кода на GitHub. Ознакомьтесь с документацией для вашей конкретной модели, чтобы понять необходимые гиперпараметры. После настройки вашей среды вы можете легко интегрировать технику логит-бая в ваш существующий конвейер вывода. Для практического опыта ознакомьтесь с демо-ссылкой, чтобы увидеть метод в действии.
📖 Читать полный источник: r/LocalLLaMA
👀 Смотрите также

Инструмент резервного копирования Databasus PostgreSQL получает поддержку с открытым исходным кодом от Anthropic.
Anthropic признала инструмент для резервного копирования баз данных с открытым исходным кодом Databasus через свою программу Claude for Open Source, предоставив сопровождающим бесплатный доступ к Claude Max. Инструмент поддерживает PostgreSQL, MySQL, MariaDB и MongoDB с запланированными резервными копиями, 70+ вариантами хранения и шифрованием AES-256-GCM.

Mímir: Система памяти на Python, основанная на 21 механизме нейронауки
Mímir — это система памяти на Python для ИИ-агентов, реализующая 21 механизм когнитивной науки, такие как флэшбэк-память и забывание, вызванное извлечением. Она использует гибридный индекс BM25 + семантический + датированный и демонстрирует улучшения в тестах, включая на 13% более высокую точность инструментов на Mem2ActBench по сравнению с VividnessMem.

Знающий Ворон: Поисковый плагин базы знаний для Claude
Knowledge Raven — это инструмент, который позволяет Claude искать в ваших документах из таких источников, как Confluence, Notion, Google Drive, Dropbox и GitHub, через плагин для Claude Desktop или MCP-сервер, предоставляя семантический поиск, поиск по ключевым словам и полное извлечение документов.

HostMyClaudeHTML: Публикация HTML-артефактов Claude в один клик
Разработчик создал hostmyclaudehtml.com — бесплатный инструмент, который позволяет делиться HTML-артефактами, сгенерированными Claude, в виде живых URL-адресов, просто перетаскивая файл .html. Для загрузчиков и просматривающих не требуется аккаунт.