Toroidal Logit Bias: простой трюк на инференсе снижает галлюцинации на 40%

Исследователи разработали простой метод логит-бая, который снижает фактические галлюцинации без дообучения или RAG. Техника может быть применена к любой локальной модели во время вывода.
Как это работает
Метод отображает идентификаторы токенов на тор (тороидальную поверхность) размером 12x12, затем увеличивает логиты для токенов, которые "близки" к недавним токенам в этом тороидальном пространстве. Только первые 1-3K токенов подвергаются баю — применение его к полному словарю ухудшает производительность.
Результаты
- Qwen 2.5-7B: на 40% меньше фактических ошибок
- OLMo 1.7-7B: на 15.4% меньше фактических ошибок
- TruthfulQA (817 запросов): +6.8% улучшение по сравнению с Qwen
- Стоимость производительности: ~5% медленнее генерация
Реализация
Основная логика состоит примерно из 30 строк Python. Каждая модель требует своих гиперпараметров — Qwen работает лучше всего с alpha=0.3, radius=2.0, N=1440, в то время как OLMo нуждается в alpha=0.2, radius=3.0, N=3000.
Демо: huggingface.co/spaces/paraxiom-research/topological-coherence
Статья: doi.org/10.5281/zenodo.18516477
Почему это важно
Это достижение в методах логит-бая имеет значительное значение для экосистемы AI-агентов, так как оно решает критическую проблему фактических галлюцинаций, которая была основным препятствием для развертывания надежных AI-моделей. Улучшая точность выводов без обширного переобучения, этот метод может привести к более надежным AI-приложениям в различных областях, от обслуживания клиентов до генерации контента.
Ключевые выводы
- Этот метод может значительно снизить фактические ошибки, при этом Qwen демонстрирует 40% улучшение.
- Он работает во время вывода, что делает его простым в реализации без необходимости сложного дообучения.
- Подход адаптируем к различным моделям, каждая из которых требует специфических гиперпараметров для оптимальной производительности.
- Хотя он эффективен, существует небольшая компенсация в скорости производительности, с увеличением времени генерации на ~5%.
Как начать
Чтобы реализовать метод тороидального логит-бая, начните с доступа к предоставленному репозиторию кода на GitHub. Ознакомьтесь с документацией для вашей конкретной модели, чтобы понять необходимые гиперпараметры. После настройки вашей среды вы можете легко интегрировать технику логит-бая в ваш существующий конвейер вывода. Для практического опыта ознакомьтесь с демо-ссылкой, чтобы увидеть метод в действии.
📖 Читать полный источник: r/LocalLLaMA
👀 Смотрите также

Библиотека с открытым исходным кодом из 59 навыков Claude охватывает полный жизненный цикл веб-сайта
Разработчик опубликовал 59 готовых навыков для Claude, охватывающих поиск бренда, дизайн, контент, SEO, разработку, эксплуатацию и рост — независимые от стека, с единой структурой и CI-проверками.

re_gent: Git для ИИ-агентов кодинга – Контроль версий активности агента
re_gent — это инструмент с открытым исходным кодом, который обеспечивает контроль версий для сессий ИИ-агентов, отслеживая каждый вызов инструмента, сохраняя подсказки и различия в файлах, и предоставляя команды, такие как `rgt log`, `rgt blame` и `rgt rewind` (скоро появится).

Счет за Навыки: Структура Управления Навыками Кодирования ИИ на Основе Markdown
Разработчик создал Skill Bill — фреймворк из 44 навыков ИИ на основе Markdown для Kotlin, Android/KMP, PHP и Go, решающий проблемы управления промптами, такие как дрейф наименований и дублирование логики. Он включает навыки-оркестраторы, такие как 'feature-implement', которые объединяют 10-12 вызовов навыков в цепочку и синхронизируются с Claude Code, Copilot, GLM и Codex.

Использование вложений Harrier для локального семантического поиска в памяти агентов OpenClaw
Запустите локальный сервер эмбеддингов с моделью Harrier от Microsoft, откройте API, совместимое с Ollama, и настройте memorySearch в OpenClaw для локального поиска семантической памяти без внешних сервисов.