NLA преобразует внутренние активации Gemma 3 в читаемый текст для любого токена

✍️ OpenClawRadar📅 Опубликовано: 8 мая 2026 г.🔗 Source
NLA преобразует внутренние активации Gemma 3 в читаемый текст для любого токена
Ad

Anthropic опубликовала новую технику под названием Natural Language Autoencoders (NLA), которая переводит внутренние активации LLM в читаемый человеком текст для любого конкретного токена. Они выпустили два набора весов модели для Gemma 3 27b Instruct:

  • Auto Verbalizer (AV): LLM, переводящая активации целевой модели в текстовое объяснение того, о чем модель «думает» при генерации конкретного токена. Веса доступны по адресу kitft/nla-gemma3-27b-L41-av.
  • Activation Reconstructor (AR): Вспомогательная модель, восстанавливающая активации из текстового вывода AV, что подтверждает точность автоэнкодера. Веса по адресу kitft/nla-gemma3-27b-L41-ar.

Neuronpedia уже предоставляет интерактивное демо по адресу neuronpedia.org/gemma-3-27b-it/nla. Вы задаете вопрос Gemma 3, кликаете на любой токен в ответе, затем нажимаете «explain» и видите внутренние рассуждения модели для этого токена, переведенные на простой язык.

Ad

Это не про механизмы внимания или карты значимости — метод напрямую декодирует векторы скрытого состояния. Модель AV может работать вместе с вашей LLM и создавать объяснения для каждого токена, а модель AR гарантирует, что вывод AV является корректной реконструкцией. Обе модели выпущены с открытыми весами.

Для кого это: Для исследователей и инженеров, занимающихся механистической интерпретируемостью, или разработчиков, интересующихся, почему их агентская модель выбирает конкретные токены.

📖 Читать полный источник: r/LocalLLaMA

Ad

👀 Смотрите также

Mímir: Система памяти на Python, основанная на 21 механизме нейронауки
Инструменты

Mímir: Система памяти на Python, основанная на 21 механизме нейронауки

Mímir — это система памяти на Python для ИИ-агентов, реализующая 21 механизм когнитивной науки, такие как флэшбэк-память и забывание, вызванное извлечением. Она использует гибридный индекс BM25 + семантический + датированный и демонстрирует улучшения в тестах, включая на 13% более высокую точность инструментов на Mem2ActBench по сравнению с VividnessMem.

OpenClawRadar
Qwen 3.6 27B достигает 2.5-кратного ускорения при спекулятивном декодировании MTP на llama.cpp
Инструменты

Qwen 3.6 27B достигает 2.5-кратного ускорения при спекулятивном декодировании MTP на llama.cpp

Пользователь Reddit сообщает о 2.5-кратном ускорении инференса Qwen 3.6 27B с использованием спекулятивного декодирования MTP и кастомного PR для llama.cpp, достигая 28 ток/с на Mac M2 Max 96GB. Включает предварительно конвертированные GGUF квантизации и исправленные шаблоны чатов.

OpenClawRadar
LogClaw: Открытая платформа AI SRE для автоматического создания тикетов на основе логов
Инструменты

LogClaw: Открытая платформа AI SRE для автоматического создания тикетов на основе логов

LogClaw — это платформа с открытым исходным кодом для анализа логов, работающая на Kubernetes, принимающая логи через OpenTelemetry, обнаруживающая аномалии с помощью составного скоринга на основе сигналов и автоматически создающая тикеты с анализом первопричин примерно за 90 секунд.

OpenClawRadar
Телеграм-бот для управления CLI Claude Code с мобильного устройства
Инструменты

Телеграм-бот для управления CLI Claude Code с мобильного устройства

Разработчик создал Telegram-бота, который служит мостом к CLI Claude Code, позволяя управлять им через мобильные команды, такие как /commit, /code_review и /simplify. Бот автоматически обнаруживает пользовательские навыки, обрабатывает фотографии, документы и голосовые заметки, а также поддерживает сессии в групповых чатах.

OpenClawRadar