NLA преобразует внутренние активации Gemma 3 в читаемый текст для любого токена

Anthropic опубликовала новую технику под названием Natural Language Autoencoders (NLA), которая переводит внутренние активации LLM в читаемый человеком текст для любого конкретного токена. Они выпустили два набора весов модели для Gemma 3 27b Instruct:
- Auto Verbalizer (AV): LLM, переводящая активации целевой модели в текстовое объяснение того, о чем модель «думает» при генерации конкретного токена. Веса доступны по адресу kitft/nla-gemma3-27b-L41-av.
- Activation Reconstructor (AR): Вспомогательная модель, восстанавливающая активации из текстового вывода AV, что подтверждает точность автоэнкодера. Веса по адресу kitft/nla-gemma3-27b-L41-ar.
Neuronpedia уже предоставляет интерактивное демо по адресу neuronpedia.org/gemma-3-27b-it/nla. Вы задаете вопрос Gemma 3, кликаете на любой токен в ответе, затем нажимаете «explain» и видите внутренние рассуждения модели для этого токена, переведенные на простой язык.
Это не про механизмы внимания или карты значимости — метод напрямую декодирует векторы скрытого состояния. Модель AV может работать вместе с вашей LLM и создавать объяснения для каждого токена, а модель AR гарантирует, что вывод AV является корректной реконструкцией. Обе модели выпущены с открытыми весами.
Для кого это: Для исследователей и инженеров, занимающихся механистической интерпретируемостью, или разработчиков, интересующихся, почему их агентская модель выбирает конкретные токены.
📖 Читать полный источник: r/LocalLLaMA
👀 Смотрите также

Mímir: Система памяти на Python, основанная на 21 механизме нейронауки
Mímir — это система памяти на Python для ИИ-агентов, реализующая 21 механизм когнитивной науки, такие как флэшбэк-память и забывание, вызванное извлечением. Она использует гибридный индекс BM25 + семантический + датированный и демонстрирует улучшения в тестах, включая на 13% более высокую точность инструментов на Mem2ActBench по сравнению с VividnessMem.

Qwen 3.6 27B достигает 2.5-кратного ускорения при спекулятивном декодировании MTP на llama.cpp
Пользователь Reddit сообщает о 2.5-кратном ускорении инференса Qwen 3.6 27B с использованием спекулятивного декодирования MTP и кастомного PR для llama.cpp, достигая 28 ток/с на Mac M2 Max 96GB. Включает предварительно конвертированные GGUF квантизации и исправленные шаблоны чатов.

LogClaw: Открытая платформа AI SRE для автоматического создания тикетов на основе логов
LogClaw — это платформа с открытым исходным кодом для анализа логов, работающая на Kubernetes, принимающая логи через OpenTelemetry, обнаруживающая аномалии с помощью составного скоринга на основе сигналов и автоматически создающая тикеты с анализом первопричин примерно за 90 секунд.

Телеграм-бот для управления CLI Claude Code с мобильного устройства
Разработчик создал Telegram-бота, который служит мостом к CLI Claude Code, позволяя управлять им через мобильные команды, такие как /commit, /code_review и /simplify. Бот автоматически обнаруживает пользовательские навыки, обрабатывает фотографии, документы и голосовые заметки, а также поддерживает сессии в групповых чатах.