NLA transforma as ativações internas do Gemma 3 em texto legível para qualquer token

A Anthropic publicou uma nova técnica chamada Natural Language Autoencoders (NLA), que traduz as ativações internas de um LLM em texto legível para humanos para qualquer token específico. Eles lançaram dois conjuntos de pesos de modelo para o Gemma 3 27b Instruct:
- Auto Verbalizer (AV): Um LLM que traduz as ativações do modelo alvo em uma explicação em linguagem natural do que o modelo está "pensando" ao gerar um token específico. Pesos disponíveis em kitft/nla-gemma3-27b-L41-av.
- Activation Reconstructor (AR): Um modelo complementar que reconstrói as ativações a partir da saída de texto do AV, verificando se o autoencoder é fiel. Pesos em kitft/nla-gemma3-27b-L41-ar.
O Neuronpedia já hospeda uma demo interativa em neuronpedia.org/gemma-3-27b-it/nla. Você faz uma pergunta ao Gemma 3, clica em qualquer token na resposta e depois clica em "explain" para ver o raciocínio interno do modelo para aquele token traduzido em texto simples.
Isso não é sobre mapas de atenção ou saliência — ele decodifica diretamente os vetores de estado oculto. O modelo AV pode rodar junto com seu LLM e produzir explicações por token, enquanto o modelo AR garante que a saída do AV seja uma reconstrução válida. Ambos são lançados sob pesos abertos.
Para quem é: Pesquisadores e engenheiros que trabalham com interpretabilidade mecanicista, ou desenvolvedores curiosos sobre por que o modelo do seu agente escolhe tokens específicos.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

HolyClaude: Contêiner Docker para Claude Code com Interface de Navegador e Chromium Headless
HolyClaude é um contêiner Docker de código aberto que empacota o Claude Code CLI com uma interface de usuário baseada em navegador, Chromium headless e ferramentas adicionais de codificação com IA. A configuração requer apenas docker compose up e fornece acesso em localhost:3001.

RubyLLM: Um Framework Ruby para Todos os Principais Provedores de IA
RubyLLM fornece um único framework Ruby para OpenAI, Anthropic, Gemini, Ollama e 800+ modelos. Oferece chat, visão, áudio, ferramentas, agentes, streaming e integração com Rails.

Painel local monitora o uso do Claude Code com custos de tokens, chamadas de ferramentas e análises de sessão
Um desenvolvedor criou um painel local que lê os arquivos de sessão JSONL do Claude Code para visualizar o uso de tokens, custos estimados, detalhamento de chamadas de ferramentas e histórico de sessões. A ferramenta funciona inteiramente na sua máquina com uma API Express e um painel React.

Signet: Camada de Memória de Código Aberto para Agentes de IA de Programação Atinge 80% de F1 no LoCoMo
Signet é um sistema de memória de código aberto para agentes de IA de codificação que alcança 80% de F1 no benchmark LoCoMo, em comparação com 41% do RAG padrão. Ele extrai memórias após cada sessão e injeta contexto relevante antes dos prompts, executando localmente com SQLite.