NLA transforma las activaciones internas de Gemma 3 en texto legible para cualquier token

Anthropic ha publicado una nueva técnica llamada Natural Language Autoencoders (NLA) que traduce las activaciones internas de un LLM a texto legible para cualquier token específico. Han lanzado dos conjuntos de pesos de modelo para Gemma 3 27b Instruct:
- Auto Verbalizer (AV): Un LLM que traduce las activaciones del modelo objetivo a una explicación en lenguaje natural de lo que el modelo "piensa" al generar un token particular. Pesos disponibles en kitft/nla-gemma3-27b-L41-av.
- Reconstructor de Activaciones (AR): Un modelo complementario que reconstruye las activaciones a partir de la salida de texto del AV, verificando que el autoencoder sea fiel. Pesos en kitft/nla-gemma3-27b-L41-ar.
Neuronpedia ya aloja un demo interactivo en neuronpedia.org/gemma-3-27b-it/nla. Le haces una pregunta a Gemma 3, haces clic en cualquier token de la respuesta, luego haces clic en "explicar" para ver el razonamiento interno del modelo para ese token traducido a texto plano.
Esto no se trata de mapas de atención o de saliencia — decodifica directamente los vectores de estado oculto. El modelo AV puede ejecutarse junto a tu LLM y producir explicaciones por token, mientras que el modelo AR asegura que la salida del AV sea una reconstrucción válida. Ambos se publican bajo pesos abiertos.
Para quién es: Investigadores e ingenieros que trabajan en interpretabilidad mecanicista, o desarrolladores curiosos sobre por qué el modelo de su agente elige tokens específicos.
📖 Lee la fuente completa: r/LocalLLaMA
👀 Ver también

de una sola lectura: Un Gancho de Código Claude que Evita Lecturas Redundantes de Archivos
Un desarrollador creó un gancho PreToolUse llamado read-once que rastrea los archivos que Claude Code ya ha leído en una sesión, bloqueando relecturas de archivos sin cambios y usando diferencias para archivos modificados. La herramienta ahorra miles de tokens por sesión al evitar que Claude lea repetidamente el mismo contenido de archivo.

Medición del gasto de tokens fuera de tarea en Claude Code: La métrica de 'intención no declarada'
Un desarrollador creó una métrica para cuantificar el cómputo invertido en rutas de ejecución no intencionadas en sesiones de Claude Code, descubriendo que el 22.8% de los tokens se destinaron a tareas fuera del objetivo.

Complemento de Slack para Claude Code: Conéctate a Slack para Contexto y Actualizaciones
Slack ha lanzado un nuevo complemento para Claude Code que permite conectarse a Slack para búsquedas, mensajería y creación de documentos. El complemento permite a Claude Code acceder al contexto de Slack para resolver problemas técnicos y publicar actualizaciones.

MCP-India-Stack: Servidor con prioridad sin conexión para datos financieros indios en agentes de IA
MCP-India-Stack es un servidor MCP con prioridad offline que proporciona funcionalidad de API financieras y gubernamentales indias sin autenticación ni llamadas a API externas. Incluye conjuntos de datos localmente para cálculos de impuestos, herramientas de validación y búsquedas.