NLA transforma las activaciones internas de Gemma 3 en texto legible para cualquier token

Anthropic ha publicado una nueva técnica llamada Natural Language Autoencoders (NLA) que traduce las activaciones internas de un LLM a texto legible para cualquier token específico. Han lanzado dos conjuntos de pesos de modelo para Gemma 3 27b Instruct:
- Auto Verbalizer (AV): Un LLM que traduce las activaciones del modelo objetivo a una explicación en lenguaje natural de lo que el modelo "piensa" al generar un token particular. Pesos disponibles en kitft/nla-gemma3-27b-L41-av.
- Reconstructor de Activaciones (AR): Un modelo complementario que reconstruye las activaciones a partir de la salida de texto del AV, verificando que el autoencoder sea fiel. Pesos en kitft/nla-gemma3-27b-L41-ar.
Neuronpedia ya aloja un demo interactivo en neuronpedia.org/gemma-3-27b-it/nla. Le haces una pregunta a Gemma 3, haces clic en cualquier token de la respuesta, luego haces clic en "explicar" para ver el razonamiento interno del modelo para ese token traducido a texto plano.
Esto no se trata de mapas de atención o de saliencia — decodifica directamente los vectores de estado oculto. El modelo AV puede ejecutarse junto a tu LLM y producir explicaciones por token, mientras que el modelo AR asegura que la salida del AV sea una reconstrucción válida. Ambos se publican bajo pesos abiertos.
Para quién es: Investigadores e ingenieros que trabajan en interpretabilidad mecanicista, o desarrolladores curiosos sobre por qué el modelo de su agente elige tokens específicos.
📖 Lee la fuente completa: r/LocalLLaMA
👀 Ver también
Hoplite (YC S26) lanza despliegue en la nube para agentes de codificación con vistas previas de QA
Hoplite te permite desplegar agentes de codificación en la nube, transfiriendo tu configuración local incluyendo sesiones, memorias y servidores MCP. Incluye un arnés personalizado y se centra en la incorporación y vistas previas para QA.

RelayCode Extensión de VS Code Enruta el Código de Claude a Través de RDUs Soberanos
OpenGPU ha lanzado RelayCode, una extensión de VS Code que actúa como un proxy local para redirigir solicitudes de Claude Code o Copilot a través de su red descentralizada hacia modelos de código abierto como DeepSeek-R1 y MiniMax M2.5, ejecutándose en unidades de flujo de datos reconfigurables soberanas.

FlowBoard v5: Espacio de trabajo de proyectos basado en eventos para equipos multiagente
FlowBoard v5 reconstruye la capa de contexto del proyecto en React con un almacén de tareas basado en eventos, permite la coordinación multiagente entre OpenClaw, Claude Code y Cursor, e introduce un pipeline de Ideas a Especificaciones.

Actualizaciones de CodeLedger y Vibecop para el Seguimiento de Costos y Calidad en Codificación con IA Multi-Agente
CodeLedger ahora rastrea el gasto en Claude Code, Codex CLI, Cline y Gemini CLI leyendo archivos de sesión locales, mientras que Vibecop agrega verificaciones de calidad automatizadas con nuevos detectores específicos para LLM y una configuración de un solo comando para múltiples herramientas de codificación con IA.