NLA가 Gemma 3의 내부 활성화를 모든 토큰에 대해 읽을 수 있는 텍스트로 변환

Anthropic이 특정 토큰에 대한 LLM의 내부 활성화를 사람이 읽을 수 있는 텍스트로 변환하는 NLA(Natural Language Autoencoders)라는 새로운 기법을 발표했습니다. Gemma 3 27b Instruct용 모델 가중치 두 세트를 공개했습니다:
- Auto Verbalizer (AV): 대상 모델의 활성화를 입력으로 받아 특정 토큰을 생성할 때 모델이 "생각"하는 내용을 자연어로 설명하는 LLM입니다. 가중치는 kitft/nla-gemma3-27b-L41-av에서 확인할 수 있습니다.
- Activation Reconstructor (AR): AV의 텍스트 출력에서 활성화를 재구성하여 오토인코더의 충실성을 검증하는 보조 모델입니다. 가중치는 kitft/nla-gemma3-27b-L41-ar에 있습니다.
Neuronpedia는 이미 neuronpedia.org/gemma-3-27b-it/nla에서 대화형 데모를 호스팅하고 있습니다. Gemma 3에 질문하고 응답에서 토큰을 클릭한 후 "explain"을 클릭하면 해당 토큰에 대한 모델의 내부 추론이 평문으로 표시됩니다.
이는 어텐션이나 중요도 맵이 아닙니다. 숨겨진 상태 벡터를 직접 디코딩합니다. AV 모델은 LLM과 함께 실행되어 토큰별 설명을 생성할 수 있으며, AR 모델은 AV 출력이 유효한 재구성임을 보장합니다. 두 모델 모두 오픈 가중치로 공개되었습니다.
대상: 메커니즘적 해석 가능성 연구자와 엔지니어, 또는 에이전트 모델이 특정 토큰을 선택하는 이유가 궁금한 개발자.
📖 전체 소스 읽기: r/LocalLLaMA
👀 See Also

AnyClaw: Android 하드웨어 접근 및 터미널 개발용 AI 에이전트가 탑재된 Ubuntu 24.04
AnyClaw는 Android에서 proot로 실행되는 완전한 Ubuntu 24.04 환경을 제공하며, 터미널에서 bash 명령어와 Java 실행을 통해 카메라, GPS, 배터리, 센서 등 Android 하드웨어 API에 직접 접근할 수 있습니다. 동일 네트워크의 모든 브라우저에서 접근 가능한 웹 UI와 이러한 도구들을 조율할 수 있는 AI 코딩 에이전트를 포함하고 있습니다.

Claude Code Mastery: 오픈소스 설정 시스템으로 Claude Code CLI에 지속적 메모리와 선별된 스킬 추가
Claude Code Mastery는 세션 간 지속적인 메모리, 스마트 라이프사이클 훅, Claude Code CLI에 대한 26개 이상의 선별된 스킬을 추가하는 오픈소스 구성 시스템입니다. 프로젝트당 6파일 메모리 뱅크, 제로 설정 런처, 크로스 플랫폼 지원을 포함합니다.

블라인드스팟 MCP: AI 코딩 에이전트를 위한 외부 두뇌
Blindspot MCP는 tree-sitter와 SQLite를 사용하여 전체 코드베이스를 인덱싱하여 AI 코딩 에이전트가 파일 간의 심볼, 의존성, 관계를 이해하고, 직접적인 컨텍스트 외부의 코드를 손상시키는 변경을 방지하는 도구입니다.

오픈소스 AI 에이전트 자가 치유 기술은 실패를 자동으로 감지하고 수정합니다.
새로운 오픈소스 스킬은 AI 에이전트가 자동으로 실패를 감지하고 근본 원인을 진단하며 수정 사항을 구현할 수 있게 합니다. 여기에는 크론 작업, 하위 에이전트, 배포 로그를 위한 실패 스캐너와 이전 수정 사항에서 학습하는 데이터베이스가 포함됩니다.