NLA가 Gemma 3의 내부 활성화를 모든 토큰에 대해 읽을 수 있는 텍스트로 변환

✍️ OpenClawRadar📅 게시일: May 8, 2026🔗 Source
NLA가 Gemma 3의 내부 활성화를 모든 토큰에 대해 읽을 수 있는 텍스트로 변환
Ad

Anthropic이 특정 토큰에 대한 LLM의 내부 활성화를 사람이 읽을 수 있는 텍스트로 변환하는 NLA(Natural Language Autoencoders)라는 새로운 기법을 발표했습니다. Gemma 3 27b Instruct용 모델 가중치 두 세트를 공개했습니다:

  • Auto Verbalizer (AV): 대상 모델의 활성화를 입력으로 받아 특정 토큰을 생성할 때 모델이 "생각"하는 내용을 자연어로 설명하는 LLM입니다. 가중치는 kitft/nla-gemma3-27b-L41-av에서 확인할 수 있습니다.
  • Activation Reconstructor (AR): AV의 텍스트 출력에서 활성화를 재구성하여 오토인코더의 충실성을 검증하는 보조 모델입니다. 가중치는 kitft/nla-gemma3-27b-L41-ar에 있습니다.

Neuronpedia는 이미 neuronpedia.org/gemma-3-27b-it/nla에서 대화형 데모를 호스팅하고 있습니다. Gemma 3에 질문하고 응답에서 토큰을 클릭한 후 "explain"을 클릭하면 해당 토큰에 대한 모델의 내부 추론이 평문으로 표시됩니다.

이는 어텐션이나 중요도 맵이 아닙니다. 숨겨진 상태 벡터를 직접 디코딩합니다. AV 모델은 LLM과 함께 실행되어 토큰별 설명을 생성할 수 있으며, AR 모델은 AV 출력이 유효한 재구성임을 보장합니다. 두 모델 모두 오픈 가중치로 공개되었습니다.

대상: 메커니즘적 해석 가능성 연구자와 엔지니어, 또는 에이전트 모델이 특정 토큰을 선택하는 이유가 궁금한 개발자.

📖 전체 소스 읽기: r/LocalLLaMA

Ad

👀 See Also

Prism MCP v2.1은 Claude 세션에 지속적 메모리 기능을 추가합니다.
Tools

Prism MCP v2.1은 Claude 세션에 지속적 메모리 기능을 추가합니다.

Prism MCP v2.1.0 '마음의 궁전'은 Claude에 지속적인 세션 메모리를 제공하여 프로젝트 맥락을 매번 다시 설명할 필요가 없게 합니다. 로컬 SQLite 저장소, 시각적 메모리 브라우저, 상태 롤백, 그리고 클라이언트 간 맥락 동기화 기능을 갖추고 있습니다.

OpenClawRadar
클로드와의 에이전트형 AI 파트너십을 위한 오픈소스 방법론
Tools

클로드와의 에이전트형 AI 파트너십을 위한 오픈소스 방법론

한 개발자가 세션 간 공유 메모리, 인지 모니터링, 다중 AI 컨설테이션을 활용하는 지속적 파트너십 시스템을 Claude와 구축하는 방법에 대한 25,000단어 논문을 발표하고 오픈소스 템플릿을 공개했습니다.

OpenClawRadar
UIUC AI 조교, 11개 모델 병렬 실행으로 2초 미만 응답
Tools

UIUC AI 조교, 11개 모델 병렬 실행으로 2초 미만 응답

UIUC의 AI TA 챗봇은 텍스트/이미지 검색, 생성, 조정 및 순위 지정을 위해 11개 모델을 병렬로 실행하며 중간 응답 시간이 2초입니다. Pinecone RAG 및 RLHF 데이터셋과 함께 오픈소스로 제공됩니다.

OpenClawRadar
AI 에이전트용 CLI 구축: Google의 gws CLI에서 배운 설계 원칙
Tools

AI 에이전트용 CLI 구축: Google의 gws CLI에서 배운 설계 원칙

Google의 gws CLI는 AI 에이전트를 위해 특별히 설계된 명령줄 인터페이스 방법을 보여주며, 인간 친화적인 플래그보다 원시 JSON 페이로드를 우선시하고 환각 현상에 대한 안전 장치를 구현합니다.

OpenClawRadar