상태 흐름 기계: 트랜스포머 아키텍처가 2%로 떨어지는 긴 시퀀스에서 비트랜스포머 구조가 62% 정확도 유지

✍️ OpenClawRadar📅 게시일: March 16, 2026🔗 Source
상태 흐름 기계: 트랜스포머 아키텍처가 2%로 떨어지는 긴 시퀀스에서 비트랜스포머 구조가 62% 정확도 유지
Ad

한 개발자가 긴 시퀀스에 걸친 상태 추적이 필요한 작업을 위해 설계된 비트랜스포머 아키텍처인 State Flow Machine(SFM)을 구축했습니다. 이 모델은 단일 Huawei Ascend 910 ProA NPU에서 실행되며, 시퀀스가 학습 길이를 초과할 때 트랜스포머가 단계별로 프로세스를 시뮬레이션하는 데 한계를 극복합니다.

아키텍처 세부 사항

SFM은 어텐션 헤드 대신 명시적 메모리 슬롯(작은 고정 크기 벡터) 뱅크를 사용합니다. 각 토큰에서 게이팅 메커니즘이 어떤 슬롯을 어떻게 업데이트할지 결정합니다. 모델은 슬롯에서 읽고, 업데이트를 계산한 후 다시 기록하며, 작은 미분 가능 레지스터 파일처럼 작동합니다. 이 접근 방식은 DeltaNet, Linear Attention, 상태 공간 모델(Mamba, RWKV)과 관련이 있지만 더 명시적입니다. 슬롯은 직접 주소 지정 가능하며 암시적 순환 상태가 아닌 학습된 게이트를 통해 업데이트됩니다.

벤치마크 설정

합성 프로그램 상태 추적 벤치마크는 x = 42; x += 17; x -= 8; x *= 2; ...과 같은 시퀀스를 포함하며, 모델은 x의 최종 값(정수 0–100, 101개 클래스 분류로 구성)을 예측해야 합니다.

  • 학습 데이터: 10,000개 프로그램, 10–27개 연산, 어려운 난이도(모든 연산: 더하기, 빼기, 곱하기, 정수 나누기, 모듈로, 설정), 시드 42
  • 검증: 1,000개 프로그램, 동일한 분포
  • 평가: 학습 프로그램 길이의 1배(분포 내), 2배, 4배, 8배, 16배, 32배에서 테스트
Ad

결과

정확 일치 정확도:

  • 1배(10개 연산): State Slots 99.9%, Transformer-Fair 100.0%, Transformer-Large 100.0%
  • 2배(20개 연산): State Slots 92.9%, Transformer-Fair 99.0%, Transformer-Large 99.5%
  • 4배(40개 연산): State Slots 62.0%, Transformer-Fair 1.9%, Transformer-Large 3.1%
  • 8배(80개 연산): State Slots 35.3%, Transformer-Fair 1.3%, Transformer-Large 1.0%
  • 16배(160개 연산): State Slots 5.1%, Transformer-Fair 0.9%, Transformer-Large 0.7%
  • 32배(320개 연산): State Slots 5.0%, Transformer-Fair 1.0%, Transformer-Large 0.8%

일반화 비율(정확도 유지):

  • State Slots: 4배/1배 = 0.62배, 8배/1배 = 0.35배
  • Transformer-Fair: 4배/1배 = 0.02배, 8배/1배 = 0.01배
  • Transformer-Large: 4배/1배 = 0.03배, 8배/1배 = 0.01배

외삽 길이에서의 평균 절대 오차(범위 0–100):

  • 4배: State Slots 14.03, Transformer-Fair 40.33, Transformer-Large 36.76
  • 8배: State Slots 26.73, Transformer-Fair 41.71, Transformer-Large 41.19

트랜스포머는 4배 이상에서 사실상 무작위로 추측하는 반면(0–100 범위에서 MAE ~40은 균일 무작위 추측의 예상 오차에 가깝습니다), State Slots는 의미 있는 예측을 계속합니다.

모델 매개변수

State Slots는 961K 매개변수를 사용하며, Transformer-Fair(443K) 및 Transformer-Large(2.2M)와 비교됩니다.

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

🦀
News

AI 지원 개발은 스테이크 요리와 같다: 시작은 쉽지만, 마스터하기는 어렵다

개발자의 비유: AI는 코드를 빠르게 생성할 수 있지만, 일관되게 좋은 소프트웨어를 만들기 위해서는 여전히 깊은 이해, 판단력, 경험이 필요합니다.

OpenClawRadar
Google Antigravity 팀 설계: 자율 코드 생성을 위한 하위 에이전트 구조
News

Google Antigravity 팀 설계: 자율 코드 생성을 위한 하위 에이전트 구조

Google Antigravity가 자율 코딩을 위한 하위 에이전트 아키텍처를 공개했습니다: 센티넬(접수 담당)부터 감사관(진위 확인)까지 7가지 전문 에이전트 유형. OpenClaw의 하위 에이전트 설계에 관련됩니다.

OpenClawRadar
클로드 코드 엔지니어 업데이트: 사용자 질문 요청 마크다운, HTTP 훅, 새로운 스킬
News

클로드 코드 엔지니어 업데이트: 사용자 질문 요청 마크다운, HTTP 훅, 새로운 스킬

클로드 코드 엔지니어가 세 가지 업데이트를 발표했습니다: AskUserQuestion 도구가 이제 다이어그램과 코드 예제를 위한 마크다운 스니펫을 지원하고, 새로운 HTTP 훅 핸들러가 훅이 HTTP 엔드포인트에 데이터를 게시할 수 있도록 하며, 두 가지 새로운 스킬이 추가되었습니다.

OpenClawRadar
🦀
News

Claude Code v2.1.274, MCP 타임아웃 수정, 손상된 트랜스크립트 자가 복구, 시작 대기 제어 추가

Claude Code v2.1.274는 첫 비대화형 턴에서 MCP 서버 대기를 제한하는 CLAUDE_CODE_MCP_STARTUP_WAIT_MS를 추가하고, 약 5분 후 타임아웃되는 Streamable HTTP 도구 호출 문제를 수정했으며, 손상된 트랜스크립트가 자동 복구되도록 개선했습니다.

OpenClawRadar