Orion: Apple Neural Engine에서 직접 LLM 실행 및 학습을 위한 CoreML 우회 방법

✍️ OpenClawRadar📅 게시일: March 7, 2026🔗 Source
Orion: Apple Neural Engine에서 직접 LLM 실행 및 학습을 위한 CoreML 우회 방법
Ad

LLM 작업을 위한 직접적인 ANE 접근

Orion은 CoreML을 완전히 우회하여 LLM을 Apple Neural Engine(ANE)에서 직접 실행하고 학습시키는 종단 간 Objective-C 시스템을 제공합니다. 이 접근 방식은 개발자에게 ANE에 대한 직접적인 제어권을 부여하는데, 이전에는 CoreML에 의해 블랙박스 스케줄러로 취급되어 직접적인 제어나 학습 능력이 제거되었습니다.

기술적 구현과 제약사항

이 프로젝트는 비공개 ANEClient 및 ANECompiler API를 매핑한 리버스 엔지니어링 작업을 기반으로 합니다. ANE는 개발자가 "하드웨어 임피던스 불일치"라고 부르는 17가지 프로그래밍 제약사항을 제시하는데, 이 중 11가지는 완전히 문서화되지 않았습니다. 주요 제약사항은 다음과 같습니다:

  • concat 연산은 즉각적이고 조용한 컴파일러 실패를 유발합니다
  • BLOBFILE 가중치는 청크 헤더에서 64바이트 오프셋이 필요하며, 그렇지 않으면 조용한 수치 손상이 발생합니다
  • ANE는 내부 상태를 유지하며 프로세스당 약 119회 컴파일 후 조용히 실패하도록 하드코딩되어 있습니다

학습 과제에 대한 해결책

ANE 학습에 대한 이전 시도들은 단일 단계 후 NaN 발산에 부딪혔습니다. Orion은 다음과 같은 방법으로 이 문제를 해결합니다:

  • 지연 컴파일 파이프라인 구축
  • fp16 오버플로우 연쇄를 막기 위한 엄격한 활성화 클램핑 구현 (활성화를 -65504에서 +65504로 클램핑)
  • 119회 컴파일 제한을 우회하기 위해 매 학습 단계 후 exec() 프로세스 재시작 루프 사용
Ad

성능 결과

컴파일러는 27개 연산 그래프 IR을 5개의 최적화 패스를 통해 ANE 네이티브 MIL로 낮춥니다. 현재 성능은 다음과 같습니다:

  • GPT-2 124M 디코딩에서 초당 170개 이상의 토큰
  • 1억 1천만 파라미터 트랜스포머에서 기계적으로 안정적인 다단계 학습 (하드웨어의 "일관성 한계")
  • 1,000단계 이상에서 손실이 12.3에서 6.2로 감소하며 NaN이 전혀 발생하지 않음

현재 한계

ANE는 컴파일 시점에 가중치를 고정시키므로, 모든 학습 업데이트에는 약 4.2초의 재컴파일 패널티가 필요합니다. ANE는 fp16에서 약 19 TFLOPS를 제공하지만, 이를 사용하는 근본적인 제약은 컴퓨팅 능력이 아니라 네이티브 오케스트레이션 계층의 완전한 부재였습니다.

📖 전체 소스 읽기: r/LocalLLaMA

Ad

👀 See Also

agentcontract v0.0.1: AI 코딩 에이전트를 위한 휴대용 JSON 권한 계층
Tools

agentcontract v0.0.1: AI 코딩 에이전트를 위한 휴대용 JSON 권한 계층

agentcontract v0.0.1은 AI 에이전트를 위한 휴대용 JSON 권한 계층을 도입하며, 로컬 브라우저 UI를 통해 도구 호출을 편집, 검증, 드라이런할 수 있습니다.

OpenClawRadar
Opendesk: Claude Code를 통한 AI 데스크톱 제어를 위한 MCP + SOM 알고리즘
Tools

Opendesk: Claude Code를 통한 AI 데스크톱 제어를 위한 MCP + SOM 알고리즘

Opendesk는 커스텀 SOM 알고리즘을 갖춘 MCP 서버로, AI 에이전트가 당신의 데스크톱에 눈과 손을 갖게 해줍니다. Claude Code 또는 모든 에이전트 도구와 통합되어 마우스/키보드 제어, 학습, 재생, 스케줄링이 가능합니다.

OpenClawRadar
Ssemble MCP 서버는 Claude가 YouTube에서 숏폼 비디오를 생성할 수 있도록 합니다
Tools

Ssemble MCP 서버는 Claude가 YouTube에서 숏폼 비디오를 생성할 수 있도록 합니다

Ssemble AI 클리핑을 위한 새로운 MCP 서버는 Claude가 YouTube URL에서 AI 생성 클립, 자막 템플릿, 음악 트랙, 오버레이를 사용하여 TikTok/Reels/Shorts 스타일의 동영상을 만들 수 있게 해줍니다. 설정에는 Claude Desktop에 구성을 추가하거나 호스팅된 엔드포인트를 사용하는 것이 포함됩니다.

OpenClawRadar
Google Research, AI 모델 압축을 위한 TurboQuant 소개
Tools

Google Research, AI 모델 압축을 위한 TurboQuant 소개

Google Research는 정확도 손실 없이 AI 모델 크기를 줄이는 압축 알고리즘 TurboQuant를 소개했습니다. 이는 벡터 양자화에서의 메모리 오버헤드를 해결하고 키-값 캐시 성능을 향상시킵니다.

OpenClawRadar