Apple Silicon에서의 δ-Mem 테스트: MLX 구현 및 벤치마크

✍️ OpenClawRadar📅 게시일: May 16, 2026🔗 Source
Apple Silicon에서의 δ-Mem 테스트: MLX 구현 및 벤치마크
Ad

한 Reddit 사용자가 δ-mem 연구 논문(arXiv 2605.12357)을 mlx와 OpenClaw 통합을 통해 Apple Silicon용으로 구현했습니다. 이 논문은 컨텍스트나 LoRA 없이 모델의 주의 방향을 개선하며, 테스트에서 20% 더 나은 답변을 보고했습니다. 구현은 mlx와 사용자 정의 어댑터를 통해 Qwen3-4B-Instruct를 사용했습니다.

벤치마크 결과 (정규화된 mlx 테스트, MacMini 64GB에서 Qwen3-4B-Instruct):

  • 합성 논문 스타일: Plain 0.5129, δ-mem 0.5129 (1.00x)
  • LoCoMo-10 미니: Plain 0.0500, δ-mem 0.1833 (3.67x)
  • OpenClaw 재연: Plain 0.5701, δ-mem 0.6667 (1.17x)

지연 시간 비용 (일반 대비):

  • 합성: 1.013x
  • LoCoMo-10 미니: 쿼리 1.33x / 전체 1.50x
  • OpenClaw 재연: 1.30x

주요 링크:

결론:

Ad
  • 합성 프로브는 평평했지만(1.00x), LoCoMo-미니는 강력한 상대적 개선(3.67x)을 보였습니다.
  • OpenClaw 스타일 재연은 실질적인 개선(6/8 → 7/8 프로브 통과, 1.17x)을 보였습니다.
  • 사용자는 Apple Silicon이 CUDA를 효율적으로 실행할 수 없어 결과가 논문 벤치마크보다 낮다고 언급했습니다. 논문 벤치마크(Qwen3-4B-Instruct)는 고정 백본 대비 평균 1.10x, MemoryAgentBench 1.31x, LoCoMo 1.20x를 보였습니다.
  • 사용자는 Qwen3.6:27B와 같은 더 큰 모델용 어댑터를 훈련하기 위해 도움(또는 약 6천 달러 자금)을 구하고 있습니다.

대상: Apple Silicon에서 로컬 LLM 에이전트를 실행하며 δ-mem 가중치 변조를 통해 메모리/컨텍스트 성능을 개선하려는 개발자.

📖 전체 소스 읽기: r/LocalLLaMA

Ad

👀 See Also

Engram: 지식을 실제로 기억하게 만드는 OpenClaw 학습 플러그인
Tools

Engram: 지식을 실제로 기억하게 만드는 OpenClaw 학습 플러그인

Engram은 사전 테스트, 블라인드 채점, FSRS-4.5 간격 반복과 같은 신경과학 기반 기술을 사용하여 AI 에이전트가 작업 속도를 높여도 배운 내용을 기억할 수 있도록 하는 OpenClaw 플러그인입니다.

OpenClawRadar
Vibe Remote: 어디서나 Claude 코드에 접근할 수 있는 모바일 브리지
Tools

Vibe Remote: 어디서나 Claude 코드에 접근할 수 있는 모바일 브리지

Vibe Remote는 휴대폰에서 Claude Code 개발 환경에 원격으로 접근할 수 있는 모바일 앱으로, 사용자가 Tailscale이나 복잡한 VPN 설정 없이도 로컬 설정, Git 기록, 파일 트리를 유지할 수 있게 해줍니다.

OpenClawRadar
리브레토: AI 코딩 에이전트를 위한 결정론적 브라우저 자동화 생성
Tools

리브레토: AI 코딩 에이전트를 위한 결정론적 브라우저 자동화 생성

Libretto는 AI 코딩 에이전트가 런타임 AI 에이전트에서 벗어나 실제 코드로 결정론적 브라우저 자동화 스크립트를 생성할 수 있도록 하는 Skill+CLI 툴킷입니다. 신뢰성을 위해 Playwright UI 자동화와 직접 네트워크/API 요청을 결합하며, 단계별 디버깅과 읽기 전용 모드를 포함합니다.

OpenClawRadar
실제 TypeScript 기능 구현에서 8가지 AI 코딩 모델 비교
Tools

실제 TypeScript 기능 구현에서 8가지 AI 코딩 모델 비교

한 개발자가 오픈소스 TypeScript 텔레그램 봇 프로젝트에서 /rename 명령어 구현을 위해 8개의 AI 코딩 모델을 테스트하여 비용, 실행 시간, 정확성, 기술적 품질을 평가했습니다. GPT-5.4는 구현 정확도에서 가장 높은 점수를 받았으며, GLM 5는 최고의 비용 대비 성능 비율을 제공했습니다.

OpenClawRadar