Gemma-4 26B-A4B가 Opencode와 함께 M5 MacBook Air에서 효율적으로 실행됩니다

한 개발자가 32GB M5 맥북 에어에서 Opencode와 함께 Gemma-4-26B-A4B를 테스트한 결과, 로컬 AI 코딩 작업에 실용적인 성능을 제공한다는 사실을 발견했습니다.
성능 벤치마크
테스트된 특정 구성은 32GB M5 맥북 에어에서 실행되는 gemma-4-26B-A4B-it-UD-IQ4_XS였습니다. 저전력 모드에서 다음과 같은 성능을 달성했습니다:
- 300 토큰/초 프롬프트 처리
- 12 토큰/초 생성
- 8W 전력 소비
- 작동 중 발열이나 팬 소음 없음
M5 맥북 에어는 이전 하드웨어 대비 상당한 개선을 보여주었습니다:
- M1 Max 64GB 대비 약 25% 더 빠른 프롬프트 처리(심지어 Max가 절전 모드가 아닐 때도)
- Opencode 실행 시 M1 Max의 약 2시간 대비 약 6시간 배터리 수명
- 이는 더 작은 배터리(53.8Wh 대 M1 Max의 70Wh)에도 불구하고 달성된 결과입니다
실용적인 사용 사례
해당 개발자는 이 설정이 노트북에서 에이전트 코딩 동작에 "실제로 사용 가능하다"고 평가했습니다. 이전에는 M1 Max 64GB에서 LLM을 실행하는 것이 "만지작거리고 장난감 용도로 사용하는 것"에 국한되었으며, 더 긴 컨텍스트 작업을 효과적으로 처리할 수 없었습니다. 단순한 Python 스네이크 게임을 만들 수는 있었지만, 에이전트 코딩이나 더 큰 코드베이스에 기여하는 것은 "약간 엉성했다"고 합니다.
M5의 성능은 커피숍이나 기차 통근과 같이 인터넷 연결이 불안정할 수 있는 모바일 사용 사례에 실용적으로 만듭니다.
다른 모델과의 비교
해당 개발자는 Opencode와 함께하는 Gemma-4-26B를 폐쇄형 대안과 비교했습니다:
- 테스트 결과 Claude Code나 Antigravity를 대체하지는 않습니다
- Gemma-4는 "현재의 폐쇄형 최첨단 모델보다 훨씬 더 많은 손길이 필요합니다"
- 응답은 Claude Code나 Antigravity가 적용된 Gemini-3.1-Pro에 비해 "다소 건조하다"고 설명됩니다
- 그러나 Gemini-2.5-Pro 할당량을 소진하고 Gemini-2.5-Flash를 강제로 사용해야 하는 상황보다는 Gemma-4-26B를 선호할 것이라고 합니다
해당 개발자는 이는 상당한 진전을 나타낸다고 언급하며, "이러한 종류의 에이전트 코딩은 2024년 말에는 최첨단 모델로도 최첨단이었거나 실제로 가능하지 않았다"고 말합니다.
📖 Read the full source: r/LocalLLaMA
👀 See Also

Nexus 데스크톱 앱, TTRPG 캠페인 관리를 위한 MCP 설정 자동화
Claude Desktop의 모든 MCP를 수동으로 편집하는 데 지치셨나요? Nexus는 TTRPG 캠페인 관리를 위해 Archivist, Foundry VTT, Notion, Obsidian, NotebookLM을 설치하고 구성합니다.

Graft: Claude Code 후크가 grep 토큰을 42% 줄이다
Graft는 코딩 에이전트를 위한 영구 지식 그래프를 구축하여 도구 호출을 46%, 토큰을 42% 줄이고 SWE-bench 정확도를 54%에서 66%로 향상시킵니다.

클로드 코드, 엔비디아 NIM 게이트웨이를 통해 네모트론-3 120B 등 240개 이상 모델 지원
Claude Code는 /model 명령어로 세션 중간에 240개 이상의 NVIDIA NIM 모델로 전환할 수 있습니다. Nemotron-3 Super 120B 생각 모드 변형은 다중 파일 리팩토링 및 에이전트 작업에서 강력한 결과를 보여줍니다.

커서의 AI 에이전트를 위한 빠른 정규식 검색 접근법
Cursor는 대규모 모노레포에서 ripgrep이 15초 이상 걸릴 수 있는 성능 문제를 해결하기 위해 색인화된 정규식 검색을 개발 중입니다. 이는 Zobel, Moffat 및 Sacks-Davis의 1993년 연구를 기반으로 한 n-gram을 사용한 역색인을 활용합니다.