Mac Studio에서 DeepSeek v4 Flash: 로컬 LLM이 컴파일러 코드의 실제 버그를 발견하다

tsz.dev 컴파일러 프로젝트를 개발 중인 한 개발자는 128GB Mac Studio에서 DeepSeek v4 Flash를 로컬로 실행하여 복잡한 코드베이스에서 실제 버그를 찾아내는 데 성공했다고 보고했습니다. 이는 불과 5개월 전만 해도 클라우드 기반 Claude가 필요했던 작업입니다.
하드웨어 및 설정
- 기기: 128GB Mac Studio
- 모델: DeepSeek v4 Flash
- 래퍼:
pi-ds4— mitsuhiko가 GitHub에 공개한 경량 Python 래퍼
워크플로 상세
사용자는 로컬 모델에게 컴파일러 코드에서 버그를 찾도록 지시했습니다. 모델은 여러 문제점을 보고했고, 사용자는 이를 확인한 결과 유효한 버그(환각이 아님)임을 확인했습니다. 현재 사용자는 Claude와 GPT(유료 계정)를 사용하여 해당 버그를 수정 중입니다. 사용자는 “실제로 유효한 버그가 많이 생성되었다”고 말하며 모델의 결과가 실제로 실행 가능하다고 강조했습니다.
개발자는 2026년 1월 1일에 동일한 하드웨어로 프로젝트를 시작했지만, 당시 로컬 LLM은 오류가 너무 많아 Claude에 의존해야 했습니다. 5개월 만의 개선은 극적이라고 설명합니다. 이제 로컬 추론만으로도 클라우드 구독 없이 어려운 코드베이스에 대해 양질의 결과물을 생성합니다.
시사점
이는 비교적 저렴한 소비자 하드웨어(128GB RAM)에서 실행되는 로컬 LLM(특히 DeepSeek v4 Flash)이 이제 컴파일러 버그 탐지와 같은 전문 작업을 처리할 수 있다는 실제 검증 사례입니다. 개발자는 512GB RAM에서는 성능이 더욱 향상될 것이라고 예상하며, 더 큰 모델이나 더 빠른 추론이 클라우드 API와의 격차를 더욱 좁힐 수 있음을 시사했습니다.
📖 전체 출처 읽기: r/LocalLLaMA
👀 See Also

주의 게이팅: AI 메모리 시스템에서의 선택적 망각 과제
오픈클로우 봇을 위한 5계층 메모리 시스템을 구축 중인 개발자가 핵심 한계를 지적했습니다: 현재 접근법은 회상에 초점을 맞추고 있지만, 집중 작업 중 관련 없는 정보를 억제하는 메커니즘이 부족합니다. 이는 인간의 주의 게이팅과 유사합니다.

oMLX에서 Qwen 모델에 대한 M5 Max 대 M3 Max 추론 벤치마크
oMLX v0.2.23에서 Qwen 3.5 모델을 실행하는 M5 Max와 M3 Max MacBook Pro를 비교한 벤치마크에서, M5 Max가 1.4-1.7배 더 빠른 토큰 생성 속도와 긴 컨텍스트에서 최대 4배 더 빠른 프리필 속도를 보여주었습니다.

추론 가격 분석 결과, 동일 모델에 대해 제공업체 간 4.4배 가격 차이 확인
Llama 3.1 70B Instruct 모델의 추론 가격 분석 결과 제공업체 간 4.4배의 비용 차이가 나타났으며, DeepInfra는 백만 토큰당 $0.20/$0.27, Together는 $0.88/$0.88로 책정되었습니다. 추론 모델의 경우 DeepSeek R1과 OpenAI o1 간에 약 30배의 가격 차이가 관찰되었습니다.

조사: 압축 변경으로 인해 클로드 코드 에이전트가 검증되지 않은 MEMORY.md 콘텐츠를 표면화함
한 사용자가 Claude Code 에이전트가 작업 중간에 MEMORY.md의 내용을 재확인하지 않고 표시하고 있다고 보고했습니다. 이는 버전 2.1.139 및 2.1.141의 압축 변경 사항과 관련이 있습니다. 두 가지 복합 요인: '사용자 지침'의 과도한 보존과 자동 압축 임계값의 버그입니다.