벤치마크 결과: Apple Silicon 대 AMD GPU에서 ROCm 및 Vulkan을 사용한 Qwen3.5 모델 성능 비교

하드웨어 및 소프트웨어 설정
벤치마크는 세 가지 시스템을 비교했습니다: Apple M5 Max(48GB 통합 메모리)가 탑재된 MacBook Pro, Apple M1 Max(64GB 통합 메모리)가 탑재된 Mac Studio, 그리고 Intel Core Ultra 7 265K 프로세서와 세 가지 AMD GPU(Radeon Pro W7900(48GB, RDNA 3), Radeon AI PRO R9700(32GB, RDNA 4), Radeon Pro W6800(32GB, RDNA 2))가 장착된 Fedora 43 GPU 서버입니다. 메인보드는 x8/x8/x4 전기적 연결을 제공했으며, W6800은 DMI 링크로 인해 병목 현상이 발생하는 칩셋 연결 x4 슬롯에 장착되었습니다.
추론 엔진 및 모델
Apple 시스템은 mlx-lm(버전 0.31.1 및 0.31.0)을 사용했습니다. Fedora 서버는 llama.cpp를 HIP/ROCm 빌드(b5065)와 AMDVLK Vulkan 빌드(b5065) 모두로 실행했습니다. ROCm 버전은 7.2, AMDVLK 버전은 2025.Q2.1이었습니다. 모든 Fedora 실행은 단일 GPU를 사용했으며, 122B 모델은 W7900 + R9700을 --split-mode layer로 사용한 경우를 제외했습니다.
테스트된 모델은 Qwen3.5-35B-A3B MoE(3B 활성 매개변수, mlx-community 4비트 또는 unsloth Q4_K_M), Qwen3.5-27B dense(27B 매개변수, mlx-community 4비트 또는 unsloth Q4_K_M), 그리고 Qwen3.5-122B-A10B MoE(10B 활성 매개변수, unsloth Q3_K_XL)였습니다.
벤치마크 방법론
벤치마크는 약물감시 데이터 분석 사용 사례를 반영했습니다: 추출 스크립트 작성, 임상 데이터에 대한 추론, 규제 서사 생성, 임상 텍스트에서의 구조화된 데이터 추출. 프롬프트는 도메인 특화적이었으며, 일반적인 LLM 벤치마크가 아니었습니다.
표준 벤치마크는 8K 컨텍스트와 7개의 프롬프트를 사용했습니다: 2개의 프롬프트 처리 테스트(짧은 ~27 토큰 및 긴 ~2.9K 토큰 입력, 최소 출력으로 프리필 속도 분리)와 5개의 생성 작업(짧은 코딩, 중간 코딩, 수학 추론, 규제 안전 서사 작성, 구조화된 이상반응 추출). 단일 사용자, 단일 요청, 온도 0.3, /no_think으로 사고 모드 비활성화, 요청 간 프롬프트 캐싱 없음.
컨텍스트 스케일링 벤치마크는 동일한 모델과 GPU를 사용하여 점진적으로 더 큰 프롬프트(512에서 16K+ 토큰)를 사용했으며, 합성 이상반응 목록으로 구성되었고, 64 최대 출력 토큰만으로 입력 크기에 따른 프롬프트 처리 및 생성의 확장 방식을 분리했습니다.
주요 발견 사항
벤치마크는 ROCm 대 AMDVLK Vulkan에 대한 흥미로운 결과를 보여주었으며, 각 백엔드가 언제 최고 성능을 발휘하는지 보여주는 컨텍스트 스케일링 테스트를 포함했습니다. 소스는 대부분의 기존 비교가 M5 Max 노트북과 W7900 워크스테이션 같은 구성 간 선택이나 Vulkan 대비 ROCm 설정의 번거로움 가치를 판단하는 데 도움이 되지 않는다고 언급합니다.
📖 Read the full source: r/LocalLLaMA
👀 See Also

오라클, AI 데이터센터 확장 자금 조달 위해 2만~3만 명 인력 감축 및 서너 매각 고려
오라클은 AI 데이터센터 확장을 위해 80억~100억 달러의 현금 흐름을 확보하기 위해 2만~3만 개의 일자리를 줄이고 Cerner 의료 소프트웨어 부문을 매각하는 것을 고려 중입니다. 이는 미국 은행들이 회사의 1,560억 달러 규모의 인프라 구축 자금 조달에서 물러나면서 이루어지고 있습니다.

미니맥스 M2.7 및 10만 개 이상의 오픈클로 인스턴스 확장에 관한 생태계 세션 논의
Jim과 AndyML이 Minimax 팀을 초대하여 Minimax M2.7과 10만 개 이상의 OpenClaw 인스턴스를 지원하기 위해 호스팅 환경을 확장한 방법에 대해 논의했습니다. 이 세션은 Discord에서 100-110명의 사용자와 중국어 동시 중계에서 35만 명 이상의 시청자를 끌어모았습니다.

Netlify CTO Dana Lawson: 코드 작성은 더 이상 업무가 아니다
Netlify의 CTO Dana Lawson은 개발자의 업무가 코드 작성에서 AI 에이전트 조율로 변화한다고 주장합니다. 엔지니어는 경험 디자이너가 되어 에이전트의 결과물을 큐레이션하고 시스템 경계를 관리합니다.
Opus 4.7, 약 500개의 지시사항을 따를 수 있어, 1년 전 약 150개에서 증가
2026년 5월 업데이트된 연구에 따르면, Opus 4.7은 약 500개의 지시를 안정적으로 따를 수 있는 반면, 2025년 7월에는 약 150개였습니다. GPT-5.5는 약 5000개를 처리합니다. 이는 CLAUDE.md 파일 크기에 시사하는 바가 있습니다.