Qwen3-30B-A3B 대 Qwen3.5-35B-A3B 성능 비교 (RTX 5090 기준)

성능 비교: Qwen3-30B-A3B vs Qwen3.5-35B-A3B
NVIDIA RTX 5090에서 Qwen3-30B-A3B와 새로 출시된 Qwen3.5-35B-A3B를 비교한 상세 벤치마크 결과, 속도와 컨텍스트 처리 사이의 균형이 드러났습니다. 두 모델 모두 30억 개의 활성 파라미터를 가진 동일한 Mixture of Experts 아키텍처를 사용하며, 3.5 버전은 총 파라미터를 50억 개 더 추가하고 비전 프로젝터를 포함합니다.
하드웨어 및 설정
- GPU: NVIDIA RTX 5090 (32 GB VRAM, Blackwell)
- 서버: llama.cpp b8115 (Docker: ghcr.io/ggml-org/llama.cpp:server-cuda)
- 양자화: 두 모델 모두 Q4_K_M
- KV 캐시: Q8_0 (-ctk q8_0 -ctv q8_0)
- 컨텍스트: 32,768 토큰 (-c 32768)
- 파라미터: -ngl 999 -np 4 --flash-attn on -t 12
- 모델 A: Qwen3-30B-A3B-Q4_K_M (디스크 17 GB)
- 모델 B: Qwen3.5-35B-A3B-Q4_K_M (디스크 21 GB)
두 모델 모두 타이밍 측정 전에 테스트 요청으로 워밍업했습니다. 서버 측 타이밍은 벽시계 측정이 아닌 API 응답에서 가져왔습니다.
원시 추론 속도 결과
직접 llama.cpp /v1/chat/completions 테스트 결과:
- 짧은 프롬프트 (8-9 토큰): 30B: 248.2 토큰/초, 3.5: 169.5 토큰/초
- 중간 프롬프트 (73-78 토큰): 30B: 236.1 토큰/초, 3.5: 163.5 토큰/초
- 긴 형식 (800 토큰): 30B: 232.6 토큰/초, 3.5: 116.3 토큰/초
- 코드 생성 (298-400 토큰): 30B: 233.9 토큰/초, 3.5: 161.6 토큰/초
- 추론 (200 토큰): 30B: 234.8 토큰/초, 3.5: 158.2 토큰/초
평균 생성 속도: 30B: 237.1 토큰/초, 3.5: 153.8 토큰/초 (30B가 35% 더 빠름)
프롬프트 처리 평균: 30B: 773.5 토큰/초, 3.5: 518.1 토큰/초
3.5 모델은 긴 출력(800 토큰)에서 흥미로운 성능 저하를 보이며, 116 토큰/초로 떨어지는 반면 짧은 출력에서는 약 160 토큰/초를 유지합니다. 프롬프트 처리는 3.5 모델에서 더 느린데, 이는 더 큰 어휘(248K vs 152K 토큰) 때문입니다.
메모리 사용량
VRAM 사용량: 30B는 유휴 상태에서 27.3 GB, 3.5는 29.0 GB를 사용합니다. 둘 다 RTX 5090에서 편안하게 작동합니다.
응답 품질 관찰
temperature=0.7에서 테스트한 결과 두 모델 모두 유능한 출력을 생성했습니다. 주요 관찰 사항:
- 창의적 글쓰기: 둘 다 견고하며, 3.5가 약간 더 분위기 있는 산문을 보임
- 하이쿠 생성: 둘 다 유효한 5-7-5 구조를 생성
- 코딩 작업: 둘 다 O(1) get/put 연산으로 LRU 캐시를 올바르게 구현
3.5 모델은 긴 컨텍스트를 훨씬 더 잘 처리하며 토큰 스케일링이 평탄한 반면, 30B 모델은 21% 성능 저하를 보입니다. 품질 차이는 미미하며 구조와 형식에서 3.5가 약간 우세합니다.
📖 전체 소스 읽기: r/LocalLLaMA
👀 See Also

ThermoQA: 열역학 공학 문제 293개 계산 문제로 LLM 성능을 평가하는 공개 벤치마크
ThermoQA는 3단계에 걸친 293개의 공학 열역학 문제로 구성된 오픈 벤치마크로, LLM의 정확한 수치 계산 능력을 테스트합니다. Claude Opus 4.6이 94.1%의 종합 점수로 선두를 달리고 있으며, DeepSeek-R1은 ±2.5%로 실행 간 변동성이 가장 높습니다.

오픈 클로우 오버나이트 테스트: AI 자동화의 도약
오픈 클로우 밤샘 테스트는 AI 기반 코딩 에이전트의 잠재력을 보여주며, 밤샘 작업을 원활한 자동화로 전환합니다. r/openclaw 커뮤니티의 주요 시사점과 논의를 살펴보세요.

미국 법 집행 기관, AI 반발 속 '안티테크 극단주의'를 새로운 위협 범주로 지정
국토안보부, FBI 및 퓨전 센터가 '반기술 폭력 극단주의'라는 새로운 범주를 감시하고 있습니다. 이는 트럼프 행정부 지시에 따라 인공지능 관련 시위, 데이터 센터 위협 및 반대 의견을 표적으로 삼습니다.

온타리오 감사: AI 기록 시스템의 60%가 약물을 혼동하고, 85%가 정신 건강 세부사항을 놓친다
온타리오주 감사관은 20개의 AI 필기 시스템 중 12개가 잘못된 약물 정보를 삽입하고, 9개가 치료 제안을 조작했으며, 17개가 의사-환자 녹음에서 핵심 정신 건강 세부 사항을 누락했다는 사실을 발견했습니다. 평가는 정확성에 전체 점수의 4%만을 가중치로 부여했습니다.