Qwen3-30B-A3B 대 Qwen3.5-35B-A3B 성능 비교 (RTX 5090 기준)

✍️ OpenClawRadar📅 게시일: February 25, 2026🔗 Source
Qwen3-30B-A3B 대 Qwen3.5-35B-A3B 성능 비교 (RTX 5090 기준)
Ad

성능 비교: Qwen3-30B-A3B vs Qwen3.5-35B-A3B

NVIDIA RTX 5090에서 Qwen3-30B-A3B와 새로 출시된 Qwen3.5-35B-A3B를 비교한 상세 벤치마크 결과, 속도와 컨텍스트 처리 사이의 균형이 드러났습니다. 두 모델 모두 30억 개의 활성 파라미터를 가진 동일한 Mixture of Experts 아키텍처를 사용하며, 3.5 버전은 총 파라미터를 50억 개 더 추가하고 비전 프로젝터를 포함합니다.

하드웨어 및 설정

  • GPU: NVIDIA RTX 5090 (32 GB VRAM, Blackwell)
  • 서버: llama.cpp b8115 (Docker: ghcr.io/ggml-org/llama.cpp:server-cuda)
  • 양자화: 두 모델 모두 Q4_K_M
  • KV 캐시: Q8_0 (-ctk q8_0 -ctv q8_0)
  • 컨텍스트: 32,768 토큰 (-c 32768)
  • 파라미터: -ngl 999 -np 4 --flash-attn on -t 12
  • 모델 A: Qwen3-30B-A3B-Q4_K_M (디스크 17 GB)
  • 모델 B: Qwen3.5-35B-A3B-Q4_K_M (디스크 21 GB)

두 모델 모두 타이밍 측정 전에 테스트 요청으로 워밍업했습니다. 서버 측 타이밍은 벽시계 측정이 아닌 API 응답에서 가져왔습니다.

Ad

원시 추론 속도 결과

직접 llama.cpp /v1/chat/completions 테스트 결과:

  • 짧은 프롬프트 (8-9 토큰): 30B: 248.2 토큰/초, 3.5: 169.5 토큰/초
  • 중간 프롬프트 (73-78 토큰): 30B: 236.1 토큰/초, 3.5: 163.5 토큰/초
  • 긴 형식 (800 토큰): 30B: 232.6 토큰/초, 3.5: 116.3 토큰/초
  • 코드 생성 (298-400 토큰): 30B: 233.9 토큰/초, 3.5: 161.6 토큰/초
  • 추론 (200 토큰): 30B: 234.8 토큰/초, 3.5: 158.2 토큰/초

평균 생성 속도: 30B: 237.1 토큰/초, 3.5: 153.8 토큰/초 (30B가 35% 더 빠름)

프롬프트 처리 평균: 30B: 773.5 토큰/초, 3.5: 518.1 토큰/초

3.5 모델은 긴 출력(800 토큰)에서 흥미로운 성능 저하를 보이며, 116 토큰/초로 떨어지는 반면 짧은 출력에서는 약 160 토큰/초를 유지합니다. 프롬프트 처리는 3.5 모델에서 더 느린데, 이는 더 큰 어휘(248K vs 152K 토큰) 때문입니다.

메모리 사용량

VRAM 사용량: 30B는 유휴 상태에서 27.3 GB, 3.5는 29.0 GB를 사용합니다. 둘 다 RTX 5090에서 편안하게 작동합니다.

응답 품질 관찰

temperature=0.7에서 테스트한 결과 두 모델 모두 유능한 출력을 생성했습니다. 주요 관찰 사항:

  • 창의적 글쓰기: 둘 다 견고하며, 3.5가 약간 더 분위기 있는 산문을 보임
  • 하이쿠 생성: 둘 다 유효한 5-7-5 구조를 생성
  • 코딩 작업: 둘 다 O(1) get/put 연산으로 LRU 캐시를 올바르게 구현

3.5 모델은 긴 컨텍스트를 훨씬 더 잘 처리하며 토큰 스케일링이 평탄한 반면, 30B 모델은 21% 성능 저하를 보입니다. 품질 차이는 미미하며 구조와 형식에서 3.5가 약간 우세합니다.

📖 전체 소스 읽기: r/LocalLLaMA

Ad

👀 See Also

Claude Code 사후 분석: 품질 저하를 유발한 세 가지 버그, 현재 수정 완료
News

Claude Code 사후 분석: 품질 저하를 유발한 세 가지 버그, 현재 수정 완료

Anthropic은 최근 Claude Code 품질 불만을 세 가지 별도 변경 사항으로 추적했습니다. 기본 추론 노력이 낮아졌고, 캐싱 버그가 세션 메모리를 떨어뜨렸으며, 간결성 프롬프트가 코딩 품질을 저하시켰습니다. 4월 20일(v2.1.116) 기준으로 모두 수정되었습니다.

OpenClawRadar
클로드 코드 서브에이전트가 다중 에이전트 시스템에서 스킬을 로드하지 않음
News

클로드 코드 서브에이전트가 다중 에이전트 시스템에서 스킬을 로드하지 않음

한 개발자가 Claude Code v2.1.91에서 멀티 에이전트 시스템을 구축하던 중 중요한 제한 사항을 발견했습니다: 서브에이전트는 .claude/skills/ 디렉터리에 정의된 스킬에 접근할 수 없지만, 메인 세션은 트리거 키워드, 컨텍스트 내 전체 스킬 내용, 품질 게이트를 완벽하게 따르며 스킬을 로드합니다.

OpenClawRadar
클로드 오푸스 4.6의 실용적 개선 사항: 메모리 업그레이드
News

클로드 오푸스 4.6의 실용적 개선 사항: 메모리 업그레이드

클로드 오푸스 4.6은 100만 토큰 컨텍스트로 상당한 업그레이드를 제공하여 복잡한 작업에서의 기억 유지와 성능을 향상시킵니다.

OpenClawRadar
OpenClaw 초기 사용자 보고서: 텔레그램 문제, 에이전트 프로필 하드코딩 및 세션 재설정 문제
News

OpenClaw 초기 사용자 보고서: 텔레그램 문제, 에이전트 프로필 하드코딩 및 세션 재설정 문제

OpenClaw를 처음 사용한 사용자의 3일간의 경험에서 몇 가지 실질적인 문제점이 드러났습니다: Telegram 응답이 사라지는 현상, 에이전트 프로필이 소스 코드에서 'messaging'으로 하드코딩된 점, 그리고 세션 재설정 후 Wacli를 사용할 수 없게 되는 문제입니다. 사용자는 Docker에서 마이크로 테스트를 실행하고 Telegram과 Wacli를 연결하며 하트비트를 설정했습니다.

OpenClawRadar