Qwen3-30B-A3B 대 Qwen3.5-35B-A3B 성능 비교 (RTX 5090 기준)

성능 비교: Qwen3-30B-A3B vs Qwen3.5-35B-A3B
NVIDIA RTX 5090에서 Qwen3-30B-A3B와 새로 출시된 Qwen3.5-35B-A3B를 비교한 상세 벤치마크 결과, 속도와 컨텍스트 처리 사이의 균형이 드러났습니다. 두 모델 모두 30억 개의 활성 파라미터를 가진 동일한 Mixture of Experts 아키텍처를 사용하며, 3.5 버전은 총 파라미터를 50억 개 더 추가하고 비전 프로젝터를 포함합니다.
하드웨어 및 설정
- GPU: NVIDIA RTX 5090 (32 GB VRAM, Blackwell)
- 서버: llama.cpp b8115 (Docker: ghcr.io/ggml-org/llama.cpp:server-cuda)
- 양자화: 두 모델 모두 Q4_K_M
- KV 캐시: Q8_0 (-ctk q8_0 -ctv q8_0)
- 컨텍스트: 32,768 토큰 (-c 32768)
- 파라미터: -ngl 999 -np 4 --flash-attn on -t 12
- 모델 A: Qwen3-30B-A3B-Q4_K_M (디스크 17 GB)
- 모델 B: Qwen3.5-35B-A3B-Q4_K_M (디스크 21 GB)
두 모델 모두 타이밍 측정 전에 테스트 요청으로 워밍업했습니다. 서버 측 타이밍은 벽시계 측정이 아닌 API 응답에서 가져왔습니다.
원시 추론 속도 결과
직접 llama.cpp /v1/chat/completions 테스트 결과:
- 짧은 프롬프트 (8-9 토큰): 30B: 248.2 토큰/초, 3.5: 169.5 토큰/초
- 중간 프롬프트 (73-78 토큰): 30B: 236.1 토큰/초, 3.5: 163.5 토큰/초
- 긴 형식 (800 토큰): 30B: 232.6 토큰/초, 3.5: 116.3 토큰/초
- 코드 생성 (298-400 토큰): 30B: 233.9 토큰/초, 3.5: 161.6 토큰/초
- 추론 (200 토큰): 30B: 234.8 토큰/초, 3.5: 158.2 토큰/초
평균 생성 속도: 30B: 237.1 토큰/초, 3.5: 153.8 토큰/초 (30B가 35% 더 빠름)
프롬프트 처리 평균: 30B: 773.5 토큰/초, 3.5: 518.1 토큰/초
3.5 모델은 긴 출력(800 토큰)에서 흥미로운 성능 저하를 보이며, 116 토큰/초로 떨어지는 반면 짧은 출력에서는 약 160 토큰/초를 유지합니다. 프롬프트 처리는 3.5 모델에서 더 느린데, 이는 더 큰 어휘(248K vs 152K 토큰) 때문입니다.
메모리 사용량
VRAM 사용량: 30B는 유휴 상태에서 27.3 GB, 3.5는 29.0 GB를 사용합니다. 둘 다 RTX 5090에서 편안하게 작동합니다.
응답 품질 관찰
temperature=0.7에서 테스트한 결과 두 모델 모두 유능한 출력을 생성했습니다. 주요 관찰 사항:
- 창의적 글쓰기: 둘 다 견고하며, 3.5가 약간 더 분위기 있는 산문을 보임
- 하이쿠 생성: 둘 다 유효한 5-7-5 구조를 생성
- 코딩 작업: 둘 다 O(1) get/put 연산으로 LRU 캐시를 올바르게 구현
3.5 모델은 긴 컨텍스트를 훨씬 더 잘 처리하며 토큰 스케일링이 평탄한 반면, 30B 모델은 21% 성능 저하를 보입니다. 품질 차이는 미미하며 구조와 형식에서 3.5가 약간 우세합니다.
📖 전체 소스 읽기: r/LocalLLaMA
👀 See Also

Claude Code 사후 분석: 품질 저하를 유발한 세 가지 버그, 현재 수정 완료
Anthropic은 최근 Claude Code 품질 불만을 세 가지 별도 변경 사항으로 추적했습니다. 기본 추론 노력이 낮아졌고, 캐싱 버그가 세션 메모리를 떨어뜨렸으며, 간결성 프롬프트가 코딩 품질을 저하시켰습니다. 4월 20일(v2.1.116) 기준으로 모두 수정되었습니다.

클로드 코드 서브에이전트가 다중 에이전트 시스템에서 스킬을 로드하지 않음
한 개발자가 Claude Code v2.1.91에서 멀티 에이전트 시스템을 구축하던 중 중요한 제한 사항을 발견했습니다: 서브에이전트는 .claude/skills/ 디렉터리에 정의된 스킬에 접근할 수 없지만, 메인 세션은 트리거 키워드, 컨텍스트 내 전체 스킬 내용, 품질 게이트를 완벽하게 따르며 스킬을 로드합니다.

클로드 오푸스 4.6의 실용적 개선 사항: 메모리 업그레이드
클로드 오푸스 4.6은 100만 토큰 컨텍스트로 상당한 업그레이드를 제공하여 복잡한 작업에서의 기억 유지와 성능을 향상시킵니다.

OpenClaw 초기 사용자 보고서: 텔레그램 문제, 에이전트 프로필 하드코딩 및 세션 재설정 문제
OpenClaw를 처음 사용한 사용자의 3일간의 경험에서 몇 가지 실질적인 문제점이 드러났습니다: Telegram 응답이 사라지는 현상, 에이전트 프로필이 소스 코드에서 'messaging'으로 하드코딩된 점, 그리고 세션 재설정 후 Wacli를 사용할 수 없게 되는 문제입니다. 사용자는 Docker에서 마이크로 테스트를 실행하고 Telegram과 Wacli를 연결하며 하트비트를 설정했습니다.