Qwen3.5-27B 8비트 대 16비트 성능 비교

r/LocalLLaMA의 한 레딧 사용자가 Qwen3.5-27B의 다양한 정밀도 설정을 비교한 테스트 결과를 공유했습니다.
테스트 설정 및 결과
사용자는 두 가지 구성을 테스트했습니다:
- 원본 bf16 가중치와 16비트 KV 캐시
- Qwen의 fp8 양자화와 8비트 KV 캐시
테스트는 RTX 6000 Pro GPU에서 vLLM을 사용해 실행되었습니다. 사용된 벤치마크는 Aider 벤치마크였습니다. 사용자는 두 구성 사이에 "실질적으로 동일한 결과"를 보고했으며, 각 구성이 한 번만 실행되었기 때문에 작은 차이는 무작위 노이즈로 인한 것이라고 설명했습니다.
결론 및 권장사항
테스트 결과를 바탕으로, 사용자는 "가중치와 캐시 모두에 fp8을 사용해야 한다"고 결론지었습니다. 주목된 주요 이점은 낮은 정밀도로 인해 메모리 사용량이 줄어들어 "사용 가능한 컨텍스트 양이 극적으로 증가할 것"이라는 점입니다.
이러한 양자화 테스트는 메모리 제약으로 인해 컨텍스트 창 크기가 제한되는 경우가 많은 로컬에서 대규모 언어 모델을 실행하는 개발자들에게 관련이 있습니다. fp8과 같은 낮은 정밀도 형식을 사용하면 이러한 예비 결과가 시사하는 바와 같이 성능 저하 없이 더 큰 컨텍스트 창을 활성화할 수 있습니다.
📖 Read the full source: r/LocalLLaMA
👀 See Also
Opus 4.7, 약 500개의 지시사항을 따를 수 있어, 1년 전 약 150개에서 증가
2026년 5월 업데이트된 연구에 따르면, Opus 4.7은 약 500개의 지시를 안정적으로 따를 수 있는 반면, 2025년 7월에는 약 150개였습니다. GPT-5.5는 약 5000개를 처리합니다. 이는 CLAUDE.md 파일 크기에 시사하는 바가 있습니다.

AIME 2026 결과: 오픈 및 클로즈드 모델 모두 90% 이상 점수 획득
AI 모델이 AIME 2026에서 놀라운 90% 이상의 점수를 달성했으며, DeepSeek V3.2가 전체 테스트를 단 bash.09에 실행합니다.

클로드 코드 v2.1.129: 플러그인 URL 플래그, 강제 동기화 출력, 그리고 20개 이상의 수정 사항
URL에서 플러그인 zip을 로드하는 --plugin-url 플래그, Emacs eat을 위한 CLAUDE_CODE_FORCE_SYNC_OUTPUT, /context 토큰 낭비 수정, 캐시 TTL 다운그레이드 수정, OAuth 경쟁 조건 수정 등이 포함됩니다.

Claude Code v2.1.202: 동적 워크플로우 크기, /review 되돌리기, 20개 이상의 수정
/config에서 동적 워크플로우 크기 설정, /review를 단일 패스로 전환, mTLS 핸드셰이크 실패, 음성 받아쓰기 루프, 여러 git 워크트리로 인한 느린 세션 재개 등 다양한 버그 수정.