RTX 4090에서 2K부터 400K 컨텍스트까지 Qwen3.5 모델의 벤치마크 결과

RTX 4090에서의 Qwen3.5 성능 테스트
한 개발자가 RTX 4090 GPU에서 실행되는 Qwen3.5 모델의 벤치마크 결과를 공유했으며, 2,048에서 400,000 토큰까지의 컨텍스트 창을 테스트했습니다. 테스트는 원래 262k 컨텍스트를 위해 계획되었지만 yarn 및 기타 방법을 사용하여 400k까지 확장되었습니다.
테스트된 모델
다음 Qwen3.5 모델 변형이 벤치마크되었습니다:
- Qwen3.5-0.8B-Q4_K_M
- Qwen3.5-0.8B-bf16
- Qwen3.5-2B-Q4_K_M
- Qwen3.5-2B-bf16
- Qwen3.5-4B-Q4_K_M
- Qwen3.5-4B-bf16
- Qwen3.5-9B-Q4_K_M
- Qwen3.5-9B-bf16
- Qwen3.5-27B-Q4_K_M
- Qwen3.5-35B-A3B-Q4_K_M
테스트된 컨텍스트 창
모델은 다음과 같은 특정 컨텍스트 길이에서 평가되었습니다: 2048, 4096, 8192, 32768, 65536, 98304, 131072, 196608, 262144, 327680, 360448, 393216, 그리고 400000 토큰.
테스트 방법론
벤치마크 스크립트는 8비트 및 4비트 KV 캐시를 사용한 NGL 설정으로 가능한 최고의 토큰/초 속도를 달성하도록 구성되었습니다. 개발자는 초기 첫 토큰까지의 시간(TTFT)이 길게 나타나지만, Warm TTFT Avg (s) 열은 KV 캐시가 로드된 후 더 나은 성능을 보여준다고 언급했습니다. 컨텍스트는 의도적으로 첫 상호작용에서 완전히 로드되었습니다.
컨텍스트 능력을 테스트하기 위해, 모델에 로그를 요약하는 1문장 프롬프트가 주어졌고, 그 뒤에 2k에서 400k 토큰의 로그 데이터가 이어졌습니다. 개발자는 일부 불일치를 보고했지만 전반적으로 만족스러운 성능이라고 언급했습니다.
현재 상태 및 다음 단계
세 모델이 테스트 중 실패하여 KV 오프로드 테스트를 진행 중입니다: Qwen3.5-4B-bf16, Qwen3.5-27B-Q4_K_M, 그리고 Qwen3.5-35B-A3B-Q4_K_M. 개발자는 스크립트 문제로 24시간의 런타임이 낭비된 후 이러한 테스트를 재시작해야 했습니다.
VRAM 오프로딩 테스트가 완료되면, 개발자는 기초 모델과 결과를 비교할 계획이며 분석을 위해 출력을 저장했습니다. 개발자는 특히 9B 및 27B 밀집 모델의 성능에 놀라움을 표했습니다.
개발자는 어떤 모델과 비교할지, 그리고 평가를 위한 어떤 등급 방법론을 사용할지에 대한 커뮤니티의 의견을 구하고 있습니다.
📖 전체 출처 읽기: r/openclaw
👀 See Also
남성, 법원 서류에 프롬프트 인젝션 시도…판사 "위험하다" 판단
코네티컷 판사가 법원 서류에 프롬프트 인젝션 텍스트를 숨긴 남성에게 제재를 가했습니다. 미국 법원에서 처음으로 알려진 사례로, '위험한' 선례를 남겼습니다.

Anthropic, Claude AI 에이전트 관련 코드 유출에 대응하다
Anthropic이 Claude AI 에이전트와 관련된 코드 유출을 막기 위해 노력하고 있으며, WSJ 보고서에 따르면 Hacker News에서 13점과 6개의 댓글을 받으며 논의되었습니다.

클로드 코드 사용자들이 예상보다 빨리 사용 한도에 도달하고 있어, 버그가 의심됩니다
Anthropic은 Claude Code 사용자들이 예상보다 훨씬 빠르게 할당량을 소진하고 있다고 인정했으며, 사용자들은 몇 시간 만에 한도를 모두 사용했다고 보고했습니다. 프롬프트 캐싱의 의심되는 버그로 인해 비용이 10~20배까지 증가할 수 있으며, 버전 2.1.34로 다운그레이드하면 도움이 된다고 알려졌습니다.

AI水印在文本中始终容易被移除
EU AI 법은 2026년까지 텍스트 워터마크를 요구하지만, 그것은 항상 제거 가능할 것입니다. 그 이유와 SynthID의 작동 방식입니다.