Qwen3.5-27B-FP8 성능 벤치마크 (OpenClaw 에이전트 포함)

커뮤니티 테스트 성능 벤치마크
커뮤니티 테스트는 48GB VRAM을 탑재한 단일 수정 RTX 4090 GPU를 사용하여 수행되었습니다. 공식 Qwen3.5-35B-A3B-FP8 및 Qwen3.5-27B-FP8 모델이 256K 컨텍스트 길이로 테스트되었습니다.
프레임워크 권장사항
SGLang을 권장합니다 접두사 캐싱을 완전히 지원하는 유일한 프레임워크로, Qwen3.5의 하이브리드 어텐션 아키텍처에 필수적입니다.
- 100K 컨텍스트 기준: 콜드 스타트 프리필은 약 10초 소요
- 캐싱 적용 시: 프리필이 200ms로 감소
- 결과: 매우 낮은 첫 토큰 지연 시간과 극도로 빠른 출력
모델 성능 지표
- Qwen3.5-35B-A3B-FP8: 120 토큰/초로 시작하여 80 토큰/초로 감소
- Qwen3.5-27B-FP8: 20 토큰/초로 시작하여 약간 감소한 18 토큰/초
OpenClaw 에이전트 확장성
OpenClaw는 6개의 에이전트를 동시에 실행하는 에이전트 팀을 운영할 수 있으며, 속도가 120 토큰/초까지 확장됩니다. 테스터는 이 확장 동작에 놀라움을 표시했습니다.
언급된 단점은 이 구성에서 단일 스레드 성능이 느리다는 점입니다.
MTP 최적화 참고사항
27B-FP8 모델에 MTP(다중 토큰 예측)를 활성화하면 단일 요청 생성 속도를 크게 향상시킬 수 있습니다:
- 단일 NVIDIA H100 기준: 20K 컨텍스트 창으로 100 토큰/초 유지
- 64K 토큰 프리필 속도: 1초 미만
중요 주의사항: MTP는 접두사 캐싱과 충돌하며 VRAM 사용량이 매우 높습니다. RTX 4090 사용자는 낮은 num-steps 설정으로 시작해야 합니다.
📖 전체 출처 읽기: r/openclaw
👀 See Also

OpenClaw 2026.6.5: 무료 병렬 검색, 전반적인 안정성 수정
OpenClaw 2026.6.5는 무료, 설정 없는 Parallel Search, 더 안전한 채널 답변, 더 나은 에이전트 실행 복구, 덜 취약한 공급자/모델 설정을 추가합니다.

결정론적 vs 확률론적 코드 생성: Bun의 Vibe-Coded Rust 변환이 경고 신호를 보내는 이유
Noah Hall은 번역기(Python 2to3)와 같은 결정론적 코드 생성과 LLM의 확률론적 출력을 대비하며, Bun의 백만 줄 분량 vibe-coded Rust 변환은 사람의 검토 없이는 안전하지 않다고 주장합니다. 테스트만으로는 충분하지 않습니다.

Claude Code v2.1.191: /rewind, CPU 수정, MCP 신뢰성 개선
Claude Code v2.1.191이 추가한 /rewind로 대화 내역을 복원하고, 스트리밍 CPU 사용량을 37% 줄이며, 에이전트 재생 문제를 수정하고, MCP 재시도 및 오류 처리를 개선합니다.

Claude Code v2.1.154: Opus 4.8, 동적 워크플로우 및 주요 수정 사항
새로운 릴리스에는 높은 노력을 기본값으로 하는 Opus 4.8, 수십에서 수백 개의 에이전트를 조율하는 동적 워크플로, 2배 요금으로 2.5배 속도를 제공하는 고속 모드, 그리고 수많은 버그 수정이 포함되었습니다.