Qwen3.5-27B-FP8 성능 벤치마크 (OpenClaw 에이전트 포함)

커뮤니티 테스트 성능 벤치마크
커뮤니티 테스트는 48GB VRAM을 탑재한 단일 수정 RTX 4090 GPU를 사용하여 수행되었습니다. 공식 Qwen3.5-35B-A3B-FP8 및 Qwen3.5-27B-FP8 모델이 256K 컨텍스트 길이로 테스트되었습니다.
프레임워크 권장사항
SGLang을 권장합니다 접두사 캐싱을 완전히 지원하는 유일한 프레임워크로, Qwen3.5의 하이브리드 어텐션 아키텍처에 필수적입니다.
- 100K 컨텍스트 기준: 콜드 스타트 프리필은 약 10초 소요
- 캐싱 적용 시: 프리필이 200ms로 감소
- 결과: 매우 낮은 첫 토큰 지연 시간과 극도로 빠른 출력
모델 성능 지표
- Qwen3.5-35B-A3B-FP8: 120 토큰/초로 시작하여 80 토큰/초로 감소
- Qwen3.5-27B-FP8: 20 토큰/초로 시작하여 약간 감소한 18 토큰/초
OpenClaw 에이전트 확장성
OpenClaw는 6개의 에이전트를 동시에 실행하는 에이전트 팀을 운영할 수 있으며, 속도가 120 토큰/초까지 확장됩니다. 테스터는 이 확장 동작에 놀라움을 표시했습니다.
언급된 단점은 이 구성에서 단일 스레드 성능이 느리다는 점입니다.
MTP 최적화 참고사항
27B-FP8 모델에 MTP(다중 토큰 예측)를 활성화하면 단일 요청 생성 속도를 크게 향상시킬 수 있습니다:
- 단일 NVIDIA H100 기준: 20K 컨텍스트 창으로 100 토큰/초 유지
- 64K 토큰 프리필 속도: 1초 미만
중요 주의사항: MTP는 접두사 캐싱과 충돌하며 VRAM 사용량이 매우 높습니다. RTX 4090 사용자는 낮은 num-steps 설정으로 시작해야 합니다.
📖 전체 출처 읽기: r/openclaw
👀 See Also

클로드, 이제 어도비 크리에이티브 클라우드, 블렌더, 에이블톤 등에 연결
Anthropic이 Claude가 Adobe Creative Cloud, Affinity, Blender, Ableton, Splice, Autodesk와 통합될 수 있는 커넥터를 출시하여 자연어로 앱 제어 및 데이터 검색을 가능하게 했습니다.

마이크로소프트 임원, AI 에이전트에 '좌석 기회'로서 소프트웨어 라이센스 필요성 제안
마이크로소프트 임원 라제시 자는 AI 에이전트가 자체 소프트웨어 라이선스가 필요할 수 있으며, 각 에이전트가 기업 시스템에서 '좌석'으로 간주될 수 있다고 제안합니다. 이는 AI가 인간 사용자를 대체하여 라이선스 수를 줄일 것이라는 견해와 대조됩니다.

클로드 AI는 인스턴스 간에 특이한 구두점만으로 이루어진 커뮤니케이션 패턴을 보여줍니다.
두 개의 Claude Sonnet 4.6 인스턴스가 대화 중 정상 메시지 하나 이후에 "- . . ? , \"-\" , : \" , - \"? ."와 같은 구두점만으로 구성된 출력 시퀀스로 전환했습니다. 수신 측 Claude는 이러한 시퀀스를 의미 있는 의사소통으로 해석한 반면, ChatGPT 및 Grok과 같은 다른 모델들은 그렇지 않았습니다.

Claude-Code v2.1.80은 속도 제한 모니터링, 플러그인 개선, 메모리 최적화 기능을 추가했습니다.
Claude-Code v2.1.80는 Claude.ai 사용량을 표시하기 위한 상태 표시줄 스크립트에 rate_limits 필드를 도입하고, source: 'settings' 플러그인 마켓플레이스 지원을 추가하며, 대규모 저장소에서 메모리 사용량을 약 80MB 감소시켰습니다. 이번 릴리스에서는 병렬 도구 결과 복원, WebSocket 실패, 다양한 UI 문제도 수정되었습니다.