DeepSWE 벤치마크에서 평가된 Qwen 3.6 27B: 2% 점수, 70시간, 평균 출력 토큰 44k

Reddit 사용자가 Qwen 3.6 27B를 DeepSWE 벤치마크에서 테스트하여 2%(반올림 1.79%)를 기록했으며, 이는 20개 중 18위로 Haiku 4.5 및 Minimax M2.7보다 높은 순위입니다. 전체 실행에는 70시간이 소요되었으며, 평균 작업 시간은 32분, 작업당 평균 출력 토큰은 44k로, 27B 모델의 장황한 특성에도 불구하고 대형 모델인 Qwen 3.6 Plus와 놀라울 정도로 비슷합니다.
방법론
- 모델: Qwen 3.6 27B FP8, BF16 KV 캐시, 추론 활성화, 262k 컨텍스트 윈도우, VLLM을 통해 제공
- 하드웨어: RunPod에서 1x RTX6000 Pro Blackwell
- 에이전트 도구: Modal 샌드박스에서 mini-swe
- 작업당 1회 롤아웃(공식 4회 대신)으로 시간 절약; 점수 범위 없음
- 비용은 완료된 작업에 대한 RunPod 시간당 요금으로 계산
- 오케스트레이션: Codex 5.5xhigh가 전체 실행을 모니터링하고 관리
주요 관찰
저자는 점수가 Qwen 3.6 Plus와 의심스러울 정도로 유사하여 아키텍처 차이에 대한 의문을 제기합니다. 로컬 모델이 프론티어 폐쇄형 모델에 점점 더 뒤처지고 있다고 주장합니다. K2.6이 최고의 오픈소스 모델이지만, 대부분은 로컬에서 실행조차 할 수 없습니다. Qwen 3.6 27B는 "가난한 사람의 SOTA" 로컬 옵션으로 자리 잡고 있습니다. 이러한 추세는 프론티어 성능을 달성하려면 대규모 모델이 필요하며, 이는 종종 폐쇄형 소스로 이어져 로컬 추론이 경쟁력 측면에서 불리해짐을 시사합니다.
📖 전체 출처 읽기: r/LocalLLaMA
👀 See Also

AI 운영자: 에이전트 워크플로우의 새로운 역할
Rish Gupta는 AI 운영자가 1년 안에 조직에서 핵심 역할이 될 것이라고 주장한다. Python, LLM API, 에이전트 프레임워크 같은 기술 역량과 비즈니스 프로세스 이해를 결합하여 반복적이고 영향력이 큰 작업을 자동화하는 역할이다.
AI的环境成本:到2030年将消耗945太瓦时电力,影响13亿人的用水
UNU 보고서는 2030년 AI의 환경 발자국을 정량화합니다: 945 TWh 전력, 사하라 이남 아프리카의 필요량과 같은 물, 자카르타 면적의 두 배에 달하는 토지.

젠투 버그질라, AI 봇 스크레이퍼 과부하로 중단
젠투 유지보수자 미하우 고르니(Michał Górny)가 AI 봇 스크레이퍼가 서버를 압도하여 버그질라를 오프라인으로 전환했습니다. 전체 업데이트를 읽어보세요.

SDNY 법원, AI 생성 법률 문서는 특권 보호 대상 아니다 판결
제드 S. 라코프 판사는 Anthropic의 Claude AI 도구를 사용해 생성된 31개의 문서가 변호인-의뢰인 특권이나 작업 산물 원칙에 의해 보호받지 않는다고 판결했으며, 이는 AI 생성 법률 자료에 대한 첫 번째 법원 결정으로 기록됐습니다.