DeepSWE 벤치마크에서 평가된 Qwen 3.6 27B: 2% 점수, 70시간, 평균 출력 토큰 44k

Reddit 사용자가 Qwen 3.6 27B를 DeepSWE 벤치마크에서 테스트하여 2%(반올림 1.79%)를 기록했으며, 이는 20개 중 18위로 Haiku 4.5 및 Minimax M2.7보다 높은 순위입니다. 전체 실행에는 70시간이 소요되었으며, 평균 작업 시간은 32분, 작업당 평균 출력 토큰은 44k로, 27B 모델의 장황한 특성에도 불구하고 대형 모델인 Qwen 3.6 Plus와 놀라울 정도로 비슷합니다.
방법론
- 모델: Qwen 3.6 27B FP8, BF16 KV 캐시, 추론 활성화, 262k 컨텍스트 윈도우, VLLM을 통해 제공
- 하드웨어: RunPod에서 1x RTX6000 Pro Blackwell
- 에이전트 도구: Modal 샌드박스에서 mini-swe
- 작업당 1회 롤아웃(공식 4회 대신)으로 시간 절약; 점수 범위 없음
- 비용은 완료된 작업에 대한 RunPod 시간당 요금으로 계산
- 오케스트레이션: Codex 5.5xhigh가 전체 실행을 모니터링하고 관리
주요 관찰
저자는 점수가 Qwen 3.6 Plus와 의심스러울 정도로 유사하여 아키텍처 차이에 대한 의문을 제기합니다. 로컬 모델이 프론티어 폐쇄형 모델에 점점 더 뒤처지고 있다고 주장합니다. K2.6이 최고의 오픈소스 모델이지만, 대부분은 로컬에서 실행조차 할 수 없습니다. Qwen 3.6 27B는 "가난한 사람의 SOTA" 로컬 옵션으로 자리 잡고 있습니다. 이러한 추세는 프론티어 성능을 달성하려면 대규모 모델이 필요하며, 이는 종종 폐쇄형 소스로 이어져 로컬 추론이 경쟁력 측면에서 불리해짐을 시사합니다.
📖 전체 출처 읽기: r/LocalLLaMA
👀 See Also

클로드 코드 v2.1.178, Tool(param:value) 권한 규칙 추가 및 서브에이전트·인증 문제 수정
Claude Code v2.1.178은 Tool(param:value) 구문을 통한 세부 권한 규칙, 서브에이전트 대화 기록 보기, OAuth 토큰 불일치 및 인증 갱신 캐싱 문제를 해결합니다.

로봇공학의 세 가지 역법칙: AI 사용을 위한 인간 지침
Susam Pal은 인간을 위한 세 가지 역로봇공학 법칙을 제안합니다: AI를 의인화하지 말고, 그 출력을 맹신하지 말며, 전적인 책임을 유지하라는 것입니다. 생성형 AI에 대한 과도한 의존을 경계하는 실용적인 경고입니다.

AI가 나를 멍청하게 만든다: 개발자의 기술 위축 고백
James Pain은 인공지능만을 사용해 코딩한 지 1~2년 후(손으로 직접 작성한 코드 없음) 코딩하는 법을 대부분 잊어버렸다고 고백한다. 그는 다시 직접 코딩하는 법을 스스로 가르치고 있으며, AI 사용이 많아지면 글쓰기와 코딩 능력이 퇴화할 수 있다고 경고한다.

40M 토큰 1시간 내 소모: OpenClaw에서 서브 에이전트가 통제 불능 상태라는 사용자 제보
OpenClaw 사용자가 서브에이전트가 통제 불능 상태가 되어 한 시간 만에 4,000만 개의 토큰을 소진했다고 보고했습니다. OpenRouter와 DeepSeek Flash를 사용 중이었으며, 일일 예산이 소진되기 전에 개입할 수 없었습니다. 비율 제한기와 안전장치를 찾고 있습니다.