로컬 Qwen 3.6 27B를 Codex 검증 공동 에이전트로 벤치마킹하기

r/LocalLLaMA의 한 개발자가 OpenAI의 Codex 옆에서 로컬 Qwen 모델을 검증기이자 도전자로 실행하고 있으며, 이 역할에 가장 적합한 GGUF 양자화 프로파일을 정량화하기 위해 작은 재현 가능한 평가 스위트를 구축했습니다. 워크플로우: Codex는 주요 저장소 작업을 처리하고, 로컬 Qwen은 계획에 도전하며 과잉 빌드, 놓친 하드 지시사항, UI/디자인 문제, 잘못된 가정, 긴 컨텍스트 누락을 확인합니다. 작성자는 각 상호작용을 검토한 후 진행합니다.
평가 스위트 설정
이 스위트는 llama.cpp를 통해 Qwen 3.6 27B GGUF 프로파일을 테스트하며, 다양한 컨텍스트 크기와 KV 캐시 형식(q8, f16)의 Bartowski 및 Unsloth 변형을 포함합니다. 초점은 실제 실패 사례에 맞춰져 있습니다: 놓친 지시사항, 잘못된 도전 행동, 과잉 빌드, UI 판단, 긴 컨텍스트 누락.
주요 발견 사항
- 이 스위트에서 최고 성능 프로파일은
bartowski-128k-f16,bartowski-128k-q8,unsloth-128k-q8였습니다. 세 가지 모두 정확도가 동일했습니다. - q8 KV 캐시는 이 특정 스위트에서 측정 가능한 정확도 손실을 보이지 않았습니다.
- 이 워크플로우에서는 컨텍스트 크기가 f16 대 q8 KV보다 더 중요했습니다. 65k 프로파일은 스위트가 65k 토큰 이상을 필요로 할 때 실패했습니다.
unsloth-128k-f16는 로드되었지만 RTX 5090에서 긴 컨텍스트 케이스에 대해 메모리/처리량 압박을 받았습니다.
실용적 관찰
작성자는 Qwen이 Codex의 조용한 우회, 과잉 빌드, 완료까지의 코딩 지름길을 잡는 데 매우 뛰어나다고 보고합니다. UI 관련 작업의 경우 Qwen이 설계를 주도하고 Codex가 구현합니다. 역할이 바뀝니다: Qwen이 계획에 도전하고, 인간이 각 단계 전에 검토합니다.
리소스
- 프로젝트 페이지: https://robert896r1.github.io/qwen-realworld-accuracy-evals/
- 저장소: https://github.com/robert896r1/qwen-realworld-accuracy-evals
📖 전체 출처 읽기: r/LocalLLaMA
👀 See Also

로컬 AI 이미지 비평 도구, Ollama 비전 모델을 활용한 피드백 제공
한 개발자가 Ollama 비전 모델을 사용해 AI 생성 이미지를 로컬에서 분석하는 무료 데스크톱 애플리케이션을 만들었습니다. 이 도구는 개선 제안과 프롬프트 업그레이드를 포함한 구조화된 피드백 보고서를 제공합니다.

오픈소스 클로드 스킬: 경영 컨설팅 프레임워크 및 사례 연구
MIT 라이선스로 제공되는 무료 Claude 스킬이 경영 컨설팅 업무를 위한 구조화된 참고 자료를 제공합니다. 이 프로젝트는 프레임워크, 산업 맥락, 사례 연구를 포함하며, 도메인별로 구성된 80개 이상의 마크다운 파일로 이루어져 있습니다. 또한 커버리지를 확장하기 위한 기여자를 모집하고 있습니다.

Temporal-MCP: OAuth 지원을 갖춘 LLM을 위한 실시간 시계 인식
Temporal-MCP는 LLM에 실제 시간 인식을 제공하여 잘못된 인사(예: 오후 11시에 "좋은 아침")와 오래된 컨텍스트와 같은 시간 관련 오류 모드를 해결하는 최소한의 MCP 서버입니다. 경과 시간, 날짜 변경 감지, 새 스레드 플래그를 반환하는 두 가지 도구(temporal_tick 및 temporal_peek)를 제공합니다.

Vibeyard, 여러 Claude Code 세션 관리를 위한 칸반 보드 추가
Vibeyard라는 오픈소스 IDE에 칸반 보드가 추가되어 카드에서 직접 Claude Code 에이전트 세션을 실행할 수 있습니다. 에이전트가 작업을 완료하면 카드가 자동으로 Done 열로 이동합니다.