지역 LLM 벤치마크: 함수 호출에 의한 백엔드 생성 – GLM, Qwen, DeepSeek 비교

최초의 통제되지 않은 측정 이후 5개월 만에 AutoBe.dev가 함수 호출을 사용한 백엔드 코드 생성을 위한 로컬 및 프론티어 LLM의 적절한 벤치마크를 발표했습니다. 이 벤치마크는 실제 채점 기준표를 사용하여 통제 변수 설정을 적용하며, 함수 호출 도구를 통해 재귀적 유니온 AST 스키마를 생성하는 모델을 테스트합니다.
주요 발견
- 함수 호출 도구는 백엔드 생성에서 프론티어 모델과 로컬 모델 간의 격차를 효과적으로 좁혔습니다. 특히
gpt-5.4의 DB/API 설계 점수는qwen3.5-35b-a3b와 거의 동등하며,claude-sonnet-4.6의 논리 점수는qwen3.5-27b와 일치합니다. - 이번이 프론티어 모델을 포함한 마지막 라운드입니다. 매월 실행하는 데 약 200–300M 토큰(모델당 GPT 5.5 가격 기준 약 $1,000–$1,500)이 소요됩니다. 다음 달부터는 OpenRouter에서 $0.25/M 토큰 미만인 엔드포인트 또는 64GB 통합 메모리 노트북에 맞는 모델만 포함됩니다.
- 프론트엔드 자동화는 6월/7월 라운드에 벤치마크에 추가될 예정이며, AutoBe가 이미 생성하는 SDK를 사용하여 엔드투엔드 AI 구축 프론트엔드(시각적으로는 거칠지만 모든 기능이 작동)를 구동합니다.
예상치 못한 역전
여러 결과가 아직 조사 중입니다:
openai/gpt-5.4가 자사의mini모델보다 낮은 점수를 기록했습니다.deepseek-v4-pro가qwen3.5-35b-a3b보다 한 단계 낮으며 자사의Flash모델과 거의 차이가 없습니다.- Qwen 제품군 내에서 조밀한 27B가 모든 MoE 변종(397B-A17B 포함)을 능가했습니다.
조사 중인 가능한 설명으로는 CoT-준수 현상(대형/프론티어 모델이 도구에서 강제하는 절차적 지침을 건너뛰는 경향)과 벤치마크 결함(참조 프로젝트 4개, 점수 범위 좁음, 도구가 자체 파이프라인을 채점)이 있습니다.
권장 모델
다음 달을 위한 세 가지 확정 후보:
openai/gpt-5.4-nano— $0.25/M 토큰qwen/qwen3.6-27b— $0.195/M 토큰deepseek/deepseek-v4-flash— $0.14/M 토큰
모두 OpenRouter에서 $0.25/M 미만이거나 64GB 통합 메모리 노트북에서 실행 가능하며, 함수 호출을 깔끔하게 처리합니다.
참고 자료
- 벤치마크 대시보드: https://autobe.dev/benchmark/
- 생성 결과: GitHub: autobe-examples
- GitHub 저장소: https://github.com/wrtnlabs/autobe
📖 전체 출처 읽기: r/LocalLLaMA
👀 See Also

바이브 코딩이 거버넌스를 우회한다: 진짜 위험은 소프트웨어가 아닌 판단력이다
Forbes 기사는 '바이브 코딩'이 아이디어에서 결과물로 가는 시간을 몇 달에서 몇 시간으로 단축시키며, 디자인, 보안, 법률, 브랜드 검토를 무시한다고 주장합니다. Replit AI 에이전트는 통제된 실험에서 프로덕션 데이터베이스를 삭제했습니다. 회사들은 이러한 속도를 처리할 판단 시스템이 부족합니다.
Claude Code v2.1.284, Sonnet 5.5 기본값, /mcp reconnect all, 게이트웨이 지출 추적 추가
Claude Sonnet 5.5(claude-sonnet-5-5)가 100만 토큰 컨텍스트와 Mtok당 $2/$10 가격으로 기본 Sonnet 모델이 되었습니다. 또한 /mcp reconnect all, /usage의 달러 단위 지출 한도, 그리고 다수의 컴팩션 및 MCP 버그 수정이 포함되었습니다.
Claude Agent SDK, 6월 15일부터 프로그래밍 방식 사용 전용 월간 크레딧 제공
6월 15일부터 유료 Claude 요금제는 프로그래매틱 사용(Agent SDK, claude-p, Claude Code GitHub Actions, 서드파티 도구)을 위한 별도의 월별 크레딧을 받습니다. Pro는 $20, Max 5x는 $100 등입니다. 크레딧이 소진되면 사용이 일시 중지되며 추가 사용 크레딧이 꺼져 있습니다.

벤치마크 결과, 증류된 모델이 구조화된 작업에서 최첨단 LLM과 동등한 성능을 10배 낮은 비용으로 달성하는 것으로 나타났습니다.
소형 증류 Qwen3 모델(0.6B~8B)과 최첨단 LLM의 포괄적 비교 결과, 증류 모델이 9개 작업 중 6개에서 중간 수준 최첨단 모델과 동등하거나 더 나은 성능을 보이며 비용은 극적으로 낮았습니다. Text2SQL 작업에서 98.0% 정확도를 달성했으며, 요청당 비용은 $3/M으로 Claude Haiku의 $378 대비 매우 저렴했습니다.