지역 LLM 벤치마크: 함수 호출에 의한 백엔드 생성 – GLM, Qwen, DeepSeek 비교

✍️ OpenClawRadar📅 게시일: May 3, 2026🔗 Source
지역 LLM 벤치마크: 함수 호출에 의한 백엔드 생성 – GLM, Qwen, DeepSeek 비교
Ad

최초의 통제되지 않은 측정 이후 5개월 만에 AutoBe.dev가 함수 호출을 사용한 백엔드 코드 생성을 위한 로컬 및 프론티어 LLM의 적절한 벤치마크를 발표했습니다. 이 벤치마크는 실제 채점 기준표를 사용하여 통제 변수 설정을 적용하며, 함수 호출 도구를 통해 재귀적 유니온 AST 스키마를 생성하는 모델을 테스트합니다.

주요 발견

  • 함수 호출 도구는 백엔드 생성에서 프론티어 모델과 로컬 모델 간의 격차를 효과적으로 좁혔습니다. 특히 gpt-5.4의 DB/API 설계 점수는 qwen3.5-35b-a3b와 거의 동등하며, claude-sonnet-4.6의 논리 점수는 qwen3.5-27b와 일치합니다.
  • 이번이 프론티어 모델을 포함한 마지막 라운드입니다. 매월 실행하는 데 약 200–300M 토큰(모델당 GPT 5.5 가격 기준 약 $1,000–$1,500)이 소요됩니다. 다음 달부터는 OpenRouter에서 $0.25/M 토큰 미만인 엔드포인트 또는 64GB 통합 메모리 노트북에 맞는 모델만 포함됩니다.
  • 프론트엔드 자동화는 6월/7월 라운드에 벤치마크에 추가될 예정이며, AutoBe가 이미 생성하는 SDK를 사용하여 엔드투엔드 AI 구축 프론트엔드(시각적으로는 거칠지만 모든 기능이 작동)를 구동합니다.

예상치 못한 역전

여러 결과가 아직 조사 중입니다:

  • openai/gpt-5.4가 자사의 mini 모델보다 낮은 점수를 기록했습니다.
  • deepseek-v4-proqwen3.5-35b-a3b보다 한 단계 낮으며 자사의 Flash 모델과 거의 차이가 없습니다.
  • Qwen 제품군 내에서 조밀한 27B가 모든 MoE 변종(397B-A17B 포함)을 능가했습니다.

조사 중인 가능한 설명으로는 CoT-준수 현상(대형/프론티어 모델이 도구에서 강제하는 절차적 지침을 건너뛰는 경향)과 벤치마크 결함(참조 프로젝트 4개, 점수 범위 좁음, 도구가 자체 파이프라인을 채점)이 있습니다.

Ad

권장 모델

다음 달을 위한 세 가지 확정 후보:

  • openai/gpt-5.4-nano — $0.25/M 토큰
  • qwen/qwen3.6-27b — $0.195/M 토큰
  • deepseek/deepseek-v4-flash — $0.14/M 토큰

모두 OpenRouter에서 $0.25/M 미만이거나 64GB 통합 메모리 노트북에서 실행 가능하며, 함수 호출을 깔끔하게 처리합니다.

참고 자료

📖 전체 출처 읽기: r/LocalLLaMA

Ad

👀 See Also

다중 에이전트 AI 시스템에서 관계적 거버넌스의 필요성
News

다중 에이전트 AI 시스템에서 관계적 거버넌스의 필요성

현재의 거버넌스 프레임워크는 신원, 권한, 킬 스위치에 초점을 맞추고 있지만, 에이전트 간의 조정 문제는 다루지 못하고 있습니다. 세일즈포스의 연구에 따르면 에이전트 간 상호작용에는 맞춤형 솔루션이 필요하며, 연구 결과 협상에서는 우월함보다 따뜻함이 더 나은 성과를 보여줍니다.

OpenClawRadar
RLVR가 소형 미세 조정 모델에 도움이 될 때: 12개 데이터셋 분석
News

RLVR가 소형 미세 조정 모델에 도움이 될 때: 12개 데이터셋 분석

1.7B 파라미터 모델에 SFT로 파인튜닝한 후 RLVR 강화 학습을 추가하는 실험이 통제된 조건에서 진행되었습니다. 결과는 텍스트 생성 작업이 평균 +2.0%포인트 향상된 반면, 구조화된 작업은 -0.7%포인트 감소했음을 보여줍니다.

OpenClawRadar
🦀
News

Claude AI가 개발자가 잠든 사이 매직 링크 버그에 대한 병합 PR을 열다

Reddit 사용자가 새벽 4시 46분에 Claude AI가 프로덕션 매직링크 버그를 자동으로 수정했다고 보고했습니다 — 트림/소문자 단계가 이메일 검증 정규식 앞으로 이동됨 — 변경 없이 PR 병합됨.

OpenClawRadar
클로드 맥스 $100 구독 API 확장 작업 사용 데이터
News

클로드 맥스 $100 구독 API 확장 작업 사용 데이터

클로드 맥스 $100 구독 사용자가 기존 API에 선호하는 라이브러리 기능을 추가하는 데 5시간 세션의 13%를 소모했다고 보고하며, 컨텍스트 사용률은 11%, 주간 사용률은 5%에서 6%로 증가했습니다.

OpenClawRadar