YC 벤치마크, LLM을 스타트업 CEO로 테스트... GLM-5, 높은 비용 효율성 보여

✍️ OpenClawRadar📅 게시일: April 13, 2026🔗 Source
YC 벤치마크, LLM을 스타트업 CEO로 테스트... GLM-5, 높은 비용 효율성 보여
Ad

YC-Bench: 장기적 스타트업 시뮬레이션 벤치마크

연구진이 YC-Bench를 개발했는데, 이는 LLM이 1년 동안 수백 번의 의사결정 턴을 거치는 시뮬레이션된 스타트업 환경에서 CEO 역할을 수행하는 벤치마크입니다. 이 시뮬레이션은 직원 관리, 계약 선택, 급여 처리, 그리고 작업 수락 후 약 35%의 고객이 비밀리에 작업 요구사항을 부풀리는 시장을 탐색하는 것을 요구합니다. 피드백은 지연되고 드물게 제공되며, 모델에게는 어떤 도움도 제공되지 않습니다.

벤치마크 결과 및 주요 발견점

이 벤치마크는 각각 3개의 시드로 12개 모델을 테스트했습니다. 리더보드는 다음과 같습니다:

  • 🥇 Claude Opus 4.6 - 평균 최종 자금 $127만 달러 (API 비용 실행당 약 $86)
  • 🥈 GLM-5 - 평균 최종 자금 $121만 달러 (실행당 약 $7.62)
  • 🥉 GPT-5.4 - 평균 최종 자금 $100만 달러 (실행당 약 $23)
  • 다른 모든 모델은 시작 자본 $20만 달러 이하의 성능을 보였으며, 여러 모델이 파산했습니다

GLM-5는 중요한 발견점으로 강조되는데, 원시 성능 면에서 Claude Opus와 5% 이내 차이로 근접하면서 실행 비용은 약 11배 더 저렴했습니다. 생산 에이전트 파이프라인에 있어서 이는 상당한 비용 효율성 향상을 의미합니다. Kimi-K2.5는 실제로 API 달러당 수익 차트에서 1위를 차지했으며, 다음 모델보다 2.5배 더 좋은 성능을 보였습니다.

Ad

벤치마크가 드러내는 LLM 역량

이 벤치마크는 지연된 피드백 하에서의 장기적 일관성을 드러내는데, 이는 대부분의 평가에서 놓치는 역량입니다. 의사결정 품질을 판단할 즉각적인 피드백이 없을 때, 대부분의 모델은 루프에 빠지거나 최근 수립한 전략을 포기하거나, 이미 문제가 있다고 식별한 고객으로부터 작업을 계속 수락합니다.

성공의 가장 강력한 예측 변수는 모델 크기나 전통적인 벤치마크 점수가 아니라, 모델이 학습된 정보를 기록하기 위해 지속적인 스크래치패드를 적극적으로 사용했는지 여부였습니다. 최상위 성능 모델은 실행당 약 34번 메모를 다시 작성한 반면, 최하위 성능 모델은 평균 0~2개의 항목만 기록했습니다.

자료 및 구현

이 벤치마크는 GitHub에서 코드를 이용할 수 있는 완전한 오픈소스입니다. 논문은 상세한 방법론과 결과를 제공하며, 리더보드는 현재 모델 순위를 보여줍니다. 연구진은 다른 사람들이 자신의 모델을 실행하도록 권장하며, 질의에 답변할 수 있습니다.

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

AI 엔지니어들도 AI로 대체되는 위험에서 자유롭지 않다
News

AI 엔지니어들도 AI로 대체되는 위험에서 자유롭지 않다

메타의 DINO와 같은 기반 모델이 범용화되면서 맞춤형 AI 엔지니어링 역할이 잠식되고 있습니다. 저자는 대부분의 AI 엔지니어링 일자리가 다른 개발자 역할보다 더 빨리 대체될 것이라고 주장합니다.

OpenClawRadar
Kimi K2.6 대 Claude Opus 4.7: Minetest 모드 + Google Sheets 통합을 통한 실용적 코딩 대결
News

Kimi K2.6 대 Claude Opus 4.7: Minetest 모드 + Google Sheets 통합을 통한 실용적 코딩 대결

한 개발자가 Kimi K2.6과 Claude Opus 4.7을 테스트하여 Minetest 현상금 보드 모드를 TypeScript 백엔드와 Google Sheets 로깅으로 구축했습니다. Opus는 두 작업 모두 성공했고, Kimi는 로컬 작업은 통과했지만 통합 작업은 실패했습니다. 비용: Opus 로컬 ~$3.59, 통합 $16.03; Kimi 로컬 $0.39, 통합 $5.03(실패).

OpenClawRadar
🦀
News

Grok 4.5 대 클로드 코드: 달러당 허용된 변경사항이 진정한 벤치마크다

Grok 4.5와 Claude Code(Opus)의 코딩 작업 실무 비교: 벤치마크 헤드라인이 아닌, 달러당 승인된 변경 사항을 기준으로 합니다. Rust 작업에 대한 제3자 테스트 결과, Opus가 다중 파일 기능 구축에서 우위를 보였습니다.

OpenClawRadar
Anthropic이 100만 개의 클로드 대화 분석: 6%가 개인적 조언 요청, 아첨 비율 9%, Opus 4.7에서 개선
News

Anthropic이 100만 개의 클로드 대화 분석: 6%가 개인적 조언 요청, 아첨 비율 9%, Opus 4.7에서 개선

백만 개의 Claude 대화 분석 결과, 6%가 개인 상담을 요청했으며, 관계 상담에서 아첨률(25%)이 가장 높았습니다. Opus 4.7과 Mythos Preview는 합성 훈련 데이터를 사용하여 아첨률을 절반으로 줄였습니다.

OpenClawRadar