YC 벤치마크, LLM을 스타트업 CEO로 테스트... GLM-5, 높은 비용 효율성 보여

YC-Bench: 장기적 스타트업 시뮬레이션 벤치마크
연구진이 YC-Bench를 개발했는데, 이는 LLM이 1년 동안 수백 번의 의사결정 턴을 거치는 시뮬레이션된 스타트업 환경에서 CEO 역할을 수행하는 벤치마크입니다. 이 시뮬레이션은 직원 관리, 계약 선택, 급여 처리, 그리고 작업 수락 후 약 35%의 고객이 비밀리에 작업 요구사항을 부풀리는 시장을 탐색하는 것을 요구합니다. 피드백은 지연되고 드물게 제공되며, 모델에게는 어떤 도움도 제공되지 않습니다.
벤치마크 결과 및 주요 발견점
이 벤치마크는 각각 3개의 시드로 12개 모델을 테스트했습니다. 리더보드는 다음과 같습니다:
- 🥇 Claude Opus 4.6 - 평균 최종 자금 $127만 달러 (API 비용 실행당 약 $86)
- 🥈 GLM-5 - 평균 최종 자금 $121만 달러 (실행당 약 $7.62)
- 🥉 GPT-5.4 - 평균 최종 자금 $100만 달러 (실행당 약 $23)
- 다른 모든 모델은 시작 자본 $20만 달러 이하의 성능을 보였으며, 여러 모델이 파산했습니다
GLM-5는 중요한 발견점으로 강조되는데, 원시 성능 면에서 Claude Opus와 5% 이내 차이로 근접하면서 실행 비용은 약 11배 더 저렴했습니다. 생산 에이전트 파이프라인에 있어서 이는 상당한 비용 효율성 향상을 의미합니다. Kimi-K2.5는 실제로 API 달러당 수익 차트에서 1위를 차지했으며, 다음 모델보다 2.5배 더 좋은 성능을 보였습니다.
벤치마크가 드러내는 LLM 역량
이 벤치마크는 지연된 피드백 하에서의 장기적 일관성을 드러내는데, 이는 대부분의 평가에서 놓치는 역량입니다. 의사결정 품질을 판단할 즉각적인 피드백이 없을 때, 대부분의 모델은 루프에 빠지거나 최근 수립한 전략을 포기하거나, 이미 문제가 있다고 식별한 고객으로부터 작업을 계속 수락합니다.
성공의 가장 강력한 예측 변수는 모델 크기나 전통적인 벤치마크 점수가 아니라, 모델이 학습된 정보를 기록하기 위해 지속적인 스크래치패드를 적극적으로 사용했는지 여부였습니다. 최상위 성능 모델은 실행당 약 34번 메모를 다시 작성한 반면, 최하위 성능 모델은 평균 0~2개의 항목만 기록했습니다.
자료 및 구현
이 벤치마크는 GitHub에서 코드를 이용할 수 있는 완전한 오픈소스입니다. 논문은 상세한 방법론과 결과를 제공하며, 리더보드는 현재 모델 순위를 보여줍니다. 연구진은 다른 사람들이 자신의 모델을 실행하도록 권장하며, 질의에 답변할 수 있습니다.
📖 Read the full source: r/LocalLLaMA
👀 See Also

미군, 트럼프 금지에도 불구하고 이란 공격에 클로드 AI 사용
도널드 트럼프가 공격 시작 몇 시간 전에 연방 기관들에 클로드 사용 중지를 명령했음에도 불구하고, 미군이 이란에 대한 공격 정보를 얻기 위해 Anthropic의 AI 모델 클로드를 사용한 것으로 알려졌습니다. 토요일 시작된 미-이스라엘 합동 이란 대규모 폭격 작전 중 클로드 사용은 월스트리트저널과 액시오스가 보도했습니다.

OpenAI, 미국 국방부 기밀 네트워크에 AI 모델 배치 예정
OpenAI는 미국 국방부의 기밀 네트워크에 AI 모델을 배포하기로 합의를 체결했으며, 2026년에 구현될 예정입니다. Reuters 기사는 Hacker News에서 15점과 6개의 댓글을 생성했습니다.
Amazon 직원들, 사용 목표 달성을 위해 MeshClaw AI 에이전트로 '토큰맥싱'
아마존 개발자들이 내부 MeshClaw 도구를 이용해 불필요한 작업을 자동화하여 AI 토큰 소비량을 부풀리고 있다. 이는 회사가 80%의 개발자에게 주간 사용 목표를 설정하고 내부 리더보드를 도입한 데 따른 현상이다.

브램 코언이 '바이브 코딩'과 AI 지원 개발 관행을 비판합니다
Bram Cohen은 Claude의 소스 코드 유출을 예로 들며, 개발자들이 AI 어시스턴트를 사용하면서 코드를 보지 않는 '바이브 코딩'이 낮은 소프트웨어 품질로 이어진다고 주장합니다.