실제 TypeScript 기능 구현에서 8가지 AI 코딩 모델 비교

✍️ OpenClawRadar📅 게시일: March 15, 2026🔗 Source
실제 TypeScript 기능 구현에서 8가지 AI 코딩 모델 비교
Ad

실제 AI 코딩 모델 비교

한 개발자가 기존 TypeScript 프로젝트에서 동일한 실제 기능을 구현하도록 하여 8개의 AI 코딩 모델을 실질적으로 비교했습니다. 목표는 인위적인 벤치마크를 넘어서 실제 코드베이스에서 모델이 어떻게 작동하는지 확인하는 것이었습니다.

테스트 설정

사용된 프로젝트는 grammY 프레임워크로 구축된 오픈소스 TypeScript 봇인 OpenCode 텔레그램 봇으로, 텔레그램 인터페이스를 통해 Opencode 기능을 제공합니다. 이 봇은 i18n 지원과 기존 테스트 커버리지를 갖추고 있습니다.

작업은 현재 작업 세션의 이름을 변경하는 /rename 명령어를 구현하는 것이었습니다. 이 기능은 모든 애플리케이션 계층에 영향을 미치며 여러 예외 사례를 처리해야 합니다. 원래 구현은 평가를 위한 깨끗한 기준선을 제공하기 위해 되돌려졌습니다.

각 모델은 두 단계로 동일한 프롬프트를 받았습니다: 먼저 계획 모드(코드베이스를 연구하고 구현 계획을 수립), 그 다음 코딩 모드입니다. 모든 테스트는 "사고" 모드와 추론이 활성화된 상태에서 Opencode를 사용하여 수행되었습니다.

테스트된 모델

  • Claude 4.6 Sonnet ($3.00 입력/$15.00 출력 per 1M 토큰)
  • Claude 4.6 Opus ($5.00/$25.00)
  • GLM 5 ($1.00/$3.20)
  • Kimi K2.5 ($0.60/$3.00)
  • MiniMax M2.5 ($0.30/$1.20)
  • GPT 5.3 Codex (high) ($1.75/$14.00)
  • GPT 5.4 (high) ($2.50/$15.00)
  • Gemini 3.1 Pro (high) ($2.00/$12.00)

코딩 지수와 에이전트 지수 데이터는 Artificial Analysis에서 제공되었습니다. 모든 모델은 OpenCode 팀의 제공업체인 OpenCode Zen을 통해 접근되었으며, 이는 도구와의 호환성을 위해 모델을 테스트합니다.

Ad

평가 방법론

네 가지 지표가 사용되었습니다:

  • API 비용 ($) - 하위 에이전트를 포함한 작업 중 모든 API 호출의 총 비용
  • 실행 시간 (mm:ss) - 총 모델 작업 시간
  • 구현 정확성 (0-10) - 요구사항 및 예외 사례와 얼마나 잘 일치하는지
  • 기술적 품질 (0-10) - 솔루션의 엔지니어링 품질

정확성과 품질 점수의 경우, 기존 /rename 구현을 사용하여 명령어 통합, 주요 흐름, 오류 처리, 취소, i18n, 문서화, 아키텍처, 상태 관리, 테스트 및 기술 부채를 포함한 상세 평가 기준을 도출했습니다. 평가는 구조화된 루브릭에 대해 GPT-5.3 Codex에 의해 수행되었으며, 여러 실행에서 ±0.5점 이내의 변동이 나타났습니다.

주요 발견 사항

결과는 GPT-5.4 (high)가 에이전트 지수에서 69점 만점에 57점으로 가장 높은 구현 정확성 점수를 달성한 것으로 나타났습니다. GLM 5는 1M 토큰당 $1.00/$3.20의 비용으로 코딩 지수 53점을 기록하며 강력한 비용 대비 성능 비율을 보였습니다. 이 실험은 중국의 저렴한 오픈소스 모델들이 실제 코딩 작업에서 독점 모델에 접근하고 있음을 보여주었지만, 벤치마크만으로는 전체 상황을 설명하지는 못합니다.

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

Clawdbot이 어떻게 6개의 AI 에이전트를 프로덕션-안정적인 작업 큐로 조율하는가
Tools

Clawdbot이 어떻게 6개의 AI 에이전트를 프로덕션-안정적인 작업 큐로 조율하는가

Clawdbot 팀은 AI 운영 매장을 운영하는 6개의 AI 에이전트(디자인, 코드, 마케팅, 운영)를 조율하기 위한 작업 큐 시스템을 구축했습니다. 이 시스템은 원자적 작업 클레임, 상태 머신, 백오프를 통한 재시도 로직, 작업 체인, 하트비트 추적, 데몬 오케스트레이터 기능을 갖추고 있습니다.

OpenClawRadar
🦀
Tools

OpenClaw 음성: 음성 대 음성 스마트 홈 제어를 위한 DIY 하드웨어

OpenClaw Voice는 Home Assistant Voice PE(59달러)를 전용 하드웨어 음성 인터페이스로 변환하여 1초 이내 음성-음성 변환, 음성 인식 및 OpenClaw 메모리 통합을 제공합니다. OpenAI Realtime을 통한 실제 음성-음성 변환, 맞춤형 웨이크 워드, 장기 실행 작업 피드백을 지원합니다.

OpenClawRadar
개발자가 Claude Code와 잘 어울리는 CLI 도구를 공유합니다
Tools

개발자가 Claude Code와 잘 어울리는 CLI 도구를 공유합니다

한 개발자가 Claude Code 작업을 위해 MCP에서 CLI로 전환했으며, Claude가 셸 스크립트와 문서에 대한 학습 덕분에 CLI 명령어를 효과적으로 처리한다고 밝혔습니다. 그들은 일상적으로 사용하는 구체적인 CLI 도구들을 공유했는데, 여기에는 gh, ripgrep, stripe, supabase, vercel, sentry-cli, neon 등이 포함됩니다.

OpenClawRadar
ClaudeHive: 병렬 Claude 코드 세션 관리를 위한 웹 UI
Tools

ClaudeHive: 병렬 Claude 코드 세션 관리를 위한 웹 UI

ClaudeHive는 병렬 Claude Code 세션을 처리하는 웹 UI로, 사용자가 자리 표시자가 있는 프롬프트 템플릿을 정의하고, 구성 가능한 동시성을 통해 여러 입력에 걸쳐 일괄 실행하며, 모든 결과를 한 곳에서 검토할 수 있도록 합니다. 여기에는 관리자 에이전트가 작업자 에이전트를 생성하고 조정할 수 있는 CLI 도구도 포함됩니다.

OpenClawRadar