Netlify 테스트: 코딩용 AI 모델 11개 중 최고는?

✍️ OpenClawRadar📅 게시일: August 14, 2026🔗 Source
Ad

Netlify가 자체 공개한 평가 도구 AXIS를 사용하여 11개 AI 모델에 동일한 코딩 프롬프트를 실행한 실제 비교 결과를 공개했습니다. 테스트는 커피숍 웹사이트, 할 일 앱, AI 레시피 앱과 같은 일반적인 웹 개발 작업을 다루며, 모델 품질과 크레딧 비용에 대한 구체적인 데이터를 제공합니다.

이 비교는 Netlify가 OpenRouter와 파트너십을 맺은 직후에 나온 것입니다. 이 파트너십을 통해 프로젝트에서 AI 게이트웨이를 통해 OpenRouter의 모든 모델을 사용할 수 있습니다. Agent Runners(Netlify에서 프로젝트를 빌드하거나 반복하는 채팅 프롬프트 상자)에 오픈소스 OpenCode 에이전트를 추가하여 Kimi K3, GLM 5.2, DeepSeek V4를 포함한 더 다양한 모델을 사용할 수 있습니다.

테스트 내용

Netlify는 자체 AXIS 프레임워크를 사용하여 세 가지 간단한 사용 사례를 실행했습니다:

  • 커피숍 사이트 – 간단한 정적 사이트 및 좌석 예약을 추가하는 후속 작업.
  • 할 일 목록 앱 – 처음부터 공유 데이터베이스가 필요하며, 선택적으로 사진 업로드를 추가합니다.
  • "무엇을 요리할까" 앱 – 사용자가 재료를 입력하면 사이트가 AI 게이트웨이를 사용하여 레시피를 생성합니다.

기능(디자인 아님)을 기준으로 평가했으며, 다음 사항을 확인했습니다: 필요한 경우 데이터베이스를 사용하는가? Netlify Database를 제대로 사용하는가? 과도한 엔지니어링을 피하는가? 검사를 지속적으로 통과하지 못하는 모델은 Agent Runners에서 제공되지 않습니다.

Ad

주요 결과

전체 보고서는 블로그에서 확인할 수 있으며, 각 모델이 생성한 사이트, notable issue에 대한 메모, 크레딧 비용을 보여줍니다. 이 게시물에서는 공식 점수를 공개하지 않았지만, 결과의 큰 차이를 강조합니다. 예를 들어, GPT 5.6 Sol을 기본적으로 낮은 노력으로 실행하여 Opus보다 경제적인 대안을 제공하며 여전히 "꽤 좋은 결과"를 얻을 수 있다고 언급했습니다.

또한 동일한 작업에 대해 모델 간 크레딧 비용이 크게 다르므로, 더 나은 출력을 생성하지 않는 모델에 프리미엄을 지불할 수 있습니다.

시사점

자체 에이전트 기반 프로젝트에 사용할 코딩 모델을 선택하는 경우, 이 데이터가 유용할 수 있습니다. 테스트는 실제 웹 개발 시나리오에 중점을 두며 종종 과대평가되는 오픈소스 모델을 포함합니다. 결과는 주관적이지만(그들이 인정함), 기본 모델을 결정하거나 크레딧을 사용하기 전에 검토할 가치가 있습니다.

참고: 이는 시리즈의 첫 번째 게시물이며, 후속 게시물에서 다른 사용 사례를 다룰 예정입니다.

📖 전체 소스 읽기: HN LLM Tools

Ad

👀 See Also

Teenyapp으로 Claude Design Artifacts를 라이브 웹사이트에 배포하기
Tools

Teenyapp으로 Claude Design Artifacts를 라이브 웹사이트에 배포하기

Teenyapp은 에이전트 토큰 링크를 통해 Claude Design이 채팅에서 바로 사용할 수 있는 호스팅 서비스를 제공하여, 백엔드 지원을 받는 아티팩트를 자율적으로 배포할 수 있게 합니다.

OpenClawRadar
OneTool MCP 소개: 개발자를 위한 오픈소스 멀티툴
Tools

OneTool MCP 소개: 개발자를 위한 오픈소스 멀티툴

OneTool MCP는 Claude AI를 사용하여 구축되었으며, 웹 검색, 라이브러리 업데이트, 파일 관리와 같은 작업을 위한 100개 이상의 도구를 개발자에게 제공합니다. 도구 사용에 따른 부담이나 컨텍스트 손실 없이 이용할 수 있습니다.

OpenClawRadar
NLA가 Gemma 3의 내부 활성화를 모든 토큰에 대해 읽을 수 있는 텍스트로 변환
Tools

NLA가 Gemma 3의 내부 활성화를 모든 토큰에 대해 읽을 수 있는 텍스트로 변환

Anthropic이 모델의 내부 상태를 텍스트로 디코딩하는 NLA(Natural Language Autoencoders)를 발표했습니다. Gemma 3와 함께, Auto Verbalizer는 생성된 모든 토큰에 대해 모델이 "생각"한 내용을 설명합니다. 가중치는 Hugging Face에, 데모는 Neuronpedia에 있습니다.

OpenClawRadar
APEX 테스트 벤치마크 결과: 실제 코딩 작업에서의 Qwen 3.5 성능
Tools

APEX 테스트 벤치마크 결과: 실제 코딩 작업에서의 Qwen 3.5 성능

APEX 테스트 벤치마크 결과는 Qwen 3.5 모델들의 70개 실제 GitHub 코딩 작업 성능을 보여주며, 397B 버전은 마스터 수준 작업에서 1194 ELO로 떨어지는 반면 GLM-4.7 양자화 버전이 1572 ELO로 로컬 모델 중 선두를 달리고 있습니다.

OpenClawRadar