Netlify 테스트: 코딩용 AI 모델 11개 중 최고는?
Netlify가 자체 공개한 평가 도구 AXIS를 사용하여 11개 AI 모델에 동일한 코딩 프롬프트를 실행한 실제 비교 결과를 공개했습니다. 테스트는 커피숍 웹사이트, 할 일 앱, AI 레시피 앱과 같은 일반적인 웹 개발 작업을 다루며, 모델 품질과 크레딧 비용에 대한 구체적인 데이터를 제공합니다.
이 비교는 Netlify가 OpenRouter와 파트너십을 맺은 직후에 나온 것입니다. 이 파트너십을 통해 프로젝트에서 AI 게이트웨이를 통해 OpenRouter의 모든 모델을 사용할 수 있습니다. Agent Runners(Netlify에서 프로젝트를 빌드하거나 반복하는 채팅 프롬프트 상자)에 오픈소스 OpenCode 에이전트를 추가하여 Kimi K3, GLM 5.2, DeepSeek V4를 포함한 더 다양한 모델을 사용할 수 있습니다.
테스트 내용
Netlify는 자체 AXIS 프레임워크를 사용하여 세 가지 간단한 사용 사례를 실행했습니다:
- 커피숍 사이트 – 간단한 정적 사이트 및 좌석 예약을 추가하는 후속 작업.
- 할 일 목록 앱 – 처음부터 공유 데이터베이스가 필요하며, 선택적으로 사진 업로드를 추가합니다.
- "무엇을 요리할까" 앱 – 사용자가 재료를 입력하면 사이트가 AI 게이트웨이를 사용하여 레시피를 생성합니다.
기능(디자인 아님)을 기준으로 평가했으며, 다음 사항을 확인했습니다: 필요한 경우 데이터베이스를 사용하는가? Netlify Database를 제대로 사용하는가? 과도한 엔지니어링을 피하는가? 검사를 지속적으로 통과하지 못하는 모델은 Agent Runners에서 제공되지 않습니다.
주요 결과
전체 보고서는 블로그에서 확인할 수 있으며, 각 모델이 생성한 사이트, notable issue에 대한 메모, 크레딧 비용을 보여줍니다. 이 게시물에서는 공식 점수를 공개하지 않았지만, 결과의 큰 차이를 강조합니다. 예를 들어, GPT 5.6 Sol을 기본적으로 낮은 노력으로 실행하여 Opus보다 경제적인 대안을 제공하며 여전히 "꽤 좋은 결과"를 얻을 수 있다고 언급했습니다.
또한 동일한 작업에 대해 모델 간 크레딧 비용이 크게 다르므로, 더 나은 출력을 생성하지 않는 모델에 프리미엄을 지불할 수 있습니다.
시사점
자체 에이전트 기반 프로젝트에 사용할 코딩 모델을 선택하는 경우, 이 데이터가 유용할 수 있습니다. 테스트는 실제 웹 개발 시나리오에 중점을 두며 종종 과대평가되는 오픈소스 모델을 포함합니다. 결과는 주관적이지만(그들이 인정함), 기본 모델을 결정하거나 크레딧을 사용하기 전에 검토할 가치가 있습니다.
참고: 이는 시리즈의 첫 번째 게시물이며, 후속 게시물에서 다른 사용 사례를 다룰 예정입니다.
📖 전체 소스 읽기: HN LLM Tools
👀 See Also

벤치마크 결과: 38가지 실제 업무 워크플로우 작업에서 15개 LLM 평가
한 개발자가 실제 워크플로우에서 38가지 작업을 통해 15개의 클라우드 및 로컬 LLM을 벤치마킹했습니다. 작업에는 CSV 변환, 문자 세기, 모듈러 연산, 형식 준수 등이 포함되었습니다. Claude 3.5 Sonnet과 Opus 모두 100% 점수를 받았지만, Sonnet이 호출당 비용이 3.5배 더 저렴했습니다.

Nexus 데스크톱 앱, TTRPG 캠페인 관리를 위한 MCP 설정 자동화
Claude Desktop의 모든 MCP를 수동으로 편집하는 데 지치셨나요? Nexus는 TTRPG 캠페인 관리를 위해 Archivist, Foundry VTT, Notion, Obsidian, NotebookLM을 설치하고 구성합니다.

2026 Hermes 에이전트 대안 정리: OpenClaw부터 memU Bot까지 자체 호스팅 옵션
ClawHub 보안 사태 이후, Hermes를 런칭부터 운영해 온 개발자가 모든 자체 호스팅 및 관리형 대안을 테스트했습니다. 주요 결과: OpenClaw (370k 스타)는 4일 만에 9건의 CVE와 ~20%의 악성 패키지; TrustClaw는 OAuth/샌드박싱으로 재구축; nanobot은 MCP를 지원하는 약 4천 줄의 Python 코드; memU Bot은 독특한 구조화 메모리 제공. 관리형 옵션으로는 Perplexity Computer (19개 모델, 월 $200), Claude Cowork (실제 Mac 앱 실행), KimiClaw (40GB RAG, K2.5 고정, 중국 데이터 법 적용) 등이 있습니다. 전체 내용은 출처에서 확인하세요.

mistral.rs, Gemma 4 12B 지원 추가: 멀티모달, 에이전틱, MTP
mistral.rs가 멀티모달, 에이전틱, MTP 통합으로 Gemma 4 12B를 지원합니다. 한 줄 설치 후 웹 검색, 코드 실행, 내장 UI로 실행 가능합니다.