에이전트 기반 텍스트-투-SQL 작업에서 소형 로컬 및 오픈라우터 모델의 벤치마크 결과

✍️ OpenClawRadar📅 게시일: April 17, 2026🔗 Source
에이전트 기반 텍스트-투-SQL 작업에서 소형 로컬 및 오픈라우터 모델의 벤치마크 결과
Ad

한 개발자가 에이전트 기반 텍스트-투-SQL 작업에 대한 소형 로컬 및 OpenRouter 모델의 벤치마크 결과를 발표했습니다. 이 벤치마크는 "각 제품 하위 카테고리에 대한 주문 라인, 매출, 판매 단위, 단위당 매출(총 매출 ÷ 총 판매 단위), 하위 카테고리별 제품 평균 정가, 총 이익 및 마진 백분율 표시"와 같은 영어 쿼리를 가져와 데이터베이스 테이블에 대해 테스트되는 SQL로 변환합니다.

벤치마크 세부 사항

에이전트는 쿼리 결과를 확인하고 문제를 수정하기 위해 SQL을 수정할 수 있으며, 디버깅 라운드에 제한이 있습니다. 벤치마크는 의도적으로 25개의 질문으로 짧게 구성되어 대부분의 모델에서 5분보다 훨씬 적은 시간에 실행되므로 다양한 구성을 테스트하기에 실용적입니다. 최고의 모델과 다른 모델을 구분할 수 있을 만큼 충분히 어렵게 설계되었습니다.

주요 발견 사항

  • 확인된 최고의 오픈 모델은 kimi-k2.5, Qwen 3.5 397B-A17B 및 Qwen 3.5 27B였습니다.
  • NVIDIA Nemotron-Cascade-2-30B-A3B는 Qwen 3.5-35B-A3B보다 높은 점수를 기록하며 Codex 5.3과 동등한 성능을 보였습니다.
  • Mimo v2 Flash는 "모델의 보석"으로 묘사되었습니다.

자체 호스팅 옵션

이제 벤치마크에는 Llama.cpp의 WASM 버전을 사용하여 자신의 서버에서 직접 실행할 수 있는 기능이 포함되어 있습니다. 개발자는 버전 2에서 변경할 사항에 대한 피드백을 구하고 있으며, 다른 구성으로 다른 사람들이 얻는 점수를 확인하고 싶어합니다.

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

클로드 코드, 모바일 세션 관리를 위한 원격 제어 기능 추가
Tools

클로드 코드, 모바일 세션 관리를 위한 원격 제어 기능 추가

Claude Code는 이제 개발자들이 터미널에서 작업을 시작하고, Claude가 로컬 머신에서 실행되는 동안 Claude 앱이나 claude.ai/code를 통해 모바일 기기에서 세션을 계속 제어할 수 있게 합니다.

OpenClawRadar
🦀
Tools

지가캐털리스트: SaaS에 AI 빌더를 탑재해 사용자 맞춤형 워크플로우 제작 지원

Gigacatalyst를 사용하면 SaaS에 AI 기반 앱 빌더를 임베드할 수 있습니다. 비기술 사용자가 자연어로 워크플로를 설명하면, 시스템이 사용자의 API, 데이터 모델, 디자인 시스템을 활용하여 인증, 테넌트 격리, 버전 관리가 내장된 통제된 앱을 생성합니다.

OpenClawRadar
무료 Claude 세션 최적화 도구: 토큰 예측기, 프롬프트 압축기, 세션 플래너
Tools

무료 Claude 세션 최적화 도구: 토큰 예측기, 프롬프트 압축기, 세션 플래너

한 개발자가 Claude의 사용 한계를 관리하는 데 도움이 되는 무료, 가입 불필요 도구를 세 가지 기능과 함께 구축했습니다: 프롬프트 소비량을 미리 확인할 수 있는 토큰 추정기, 필러 문구를 제거하여 프롬프트를 40-60% 줄이는 프롬프트 압축기, 컨텍스트 재로딩을 최소화하기 위해 작업을 그룹화하는 세션 플래너입니다.

OpenClawRadar
AI 에이전트를 활용한 Lisp 개발: 높은 비용과 기술적 과제
Tools

AI 에이전트를 활용한 Lisp 개발: 높은 비용과 기술적 과제

한 DevOps 엔지니어가 AI 에이전트가 Lisp 개발에 어려움을 겪으며, 부적절한 코드를 위해 몇 분 만에 10~20달러를 소비하는 반면, Python과 Go는 효율적으로 작동한다는 사실을 발견했습니다. 그는 REPL 상호작용을 개선하기 위해 tmux-repl-mcp를 만들었지만, 여전히 높은 토큰 비용과 도구 문제에 직면했습니다.

OpenClawRadar