에이전트 기반 텍스트-투-SQL 작업에서 소형 로컬 및 오픈라우터 모델의 벤치마크 결과

한 개발자가 에이전트 기반 텍스트-투-SQL 작업에 대한 소형 로컬 및 OpenRouter 모델의 벤치마크 결과를 발표했습니다. 이 벤치마크는 "각 제품 하위 카테고리에 대한 주문 라인, 매출, 판매 단위, 단위당 매출(총 매출 ÷ 총 판매 단위), 하위 카테고리별 제품 평균 정가, 총 이익 및 마진 백분율 표시"와 같은 영어 쿼리를 가져와 데이터베이스 테이블에 대해 테스트되는 SQL로 변환합니다.
벤치마크 세부 사항
에이전트는 쿼리 결과를 확인하고 문제를 수정하기 위해 SQL을 수정할 수 있으며, 디버깅 라운드에 제한이 있습니다. 벤치마크는 의도적으로 25개의 질문으로 짧게 구성되어 대부분의 모델에서 5분보다 훨씬 적은 시간에 실행되므로 다양한 구성을 테스트하기에 실용적입니다. 최고의 모델과 다른 모델을 구분할 수 있을 만큼 충분히 어렵게 설계되었습니다.
주요 발견 사항
- 확인된 최고의 오픈 모델은 kimi-k2.5, Qwen 3.5 397B-A17B 및 Qwen 3.5 27B였습니다.
- NVIDIA Nemotron-Cascade-2-30B-A3B는 Qwen 3.5-35B-A3B보다 높은 점수를 기록하며 Codex 5.3과 동등한 성능을 보였습니다.
- Mimo v2 Flash는 "모델의 보석"으로 묘사되었습니다.
자체 호스팅 옵션
이제 벤치마크에는 Llama.cpp의 WASM 버전을 사용하여 자신의 서버에서 직접 실행할 수 있는 기능이 포함되어 있습니다. 개발자는 버전 2에서 변경할 사항에 대한 피드백을 구하고 있으며, 다른 구성으로 다른 사람들이 얻는 점수를 확인하고 싶어합니다.
📖 Read the full source: r/LocalLLaMA
👀 See Also

클로드 코드, 모바일 세션 관리를 위한 원격 제어 기능 추가
Claude Code는 이제 개발자들이 터미널에서 작업을 시작하고, Claude가 로컬 머신에서 실행되는 동안 Claude 앱이나 claude.ai/code를 통해 모바일 기기에서 세션을 계속 제어할 수 있게 합니다.
지가캐털리스트: SaaS에 AI 빌더를 탑재해 사용자 맞춤형 워크플로우 제작 지원
Gigacatalyst를 사용하면 SaaS에 AI 기반 앱 빌더를 임베드할 수 있습니다. 비기술 사용자가 자연어로 워크플로를 설명하면, 시스템이 사용자의 API, 데이터 모델, 디자인 시스템을 활용하여 인증, 테넌트 격리, 버전 관리가 내장된 통제된 앱을 생성합니다.

무료 Claude 세션 최적화 도구: 토큰 예측기, 프롬프트 압축기, 세션 플래너
한 개발자가 Claude의 사용 한계를 관리하는 데 도움이 되는 무료, 가입 불필요 도구를 세 가지 기능과 함께 구축했습니다: 프롬프트 소비량을 미리 확인할 수 있는 토큰 추정기, 필러 문구를 제거하여 프롬프트를 40-60% 줄이는 프롬프트 압축기, 컨텍스트 재로딩을 최소화하기 위해 작업을 그룹화하는 세션 플래너입니다.

AI 에이전트를 활용한 Lisp 개발: 높은 비용과 기술적 과제
한 DevOps 엔지니어가 AI 에이전트가 Lisp 개발에 어려움을 겪으며, 부적절한 코드를 위해 몇 분 만에 10~20달러를 소비하는 반면, Python과 Go는 효율적으로 작동한다는 사실을 발견했습니다. 그는 REPL 상호작용을 개선하기 위해 tmux-repl-mcp를 만들었지만, 여전히 높은 토큰 비용과 도구 문제에 직면했습니다.