에이전트 기반 텍스트-투-SQL 작업에서 소형 로컬 및 오픈라우터 모델의 벤치마크 결과

✍️ OpenClawRadar📅 게시일: April 17, 2026🔗 Source
에이전트 기반 텍스트-투-SQL 작업에서 소형 로컬 및 오픈라우터 모델의 벤치마크 결과
Ad

한 개발자가 에이전트 기반 텍스트-투-SQL 작업에 대한 소형 로컬 및 OpenRouter 모델의 벤치마크 결과를 발표했습니다. 이 벤치마크는 "각 제품 하위 카테고리에 대한 주문 라인, 매출, 판매 단위, 단위당 매출(총 매출 ÷ 총 판매 단위), 하위 카테고리별 제품 평균 정가, 총 이익 및 마진 백분율 표시"와 같은 영어 쿼리를 가져와 데이터베이스 테이블에 대해 테스트되는 SQL로 변환합니다.

벤치마크 세부 사항

에이전트는 쿼리 결과를 확인하고 문제를 수정하기 위해 SQL을 수정할 수 있으며, 디버깅 라운드에 제한이 있습니다. 벤치마크는 의도적으로 25개의 질문으로 짧게 구성되어 대부분의 모델에서 5분보다 훨씬 적은 시간에 실행되므로 다양한 구성을 테스트하기에 실용적입니다. 최고의 모델과 다른 모델을 구분할 수 있을 만큼 충분히 어렵게 설계되었습니다.

주요 발견 사항

  • 확인된 최고의 오픈 모델은 kimi-k2.5, Qwen 3.5 397B-A17B 및 Qwen 3.5 27B였습니다.
  • NVIDIA Nemotron-Cascade-2-30B-A3B는 Qwen 3.5-35B-A3B보다 높은 점수를 기록하며 Codex 5.3과 동등한 성능을 보였습니다.
  • Mimo v2 Flash는 "모델의 보석"으로 묘사되었습니다.

자체 호스팅 옵션

이제 벤치마크에는 Llama.cpp의 WASM 버전을 사용하여 자신의 서버에서 직접 실행할 수 있는 기능이 포함되어 있습니다. 개발자는 버전 2에서 변경할 사항에 대한 피드백을 구하고 있으며, 다른 구성으로 다른 사람들이 얻는 점수를 확인하고 싶어합니다.

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

코텍스: 에빙하우스 감쇠를 적용한 오픈클로 에이전트를 위한 로컬 메모리 계층
Tools

코텍스: 에빙하우스 감쇠를 적용한 오픈클로 에이전트를 위한 로컬 메모리 계층

Cortex는 OpenClaw 에이전트의 컨텍스트 압축 문제를 해결하기 위해 구축된 오픈소스 메모리 도구입니다. 사실 소멸을 위해 에빙하우스 망각 곡선을 구현하고, 파일에서 먼저 가져오며, SQLite를 사용하는 단일 19MB Go 바이너리로 실행됩니다.

OpenClawRadar
HolyCode: 지속적인 AI 코딩 에이전트 환경을 위한 Docker 컨테이너
Tools

HolyCode: 지속적인 AI 코딩 에이전트 환경을 위한 Docker 컨테이너

HolyCode는 AI 코딩 에이전트를 위한 지속적인 개발 환경을 제공하는 Docker 컨테이너로, 재구축 시에도 세션, 설정, 플러그인을 유지합니다. 에이전트 워크플로우를 위해 사전 구성된 브라우저 도구를 포함하며, OpenCode를 통해 Claude, OpenAI, Gemini 및 기타 제공업체를 지원합니다.

OpenClawRadar
파일럿 프로토콜: OpenClaw 에이전트를 위한 네트워킹 레이어
Tools

파일럿 프로토콜: OpenClaw 에이전트를 위한 네트워킹 레이어

Pilot Protocol은 다른 기기 간 OpenClaw 에이전트의 연결성을 처리하는 오픈소스 네트워킹 레이어입니다. VPN이나 ngrok 없이 영구 가상 주소, 암호화된 UDP 터널 및 NAT 트래버설을 제공합니다.

OpenClawRadar
Ollama 업데이트, Kimi k2.5 클라우드 모델에 OpenClaw 지원 추가
Tools

Ollama 업데이트, Kimi k2.5 클라우드 모델에 OpenClaw 지원 추가

Ollama가 클라우드 모델에 대한 OpenClaw 지원을 통합한 업데이트를 발표했습니다. 여기에는 웹 검색 기능이 포함된 Kimi k2.5 모델에 대한 무료 접근이 포함되며, NVIDIA 데이터 센터에서 실행됩니다.

OpenClawRadar