NerfGuard: 코딩 요청을 저렴한 모델로 라우팅하여 비용을 3배 절감하는 분류기

✍️ OpenClawRadar📅 게시일: June 6, 2026🔗 Source
NerfGuard: 코딩 요청을 저렴한 모델로 라우팅하여 비용을 3배 절감하는 분류기
Ad

속도와 제어성을 위해 Claude Code에서 Codex로 전환한 팀은 토큰당 과금에 큰 부담을 느꼈습니다. 일일 요금이 상당했고, 모든 작업에 최상위 모델과 최대 추론을 사용하고 있었기 때문입니다. 그래서 그들은 NerfGuard를 만들었습니다. 각 요청을 필요한 최소한의 모델과 추론 깊이로 라우팅하는 빠른 분류기입니다.

핵심은 주어진 코딩 요청에 필요한 최소 지능을 결정하는 분류기입니다. 여기에 자동 토큰 효율화 기술을 적용합니다. 결과적으로 동일한 품질을 유지하면서 토큰 소비는 대폭 줄이고, 지능과 추론이 적절히 배분되어 속도도 크게 향상됩니다. 팀은 최대 3배 절감과 하루에 한 사람당 도구 사용 및 에이전트 응답 대기 시간에서 몇 시간을 절약했습니다.

출처의 주요 내용:

  • 분류기가 각 요청에 가장 저렴한 모델 + 추론 깊이로 라우팅
  • 추가 자동 토큰 효율화 기술
  • 결과: 동일 비용으로 3배 사용량
  • 속도 향상: 하루에 한 사람당 몇 시간 절약
  • 조절 한도에 도달하기 전에 더 많은 사용량

현재 여러 AI 회사의 엔지니어들이 사용 중입니다. 도구는 nerfguard.com에서 확인할 수 있습니다.

대상: 코딩 에이전트(Claude Code, Codex 등)를 사용하며 비용 대비 출력을 최대화하고 대기 시간을 줄이려는 팀.

📖 전체 출처 읽기: HN AI Agents

Ad

👀 See Also

ClawDeckX: 오픈소스 macOS 스타일 웹 플랫폼으로 OpenClaw 에이전트 관리
Tools

ClawDeckX: 오픈소스 macOS 스타일 웹 플랫폼으로 OpenClaw 에이전트 관리

ClawDeckX는 OpenClaw 에이전트를 설치, 구성 및 모니터링하기 위한 오픈소스 웹 플랫폼입니다. 시각적 관리 도구, 실시간 모니터링을 제공하며 13개 언어를 지원합니다.

OpenClawRadar
어드바이저: Opus 및 병렬 Sonnet 실행기를 구동하는 Claude Code용 /advisor 슬래시 명령어
Tools

어드바이저: Opus 및 병렬 Sonnet 실행기를 구동하는 Claude Code용 /advisor 슬래시 명령어

Claude Code의 /advisor 명령어는 Opus를 전략가로 사용해 여러 Sonnet 러너가 파일을 병렬로 읽도록 조정합니다. 실제 버그 6개 발견, 외부 API 및 런타임 의존성 없음.

OpenClawRadar
번개 MLX: 애플 실리콘 에이전트 사용을 위한 초고속 로컬 AI 엔진, Qwen 35B-A3B에서 220 tok/s 구현
Tools

번개 MLX: 애플 실리콘 에이전트 사용을 위한 초고속 로컬 AI 엔진, Qwen 35B-A3B에서 220 tok/s 구현

Lightning MLX는 Apple Silicon에서 가장 빠른 로컬 AI 추론을 제공하며, 코딩 에이전트와 도구 호출에 최적화되었다고 주장합니다. 벤치마크에 따르면 MacBook Max M5(128GB)에서 Qwen3.6-27B는 40.67 tok/s, Qwen3.6-35B-A3B는 220.86 tok/s를 기록했습니다.

OpenClawRadar
넷플릭스, 허깅 페이스에 비디오 객체 및 상호작용 삭제 모델 'VOID' 공개
Tools

넷플릭스, 허깅 페이스에 비디오 객체 및 상호작용 삭제 모델 'VOID' 공개

Netflix는 VOID를 공개했는데, 이는 비디오에서 객체와 함께 떨어지는 물체나 이동된 아이템을 포함한 모든 물리적 상호작용을 제거하는 비디오 인페인팅 모델입니다. 이 모델은 40GB 이상의 VRAM이 탑재된 GPU가 필요하며, 서로 다른 정제 수준을 위한 두 개의 체크포인트 파일과 함께 쿼드마스크 조건화를 사용합니다.

OpenClawRadar