无令牌API网关在模型间路由AI流量,将成本减半

✍️ OpenClawRadar📅 게시일: July 30, 2026🔗 Source
Ad

토큰리스(Tokenless, YC S26)는 에이전트 대화의 각 턴을 가장 저렴하면서도 적절한 모델로 라우팅하여 AI 추론 비용을 절감하는 드롭인 API 게이트웨이입니다. 창립자(Rohit, Andrew, Kev)는 프린스턴, 구글 딥마인드, UC 버클리 출신으로, 이 라우터가 Claude Fable 5 성능을 절반 비용으로 구현한다고 주장합니다.

작동 방식

토큰리스는 요청을 여러 모델에 동시에 분산하고 진행 상황을 모니터링합니다. 하나의 모델이 명확히 올바른 방향으로 진행되면 나머지 모델을 취소합니다. 최종적으로 승리한 모델의 사용량에 대해서만 비용을 지불합니다. 이 기술은 새로운 접근 방식입니다. 라우터가 여러 모델을 병렬로 쿼리하고 중간 출력을 활용하여 라우팅 결정을 내립니다. 팀은 또한 라우팅 알고리즘이 캐시 핫/콜드 상태를 인식하면 모델 전환 시 캐시가 손상되지 않는다고 설명합니다.

벤치마크

τ³-Banking, Terminal-Bench 2.1, DeepSWE 1.1 에이전트 벤치마크에서 Tokenless Pro는 작업당 $0.57로 40.2% 해결률을 달성한 반면, Claude Fable 5는 작업당 $3.32로 24.5% 해결률을 기록했습니다. Ultra Saver 모드는 더 공격적으로 라우팅하여 작업당 $2.25로 30.9% 해결률을 보입니다. 수치들은 '측정된 결과이지 마케팅이 아니다'라고 제시되며, 비용 대비 품질에서 모든 최첨단 모델을 능가한다고 주장합니다.

시작하기

토큰리스는 OpenAI 및 Anthropic 호환 엔드포인트를 제공합니다. 기존 에이전트를 해당 엔드포인트로 연결하면 라우팅이 처리됩니다. 신규 사용자에게는 $20의 무료 크레딧이 제공됩니다. 팀은 Kimi K3, GPT 노력 및 더 많은 모델을 라우터에 추가할 계획입니다.

비용 절감 예측

토큰리스는 계산기를 제공합니다. LLM에 월 $40,000을 지출하는 팀의 경우, 새 청구액은 월 $26,000(34% 절감, 월 $14,000 절감)으로 예측되며, 월 11%의 지출 증가율을 가정할 때 향후 1년간 총 $344,000이 절감됩니다.

📖 전체 원문 읽기: HN AI Agents

Ad

👀 See Also

클로드용 자체 호스팅 메모리 레이어, 클라우드플레어에서 무료 실행
Tools

클로드용 자체 호스팅 메모리 레이어, 클라우드플레어에서 무료 실행

Cloudflare Worker MCP 서버는 Workers AI와 Vectorize를 사용하여 Claude가 의미론적 검색을 통해 메모를 기억하고 불러올 수 있게 해줍니다. 모두 무료 요금제로 가능합니다.

OpenClawRadar
캐스케이드 그래프: AI 에너지 제약과 공급 병목 현상의 인터랙티브 지도
Tools

캐스케이드 그래프: AI 에너지 제약과 공급 병목 현상의 인터랙티브 지도

캐스케이드 그래프는 물리적 경제의 방향성 지식 그래프로, 에너지 및 물리적 제약에서 투자 가능한 자산에 이르기까지 구조적 압력이 어떻게 전이되는지 추적하기 위해 405개의 노드(드라이버, 병목점, 지역, 티커)가 597개의 출처가 있는 엣지로 연결되어 있습니다.

OpenClawRadar
Claude Code: AI로 구축한 프론트엔드를 실제 백엔드에 연결하는 방법
Tools

Claude Code: AI로 구축한 프론트엔드를 실제 백엔드에 연결하는 방법

Claude Code로 멋진 프론트엔드를 만들 수 있지만, 종종 하드코딩된 데이터를 사용합니다. 실제 백엔드에 연결하는 네 가지 방법을 소개합니다: 원시 API, SDK, CLI, MCP.

OpenClawRadar
Flash-MoE: 순수 C/Metal로 MacBook Pro에서 397B 파라미터 Qwen 모델 실행하기
Tools

Flash-MoE: 순수 C/Metal로 MacBook Pro에서 397B 파라미터 Qwen 모델 실행하기

Flash-MoE는 순수 C/Metal 추론 엔진으로, 3970억 개의 파라미터를 가진 Mixture-of-Experts 모델인 Qwen3.5-397B-A17B를 48GB RAM의 MacBook Pro에서 초당 4.4+ 토큰의 속도로 실행합니다. 209GB 모델은 Python이나 프레임워크 없이 커스텀 Metal 컴퓨트 셰이더를 통해 SSD에서 스트리밍됩니다.

OpenClawRadar