无令牌API网关在模型间路由AI流量,将成本减半
토큰리스(Tokenless, YC S26)는 에이전트 대화의 각 턴을 가장 저렴하면서도 적절한 모델로 라우팅하여 AI 추론 비용을 절감하는 드롭인 API 게이트웨이입니다. 창립자(Rohit, Andrew, Kev)는 프린스턴, 구글 딥마인드, UC 버클리 출신으로, 이 라우터가 Claude Fable 5 성능을 절반 비용으로 구현한다고 주장합니다.
작동 방식
토큰리스는 요청을 여러 모델에 동시에 분산하고 진행 상황을 모니터링합니다. 하나의 모델이 명확히 올바른 방향으로 진행되면 나머지 모델을 취소합니다. 최종적으로 승리한 모델의 사용량에 대해서만 비용을 지불합니다. 이 기술은 새로운 접근 방식입니다. 라우터가 여러 모델을 병렬로 쿼리하고 중간 출력을 활용하여 라우팅 결정을 내립니다. 팀은 또한 라우팅 알고리즘이 캐시 핫/콜드 상태를 인식하면 모델 전환 시 캐시가 손상되지 않는다고 설명합니다.
벤치마크
τ³-Banking, Terminal-Bench 2.1, DeepSWE 1.1 에이전트 벤치마크에서 Tokenless Pro는 작업당 $0.57로 40.2% 해결률을 달성한 반면, Claude Fable 5는 작업당 $3.32로 24.5% 해결률을 기록했습니다. Ultra Saver 모드는 더 공격적으로 라우팅하여 작업당 $2.25로 30.9% 해결률을 보입니다. 수치들은 '측정된 결과이지 마케팅이 아니다'라고 제시되며, 비용 대비 품질에서 모든 최첨단 모델을 능가한다고 주장합니다.
시작하기
토큰리스는 OpenAI 및 Anthropic 호환 엔드포인트를 제공합니다. 기존 에이전트를 해당 엔드포인트로 연결하면 라우팅이 처리됩니다. 신규 사용자에게는 $20의 무료 크레딧이 제공됩니다. 팀은 Kimi K3, GPT 노력 및 더 많은 모델을 라우터에 추가할 계획입니다.
비용 절감 예측
토큰리스는 계산기를 제공합니다. LLM에 월 $40,000을 지출하는 팀의 경우, 새 청구액은 월 $26,000(34% 절감, 월 $14,000 절감)으로 예측되며, 월 11%의 지출 증가율을 가정할 때 향후 1년간 총 $344,000이 절감됩니다.
📖 전체 원문 읽기: HN AI Agents
👀 See Also

Kanwas: 팀과 AI 에이전트를 위한 오픈소스 공유 컨텍스트 보드
Kanwas는 팀과 AI 에이전트가 문서, 증거, 결정을 캔버스에서 실시간으로 공유하고 라이브 스트리밍 도구 호출을 지원하는 오픈소스 멀티플레이어 워크스페이스입니다. Docker를 통해 자체 호스팅되며, Yjs와 BlockNote로 Git 기반 백업이 가능합니다.

aco-system: 클로드를 위한 전체 회사 OS - 사용자 스토리 작성, 작업 분할, PR 검토 수행
Reddit 사용자가 공유한 내용에 따르면, aco-system은 단일 GitHub 이슈를 Claude가 완전히 검증된 PR과 테스트로 변환했습니다. 사용자 스토리 생성, 작업 분할, 비밀 확인 및 PR 리뷰가 포함됩니다.

맞춤형 llama.cpp 백엔드, Ryzen AI MAX 385의 AMD XDNA2 NPU로 LLM 행렬 곱셈 오프로딩
한 개발자가 Ryzen AI MAX 385(Strix Halo)의 AMD XDNA2 NPU에 GEMM 연산을 직접 전달하는 맞춤형 llama.cpp 백엔드를 구축하여 Meta-Llama-3.1-8B-Instruct Q4_K_M 모델로 0.947 J/tok의 에너지 효율로 43.7 t/s 디코딩 속도를 달성했습니다. NPU 디코딩 경로는 Vulkan 전용 대비 약 10W를 절약하면서 디코딩 처리량을 유지합니다.

Repo 토큰: LLM 컨텍스트 윈도우 인식을 위한 GitHub 액션 토큰 개수 배지 추가
Repo Tokens는 tiktoken을 사용하여 코드베이스의 토큰 수를 계산하고 README에 배지를 표시하여 LLM의 컨텍스트 창을 얼마나 채우는지 보여주는 GitHub Action입니다. 배지는 30% 미만은 녹색, 50-70%는 노란색, 70% 이상은 빨간색으로 표시됩니다.