SubQ: 1,200만 토큰 컨텍스트 윈도우를 가진 서브-쿼드라틱 LLM

✍️ OpenClawRadar📅 게시일: May 6, 2026🔗 Source
SubQ: 1,200만 토큰 컨텍스트 윈도우를 가진 서브-쿼드라틱 LLM
Ad

Subquadratic의 SubQ는 완전 준2차 희소 주의 아키텍처를 기반으로 한 프로덕션 준비 완료 LLM입니다. 단일 프롬프트에서 최대 12M 토큰을 처리하며, 초당 150 토큰 속도로 실행되고 GPT-5나 Opus 같은 주요 모델의 약 1/5 비용으로 운영됩니다.

아키텍처 및 벤치마크

O(n²) 주의를 사용하는 표준 트랜스포머와 달리, SubQ는 관련 토큰 관계만 처리하는 준2차 희소 주의 메커니즘을 사용합니다. 12M 토큰에서 이는 주의 계산량을 거의 1000배 줄입니다. 벤치마크(타사 검증):

  • SWE-Bench Verified (실제 코딩): 81.8%
  • RULER @ 128K (긴 컨텍스트 정확도): 95.0%
  • MRCR v2 (8-니들, 1M): 65.9%

비교를 위해, SubQ의 SWE-Bench 점수는 Gemini 3.1 Pro (80.6%)와 Opus 4.6 (80.8%) 사이에 위치합니다. 또한 MRCR v2에서 Opus 4.7 (87.6%? – 당시 보고되지 않음) 및 GPT-5.5 (n/r)를 능가합니다.

제품 및 통합

두 가지 액세스 옵션:

  • 전체 컨텍스트 API: 12M 토큰 컨텍스트, 스트리밍, 도구 사용, OpenAI 호환 엔드포인트. 선형 비용으로 한 번의 호출에 전체 리포지토리 처리.
  • SubQ Code (코딩 에이전트용 긴 컨텍스트 레이어): Claude Code, Codex 또는 Cursor에 플러그인. 청구서 약 25% 절감, 탐색 속도 10배 향상, 비싼 모델 호출 자동 리디렉션. 한 줄 설치.

대상 사용자

전체 코드베이스, 긴 PR 기록 또는 지속적 상태에 걸쳐 추론해야 하는 AI 에이전트를 실행하는 개발자 및 팀. 품질 저하 없음.

📖 전체 소스 읽기: HN AI Agents

Ad

👀 See Also

Semble: 클로드 코드용 로컬 MCP 서버, 토큰 98% 절감
Tools

Semble: 클로드 코드용 로컬 MCP 서버, 토큰 98% 절감

Semble는 Claude Code를 위한 오픈소스 MCP 서버로, grep+read 워크플로우를 대체합니다. 임베딩, BM25, 재순위화를 사용하여 리포지토리를 약 250ms에 인덱싱하면서 토큰 사용량을 약 98% 줄입니다.

OpenClawRadar
CrabMeat v0.1.0: LLM이 보안 경계를 신뢰하지 않는 보안 우선 에이전트 게이트웨이
Tools

CrabMeat v0.1.0: LLM이 보안 경계를 신뢰하지 않는 보안 우선 에이전트 게이트웨이

CrabMeat v0.1.0은 에이전틱 LLM 워크로드를 위한 WebSocket 게이트웨이로, 아키텍처 수준에서 보안을 강화합니다: 기능 ID 간접화, 효과 클래스, IRONCLAD_CONTEXT 고정 명령어, 변조 감지 감사 체인, 스트리밍 출력 누출 필터, 그리고 YOLO 모드 없음.

OpenClawRadar
🦀
Tools

Apple Silicon macOS 가상 머신: Metal 기능 Shim으로 LLM 추론 11~16배 향상

Cua의 프로세스 범위 Metal 기능 셤은 macOS VM에서 최신 커널을 잠금 해제하여 Apple Silicon에서 llama.cpp 추론을 최대 16배 향상시킵니다. 오픈 소스 연구 릴리스.

OpenClawRadar
실시간으로 Claude 사용량을 모니터링하는 무료 macOS 메뉴 바 앱
Tools

실시간으로 Claude 사용량을 모니터링하는 무료 macOS 메뉴 바 앱

한 개발자가 Claude Code와 Opus를 전적으로 사용하여 Claude 사용량을 모니터링하는 무료 macOS 메뉴 바 앱을 구축했습니다. 이 앱은 5시간 및 7일 세션 사용량 바, 컨텍스트 창 채우기 비율을 표시하고 한계에 도달할 때 알림을 보냅니다.

OpenClawRadar