SubQ: 1,200만 토큰 컨텍스트 윈도우를 가진 서브-쿼드라틱 LLM

Subquadratic의 SubQ는 완전 준2차 희소 주의 아키텍처를 기반으로 한 프로덕션 준비 완료 LLM입니다. 단일 프롬프트에서 최대 12M 토큰을 처리하며, 초당 150 토큰 속도로 실행되고 GPT-5나 Opus 같은 주요 모델의 약 1/5 비용으로 운영됩니다.
아키텍처 및 벤치마크
O(n²) 주의를 사용하는 표준 트랜스포머와 달리, SubQ는 관련 토큰 관계만 처리하는 준2차 희소 주의 메커니즘을 사용합니다. 12M 토큰에서 이는 주의 계산량을 거의 1000배 줄입니다. 벤치마크(타사 검증):
- SWE-Bench Verified (실제 코딩): 81.8%
- RULER @ 128K (긴 컨텍스트 정확도): 95.0%
- MRCR v2 (8-니들, 1M): 65.9%
비교를 위해, SubQ의 SWE-Bench 점수는 Gemini 3.1 Pro (80.6%)와 Opus 4.6 (80.8%) 사이에 위치합니다. 또한 MRCR v2에서 Opus 4.7 (87.6%? – 당시 보고되지 않음) 및 GPT-5.5 (n/r)를 능가합니다.
제품 및 통합
두 가지 액세스 옵션:
- 전체 컨텍스트 API: 12M 토큰 컨텍스트, 스트리밍, 도구 사용, OpenAI 호환 엔드포인트. 선형 비용으로 한 번의 호출에 전체 리포지토리 처리.
- SubQ Code (코딩 에이전트용 긴 컨텍스트 레이어): Claude Code, Codex 또는 Cursor에 플러그인. 청구서 약 25% 절감, 탐색 속도 10배 향상, 비싼 모델 호출 자동 리디렉션. 한 줄 설치.
대상 사용자
전체 코드베이스, 긴 PR 기록 또는 지속적 상태에 걸쳐 추론해야 하는 AI 에이전트를 실행하는 개발자 및 팀. 품질 저하 없음.
📖 전체 소스 읽기: HN AI Agents
👀 See Also

Engram: 지식을 실제로 기억하게 만드는 OpenClaw 학습 플러그인
Engram은 사전 테스트, 블라인드 채점, FSRS-4.5 간격 반복과 같은 신경과학 기반 기술을 사용하여 AI 에이전트가 작업 속도를 높여도 배운 내용을 기억할 수 있도록 하는 OpenClaw 플러그인입니다.

원격 상호 작용을 위해 채팅 앱에 Claude 코드 연결하기
cc-connect라는 GitHub 프로젝트는 Claude Code를 Slack과 Telegram 같은 메시징 플랫폼에 연결하여 로컬 머신을 노출하지 않고도 원격 상호작용을 가능하게 합니다. 에이전트는 로컬에서 실행되며 작은 브리지가 에이전트와 채팅 앱 사이에서 메시지를 중계합니다.

클로드 기반 MCP 도구, 빌드 도구 없이 대화형 HTML 컴포넌트 생성
한 개발자가 daub.dev를 구축했습니다. 이 시스템은 Claude가 MCP 서버의 두뇌 역할을 하여 자연어 설명으로부터 스타일이 적용된 대화형 HTML UI 컴포넌트를 생성합니다. React, 번들러 또는 빌드 파이프라인 없이 작동합니다.

다중 에이전트 토론 접근법이 LLM 추론 품질을 향상시킵니다
한 개발자가 CyrcloAI를 사용하여 다중 에이전트 토론 방식을 실험했습니다. 이 방식에서는 분석가, 비평가, 종합자 등 다양한 역할을 맡은 AI 에이전트들이 최종 답변을 내놓기 전에 서로의 응답을 비판하며, 더 구조화되고 신중한 결과물을 만들어냈습니다.