SubQ: 1,200万トークンのコンテキストウィンドウを備えた準二次LLM

Subquadratic社のSubQは、完全に準二次スパース注意機構をベースにしたプロダクション対応LLMです。単一プロンプトで最大1200万トークンを処理し、毎秒150トークンの速度で動作し、GPT-5やOpusなどの主要モデルと比較して約5分の1のコストです。
アーキテクチャとベンチマーク
O(n²)の注意機構を持つ標準的なトランスフォーマーとは異なり、SubQは準二次スパース注意機構を採用し、関連するトークン関係のみを処理します。1200万トークンでは、注意計算を約1000倍削減します。ベンチマーク(第三者検証済み):
- SWE-Bench Verified(実世界のコーディング): 81.8%
- RULER @ 128K(長文コンテキスト精度): 95.0%
- MRCR v2(8ニードル、100万トークン): 65.9%
比較として、SubQのSWE-BenchスコアはGemini 3.1 Pro(80.6%)とOpus 4.6(80.8%)の間に位置します。また、MRCR v2ではOpus 4.7(87.6%?—当時未報告)やGPT-5.5(未報告)を上回っています。
製品と統合
2つのアクセスオプション:
- Full-Context API: 1200万トークンのコンテキスト、ストリーミング、ツール使用、OpenAI互換エンドポイント。リポジトリ全体を1回の呼び出しで線形コストで処理。
- SubQ Code(コーディングエージェント用の長文コンテキストレイヤー): Claude Code、Codex、Cursorにプラグイン。請求額約25%削減、探索速度10倍向上、高価なモデル呼び出しを自動リダイレクト。一行でインストール。
対象ユーザー
コードベース全体、長いPR履歴、または永続的な状態を品質低下なく推論する必要があるAIエージェントを実行する開発者やチーム。
📖 出典: HN AI Agents
👀 See Also

Claude Codeユーザーが、読み取り専用の会話用に/discussコマンドを作成しました。
Claude Codeユーザーが、会話中に「変更を加えないで」と繰り返し入力する煩わしさを解消するために、/discussというカスタムスキルを開発しました。この25行のスキルは、ファイル変更を引き起こさずに、アーキテクチャの決定、コードの探索、ブレインストーミングについて議論するための読み取り専用モードを作成します。

オーラリサーチ:ローカルツールが文書をAIがナビゲート可能なウィキにまとめ、永続的なメモリを実現
Aura Researchは、生のドキュメント(PDF、論文、メモ、コード、60以上の形式)を、相互リンクされた記事、概念ページ、マスターインデックスを持つ構造化されたマークダウンwikiに処理するオープンソースツールです。すべてをRAG検索に最適化された.auraアーカイブに圧縮し、データがマシンから流出することなく100%ローカルで実行されます。
Ant GroupのAntLing-3.0-flash、OpenRouter経由でOpenClawに登場 – 256Kコンテキスト、8月3日まで無料
Ant GroupのAntLing-3.0-flashが、OpenRouter経由でOpenClaw上で利用可能に。クライアントのアップデートは不要で、設定はopenclaw models set openrouter/inclusionai/ling-3.0-flashを実行するだけ。256Kコンテキストと、長期ツール呼び出しに対する強化学習が特徴。8月3日まで無料(APIのみ、重みは未提供)。

ローカルダッシュボードは、Claude Codeの使用状況をトークンコスト、ツール呼び出し、セッション分析で追跡します。
開発者が、Claude CodeのJSONLセッションファイルを読み取り、トークン使用量、推定コスト、ツール呼び出しの内訳、セッション履歴を可視化するローカルダッシュボードを構築しました。このツールはExpress APIとReactダッシュボードを使用し、完全にユーザーのマシン上で動作します。