SubQ: Ein sub-quadratisches LLM mit 12-Millionen-Token-Kontextfenster

SubQ von Subquadratic ist ein produktionsreifes LLM, das auf einer vollständig sub-quadratischen Sparse-Attention-Architektur basiert. Es verarbeitet bis zu 12 Millionen Token in einer einzelnen Abfrage, läuft mit 150 Token pro Sekunde und kostet etwa ein Fünftel führender Modelle wie GPT-5 oder Opus.
Architektur & Benchmarks
Im Gegensatz zu Standard-Transformatoren mit O(n²) Attention verwendet SubQ einen sub-quadratischen Sparse-Attention-Mechanismus, der nur relevante Token-Beziehungen verarbeitet. Bei 12 Millionen Token reduziert dies die Attention-Berechnung um fast das 1000-fache. Benchmarks (drittanbieter-validiert):
- SWE-Bench Verified (praxisnahes Programmieren): 81,8%
- RULER @ 128K (Langkontext-Genauigkeit): 95,0%
- MRCR v2 (8-Nadel, 1M): 65,9%
Zum Vergleich: SubQs SWE-Bench-Wert liegt zwischen Gemini 3.1 Pro (80,6%) und Opus 4.6 (80,8%). Das Modell übertrifft außerdem Opus 4.7 (87,6%? – zum Zeitpunkt nicht berichtet) und GPT-5.5 (n/r) bei MRCR v2.
Produkte & Integration
Zwei Zugriffsoptionen:
- Full-Context API: 12M-Token-Kontext, Streaming, Tool-Nutzung, OpenAI-kompatible Endpunkte. Verarbeiten Sie gesamte Repositories in einem Aufruf zu linearen Kosten.
- SubQ Code (Langkontext-Schicht für Programmieragenten): Einbindbar in Claude Code, Codex oder Cursor. ~25% niedrigere Rechnung, 10× schnellere Erkundung, automatische Umleitung teurer Modellaufrufe. Installation mit einem Befehl.
Für wen es gedacht ist
Entwickler und Teams, die KI-Agenten betreiben, die über vollständige Codebasen, lange PR-Verläufe oder persistenten Zustand hinweg denken müssen, ohne Qualitätseinbußen.
📖 Vollständige Quelle lesen: HN AI Agents
👀 Siehe auch

Claude AIs UltraThink-Funktion kehrt zurück mit praktischen Nutzungshinweisen
Claude AI hat die UltraThink-Funktion nach Nutzerfeedback wieder eingeführt. Mittlerer Aufwand ist jetzt die Standardeinstellung für Opus 4.6 (Max/Team), wobei Hoher Aufwand dauerhaft über /model verfügbar ist und UltraThink als einmalige Überschreibung für hohen Aufwand dient.

Hypura: Speicher-Ebenen-bewusster LLM-Inferenz-Planer für Apple Silicon
Hypura ist ein auf Rust basierender Inferenz-Scheduler, der Modelltensoren über GPU-, RAM- und NVMe-Ebenen verteilt, um Modelle auszuführen, die den physischen Speicher auf Apple Silicon Macs übersteigen. Es ermöglicht die Ausführung eines 31 GB großen Mixtral 8x7B auf einem 32 GB Mac Mini mit 2,2 Tok/s und eines 40 GB großen Llama 70B mit 0,3 Tok/s, wo die Standardversion von llama.cpp abstürzt.

Open-Source-Claude-Code-Plugins für agentische Handelsprotokolle
OrcaQubits hat acht Open-Source-Claude-Code-Plugins veröffentlicht, die agentische Commerce-Protokolle wie UCP, ACP, AP2 und A2A implementieren, mit MIT-Lizenz und Unterstützung für Plattformen wie Magento 2, BigCommerce und WooCommerce.

BigNumberTheory: Ein Erfahrungsaustausch-Netzwerk für Claude-Code-Agenten
BigNumberTheory ist ein Community-Netzwerk, in dem Claude Code-Agenten Lektionen aus echten Debugging-Sitzungen teilen und empfangen. Die Einrichtung erfordert einen Befehl und ist derzeit kostenlos, mit über 700 geteilten Erfahrungen und mehr als 1.100 über das Netzwerk gelieferten Erfahrungen.