SubQ: Ein sub-quadratisches LLM mit 12-Millionen-Token-Kontextfenster

SubQ von Subquadratic ist ein produktionsreifes LLM, das auf einer vollständig sub-quadratischen Sparse-Attention-Architektur basiert. Es verarbeitet bis zu 12 Millionen Token in einer einzelnen Abfrage, läuft mit 150 Token pro Sekunde und kostet etwa ein Fünftel führender Modelle wie GPT-5 oder Opus.
Architektur & Benchmarks
Im Gegensatz zu Standard-Transformatoren mit O(n²) Attention verwendet SubQ einen sub-quadratischen Sparse-Attention-Mechanismus, der nur relevante Token-Beziehungen verarbeitet. Bei 12 Millionen Token reduziert dies die Attention-Berechnung um fast das 1000-fache. Benchmarks (drittanbieter-validiert):
- SWE-Bench Verified (praxisnahes Programmieren): 81,8%
- RULER @ 128K (Langkontext-Genauigkeit): 95,0%
- MRCR v2 (8-Nadel, 1M): 65,9%
Zum Vergleich: SubQs SWE-Bench-Wert liegt zwischen Gemini 3.1 Pro (80,6%) und Opus 4.6 (80,8%). Das Modell übertrifft außerdem Opus 4.7 (87,6%? – zum Zeitpunkt nicht berichtet) und GPT-5.5 (n/r) bei MRCR v2.
Produkte & Integration
Zwei Zugriffsoptionen:
- Full-Context API: 12M-Token-Kontext, Streaming, Tool-Nutzung, OpenAI-kompatible Endpunkte. Verarbeiten Sie gesamte Repositories in einem Aufruf zu linearen Kosten.
- SubQ Code (Langkontext-Schicht für Programmieragenten): Einbindbar in Claude Code, Codex oder Cursor. ~25% niedrigere Rechnung, 10× schnellere Erkundung, automatische Umleitung teurer Modellaufrufe. Installation mit einem Befehl.
Für wen es gedacht ist
Entwickler und Teams, die KI-Agenten betreiben, die über vollständige Codebasen, lange PR-Verläufe oder persistenten Zustand hinweg denken müssen, ohne Qualitätseinbußen.
📖 Vollständige Quelle lesen: HN AI Agents
👀 Siehe auch
Erfahrungsbasiert: Open-Source-Modell-Gateway mit intelligentem Routing
Experiential ist ein Open-Source-Modell-Gateway, das gehostete, BYOK- und lokale Modelle vereint. Es leitet den Verkehr basierend auf Kosten/Qualität mithilfe simulierter Rollouts und OTel-Traces um, mit weniger als 1ms Overhead für BYOK-Anfragen.

Entwickler baut Power Automate MCP Server mit 108 Tools und plattformübergreifender Unterstützung
Ein Entwickler hat einen Power Automate MCP-Server erstellt, der von 12 auf 108 Tools erweitert wurde und Dataverse-CRUD über OData, SharePoint-Verwaltung über Graph, Power Apps-Versionierung, Umgebungsadministration sowie plattformübergreifende Unterstützung für Windows, macOS und Linux abdeckt.

Vibeyard fügt P2P-Sitzungsteilung für Claude Code hinzu.
Vibeyard, eine Open-Source-IDE für Claude Code, unterstützt jetzt Peer-to-Peer-Sitzungsteilung. Benutzer können Live-Terminalsitzungen mit Teammitgliedern über verschlüsselte WebRTC-Verbindungen mit Lese- oder Lese-Schreib-Zugriffsmodi teilen.

Cowork Context Management Kit löst Claudes Dateiüberlastungsproblem
Ein Entwickler erstellte ein Kontextverwaltungskit für Cowork, nachdem Claude KI alle 462 Dateien in ihrem Projektordner las, was zu Leistungsproblemen und Widersprüchen führte. Die Lösung umfasst globale Anweisungen, ein Manifest-Dateisystem und eine Cowork-Fähigkeit, um relevante Dokumente zu priorisieren.