SubQ: Ein sub-quadratisches LLM mit 12-Millionen-Token-Kontextfenster

✍️ OpenClawRadar📅 Veröffentlicht: 6. Mai 2026🔗 Source
SubQ: Ein sub-quadratisches LLM mit 12-Millionen-Token-Kontextfenster
Ad

SubQ von Subquadratic ist ein produktionsreifes LLM, das auf einer vollständig sub-quadratischen Sparse-Attention-Architektur basiert. Es verarbeitet bis zu 12 Millionen Token in einer einzelnen Abfrage, läuft mit 150 Token pro Sekunde und kostet etwa ein Fünftel führender Modelle wie GPT-5 oder Opus.

Architektur & Benchmarks

Im Gegensatz zu Standard-Transformatoren mit O(n²) Attention verwendet SubQ einen sub-quadratischen Sparse-Attention-Mechanismus, der nur relevante Token-Beziehungen verarbeitet. Bei 12 Millionen Token reduziert dies die Attention-Berechnung um fast das 1000-fache. Benchmarks (drittanbieter-validiert):

  • SWE-Bench Verified (praxisnahes Programmieren): 81,8%
  • RULER @ 128K (Langkontext-Genauigkeit): 95,0%
  • MRCR v2 (8-Nadel, 1M): 65,9%

Zum Vergleich: SubQs SWE-Bench-Wert liegt zwischen Gemini 3.1 Pro (80,6%) und Opus 4.6 (80,8%). Das Modell übertrifft außerdem Opus 4.7 (87,6%? – zum Zeitpunkt nicht berichtet) und GPT-5.5 (n/r) bei MRCR v2.

Ad

Produkte & Integration

Zwei Zugriffsoptionen:

  • Full-Context API: 12M-Token-Kontext, Streaming, Tool-Nutzung, OpenAI-kompatible Endpunkte. Verarbeiten Sie gesamte Repositories in einem Aufruf zu linearen Kosten.
  • SubQ Code (Langkontext-Schicht für Programmieragenten): Einbindbar in Claude Code, Codex oder Cursor. ~25% niedrigere Rechnung, 10× schnellere Erkundung, automatische Umleitung teurer Modellaufrufe. Installation mit einem Befehl.

Für wen es gedacht ist

Entwickler und Teams, die KI-Agenten betreiben, die über vollständige Codebasen, lange PR-Verläufe oder persistenten Zustand hinweg denken müssen, ohne Qualitätseinbußen.

📖 Vollständige Quelle lesen: HN AI Agents

Ad

👀 Siehe auch

🦀
Werkzeuge

Erfahrungsbasiert: Open-Source-Modell-Gateway mit intelligentem Routing

Experiential ist ein Open-Source-Modell-Gateway, das gehostete, BYOK- und lokale Modelle vereint. Es leitet den Verkehr basierend auf Kosten/Qualität mithilfe simulierter Rollouts und OTel-Traces um, mit weniger als 1ms Overhead für BYOK-Anfragen.

OpenClawRadar
Entwickler baut Power Automate MCP Server mit 108 Tools und plattformübergreifender Unterstützung
Werkzeuge

Entwickler baut Power Automate MCP Server mit 108 Tools und plattformübergreifender Unterstützung

Ein Entwickler hat einen Power Automate MCP-Server erstellt, der von 12 auf 108 Tools erweitert wurde und Dataverse-CRUD über OData, SharePoint-Verwaltung über Graph, Power Apps-Versionierung, Umgebungsadministration sowie plattformübergreifende Unterstützung für Windows, macOS und Linux abdeckt.

OpenClawRadar
Vibeyard fügt P2P-Sitzungsteilung für Claude Code hinzu.
Werkzeuge

Vibeyard fügt P2P-Sitzungsteilung für Claude Code hinzu.

Vibeyard, eine Open-Source-IDE für Claude Code, unterstützt jetzt Peer-to-Peer-Sitzungsteilung. Benutzer können Live-Terminalsitzungen mit Teammitgliedern über verschlüsselte WebRTC-Verbindungen mit Lese- oder Lese-Schreib-Zugriffsmodi teilen.

OpenClawRadar
Cowork Context Management Kit löst Claudes Dateiüberlastungsproblem
Werkzeuge

Cowork Context Management Kit löst Claudes Dateiüberlastungsproblem

Ein Entwickler erstellte ein Kontextverwaltungskit für Cowork, nachdem Claude KI alle 462 Dateien in ihrem Projektordner las, was zu Leistungsproblemen und Widersprüchen führte. Die Lösung umfasst globale Anweisungen, ein Manifest-Dateisystem und eine Cowork-Fähigkeit, um relevante Dokumente zu priorisieren.

OpenClawRadar