SubQ: Erstes vollständig subquadratisches LLM mit 12-Millionen-Token-Kontext und 95 % RULER-Genauigkeit

Subquadratic hat SubQ 1M-Preview veröffentlicht, das erste vollständig subquadratische große Sprachmodell, bei dem der Rechenaufwand linear mit der Kontextlänge skaliert – nicht quadratisch wie bei Transformatoren. Dies macht RAG-Systeme und Chunking-Lösungen für Aufgaben mit langem Kontext überflüssig. Das Forschungsmodell unterstützt bis zu 12 Millionen Token, ein 1-Millionen-Token-Produktionsmodell ist im Early Access verfügbar.
Schlüsselfunktionen
- Subquadratische Attention: Reduziert den Attention-Rechenaufwand um etwa das 1.000-fache im Vergleich zu führenden Transformer-Modellen bei 12-Millionen-Token-Kontext, laut Quelle.
- SubQ Code: CLI-basierter Coding-Agent, der gesamte Codebasen in ein einziges Kontextfenster lädt. Keine Multi-Agent-Orchestrierung nötig – plant, führt aus und bewertet über ein vollständiges Repository in einem Durchgang.
- SubQ Search: Langkontext-Suchtool mit Deep-Research-Funktionen in Chatbot-Geschwindigkeit.
- API: Vollkontext-API für Entwickler und Unternehmensteams.
Benchmarks
Alle Ergebnisse wurden von einem Dritten verifiziert (die Quelle nennt keine Firma):
- RULER 128K: 95% Genauigkeit – verglichen mit Claude Opus 4.6 bei 94,8%.
- MRCR v2 (Multi-Piece Retrieval & Reasoning): Produktionsmodell erreicht 65,9; Forschungsmodell 83. Referenz: Claude Opus 4.7 = 32,2, GPT 5.5 = 74, Gemini 3.1 Pro = 26,3.
- SWE-Bench Verified: 81,8% – verglichen mit Opus 4.6 (80,8) und Deepseek 4.0 Pro (80,0).
- Attention-Geschwindigkeit: SubQ Sparse Attention ist 52× schneller als FlashAttention im Architekturvergleich, bei 63% weniger Rechenaufwand.
Architekturdetails
Das Modell verwendet einen grundlegend neu gestalteten Attention-Mechanismus, der von Grund auf subquadratisch entwickelt wurde. Es nutzt lineare Attention, State-Space-Modell-Ideen und Sparse Attention – behält aber im Gegensatz zu früheren Versuchen Genauigkeit auf Spitzenniveau. Das Team umfasst Doktoren von Meta, Google, Oxford, BYU, ByteDance, Adobe und Cambridge.
Verfügbarkeit
Private Beta startet heute (5. Mai 2026). Zugang zu API, SubQ Code CLI und SubQ Search. Der SWE-Bench-Wert deutet auf starke Code-Leistung für KI-Coding-Agenten hin, wie die Leser von OpenClawRadar.
📖 Lies die vollständige Quelle: HN AI Agents
👀 Siehe auch

Opus 4.6 Medium vs. Low: Leistungsunterschiede und Preisgestaltung
Opus 4.6 Medium kostet etwa 50 % mehr als die Low-Version, behebt jedoch erhebliche Faulheitsprobleme, die beim leistungsschwächeren Modell festgestellt wurden. Die Medium-Version liegt in Leistungsbenchmarks zwischen Low und High.

Testen von KI-Agenten-Marktplätzen: Praktische Ergebnisse von ClawGig, RentAHuman und OpenClaw-basierten Einrichtungen
Ein Entwickler testete mehrere KI-Agenten-Marktplätze und stellte fest, dass ClawGig nicht reagierende Agenten und manipulierte Reputationsbewertungen hatte, RentAHuman-Agenten keine zusammenhängenden Gespräche führen konnten, während unabhängige OpenClaw-basierte Einrichtungen vielversprechend waren, aber schwer zu finden waren.

KI-Inferenz ist offensichtlich profitabel: Eine Analyse der Wirtschaftlichkeit
Anbieter von KI-Inferenz melden Bruttomargen von 70-80 %. Kostenschätzungen zeigen ~1 $ pro Million Tokens für ein 70B-Modell, während die API-Preise bei 4,50 $+ pro Million Tokens liegen.

NYC-Kliniken beenden Palantir-Vertrag, während Expansion in Großbritannien unter die Lupe genommen wird
Das öffentliche Krankenhaussystem von New York City wird seinen 4-Millionen-Dollar-Vertrag mit Palantir im Oktober nicht verlängern und auf interne Systeme umstellen. Gleichzeitig sieht sich Palantir mit Datenschutzbedenken hinsichtlich seines 330-Millionen-Pfund-Abkommens mit dem NHS und einem neuen Vertrag mit der britischen Finanzaufsicht konfrontiert.