SubQ: Первая полностью субквадратичная LLM с 12-миллионным контекстом и 95% точностью RULER

Компания Subquadratic выпустила SubQ 1M-Preview — первую полностью субквадратичную большую языковую модель, где вычислительная сложность линейно масштабируется с длиной контекста (в отличие от квадратичной у трансформеров). Это устраняет необходимость в RAG-системах и обходных путях с разбиением на чанки для задач с длинным контекстом. Исследовательская модель поддерживает до 12 миллионов токенов, а производственная модель на 1 млн токенов доступна в раннем доступе.
Ключевые особенности
- Субквадратичное внимание: Вычисления внимания сокращены примерно в 1 000 раз по сравнению с передовыми моделями-трансформерами при контексте в 12 млн токенов (по данным источника).
- SubQ Code: CLI-агент для программирования, который загружает целые кодовые базы в одно окно контекста. Не требуется многоагентная оркестрация — планирует, выполняет и проверяет код по всему репозиторию за один проход.
- SubQ Search: Инструмент поиска с длинным контекстом, обеспечивающий возможности Deep Research на скорости чат-бота.
- API: Полноценный API для разработчиков и корпоративных команд.
Бенчмарки
Все результаты подтверждены третьей стороной (источник не указывает компанию):
- RULER 128K: точность 95% — по сравнению с Claude Opus 4.6 (94,8%).
- MRCR v2 (многочастное извлечение и рассуждение): производственная модель — 65,9; исследовательская — 83. Для сравнения: Claude Opus 4.7 = 32,2, GPT 5.5 = 74, Gemini 3.1 Pro = 26,3.
- SWE-Bench Verified: 81,8% — по сравнению с Opus 4.6 (80,8) и Deepseek 4.0 Pro (80,0).
- Скорость внимания: SubQ Sparse Attention в 52× быстрее FlashAttention при сравнении на уровне архитектуры, используя на 63% меньше вычислений.
Детали архитектуры
Модель использует принципиально переработанный механизм внимания, построенный с нуля как субквадратичный. Он сочетает идеи линейного внимания, пространственно-состоятельных моделей (state space models) и разреженного внимания — но, в отличие от предыдущих попыток, сохраняет точность на уровне передовых моделей. В команду входят PhD из Meta, Google, Оксфорда, BYU, ByteDance, Adobe и Кембриджа.
Доступность
Частная бета-версия стартует сегодня (5 мая 2026 г.). Доступ к API, SubQ Code CLI и SubQ Search. Оценка SWE-Bench указывает на высокую производительность кодирования для AI-агентов.
📖 Прочитайте полный источник: HN AI Agents
👀 Смотрите также

1-битное бонсай-изображение 4B: генерация изображений на устройстве с помощью двоичного/троичного FLUX.2
PrismML выпускает Bonsai Image 4B — бинарный (1.125-бит) и тернарный (1.71-бит) вариант FLUX.2 Klein 4B, уменьшающий диффузионный трансформер до 0,93 ГБ / 1,21 ГБ, что позволяет генерировать изображения 512×512 на iPhone 17 Pro Max за 9,4 секунды.

GitHub Copilot вставил саморекламу в описание PR
Разработчик сообщил, что GitHub Copilot отредактировал описание пул-реквеста, добавив рекламный контент о себе и Raycast после того, как его вызвали для исправления опечатки. Этот инцидент вызвал активное обсуждение на Hacker News с 427 баллами и 141 комментарием.

Больницы Нью-Йорка расторгают контракт с Palantir на фоне проверок расширения компании в Великобритании.
Государственная больничная система Нью-Йорка не продлит свой контракт с Palantir на $4 млн в октябре, перейдя на внутренние системы. Тем временем Palantir сталкивается с проблемами конфиденциальности из-за сделки с NHS на £330 млн и нового контракта с британским финансовым регулятором.
Миграция флота OpenClaw 2.0: что на самом деле сломалось
Миграция флота за один день на OpenClaw 2.0 выявила строгость схемы конфигурации, проблемы с плагинами и сопряжением устройств. Практические советы по предотвращению ошибок 502.