SubQ: Первая полностью субквадратичная LLM с 12-миллионным контекстом и 95% точностью RULER

Компания Subquadratic выпустила SubQ 1M-Preview — первую полностью субквадратичную большую языковую модель, где вычислительная сложность линейно масштабируется с длиной контекста (в отличие от квадратичной у трансформеров). Это устраняет необходимость в RAG-системах и обходных путях с разбиением на чанки для задач с длинным контекстом. Исследовательская модель поддерживает до 12 миллионов токенов, а производственная модель на 1 млн токенов доступна в раннем доступе.
Ключевые особенности
- Субквадратичное внимание: Вычисления внимания сокращены примерно в 1 000 раз по сравнению с передовыми моделями-трансформерами при контексте в 12 млн токенов (по данным источника).
- SubQ Code: CLI-агент для программирования, который загружает целые кодовые базы в одно окно контекста. Не требуется многоагентная оркестрация — планирует, выполняет и проверяет код по всему репозиторию за один проход.
- SubQ Search: Инструмент поиска с длинным контекстом, обеспечивающий возможности Deep Research на скорости чат-бота.
- API: Полноценный API для разработчиков и корпоративных команд.
Бенчмарки
Все результаты подтверждены третьей стороной (источник не указывает компанию):
- RULER 128K: точность 95% — по сравнению с Claude Opus 4.6 (94,8%).
- MRCR v2 (многочастное извлечение и рассуждение): производственная модель — 65,9; исследовательская — 83. Для сравнения: Claude Opus 4.7 = 32,2, GPT 5.5 = 74, Gemini 3.1 Pro = 26,3.
- SWE-Bench Verified: 81,8% — по сравнению с Opus 4.6 (80,8) и Deepseek 4.0 Pro (80,0).
- Скорость внимания: SubQ Sparse Attention в 52× быстрее FlashAttention при сравнении на уровне архитектуры, используя на 63% меньше вычислений.
Детали архитектуры
Модель использует принципиально переработанный механизм внимания, построенный с нуля как субквадратичный. Он сочетает идеи линейного внимания, пространственно-состоятельных моделей (state space models) и разреженного внимания — но, в отличие от предыдущих попыток, сохраняет точность на уровне передовых моделей. В команду входят PhD из Meta, Google, Оксфорда, BYU, ByteDance, Adobe и Кембриджа.
Доступность
Частная бета-версия стартует сегодня (5 мая 2026 г.). Доступ к API, SubQ Code CLI и SubQ Search. Оценка SWE-Bench указывает на высокую производительность кодирования для AI-агентов.
📖 Прочитайте полный источник: HN AI Agents
👀 Смотрите также

Выпущен Claude Opus 4.8: более быстрый и дешевый быстрый режим, динамические рабочие процессы и улучшения честности
Anthropic обновляет Claude Opus до версии 4.8: улучшения в бенчмарках, динамические рабочие процессы в Claude Code, быстрый режим с ускорением в 2,5 раза и снижением цены в 3 раза, а также обучение честности.

Результаты слепого оценивания Gemma 4 и Qwen 3.5 с Claude Opus в роли судьи
Слепое оценивание по 30 вопросам сравнило модели Gemma 4 31B, Gemma 4 26B-A4B и Qwen 3.5 27B с использованием Claude Opus 4.6 в качестве судьи. Qwen 3.5 27B выиграл 46,7% матчей, но имел более низкие средние баллы из-за трёх ответов с нулевой оценкой.

Gemini Embedding 2: Первая нативная мультимодальная модель эмбеддингов от Google
Google выпустила Gemini Embedding 2, свою первую нативно мультимодальную модель эмбеддингов, которая преобразует текст, изображения, видео, аудио и документы в единое пространство эмбеддингов. Модель поддерживает до 8192 текстовых токенов, 6 изображений на запрос, 120 секунд видео и PDF-файлы длиной до 6 страниц, с гибкими выходными размерностями от 3072 до 768.
Claude Code v2.1.236: Новая переменная окружения для модели по умолчанию, исправления песочницы и другое
Claude Code v2.1.236 добавляет ANTHROPIC_DEFAULT_MODEL для установки модели для новых сессий, вводит notify_when_idle для межсессионных уведомлений и ужесточает правила запрета чтения в песочнице macOS.