SubQ: Субквадратичная языковая модель с контекстным окном в 12 миллионов токенов

SubQ от Subquadratic — это готовая к продакшну LLM, построенная на полностью субквадратичной архитектуре разреженного внимания. Она обрабатывает до 12 млн токенов в одном запросе, работает со скоростью 150 токенов в секунду и стоит примерно в 5 раз меньше ведущих моделей, таких как GPT-5 или Opus.
Архитектура и бенчмарки
В отличие от стандартных трансформеров с attention сложности O(n²), SubQ использует механизм разреженного внимания субквадратичной сложности, который обрабатывает только релевантные связи между токенами. При 12 млн токенов это снижает вычислительные затраты на attention почти в 1000 раз. Бенчмарки (сторонняя валидация):
- SWE-Bench Verified (реальное программирование): 81.8%
- RULER @ 128K (точность на длинных контекстах): 95.0%
- MRCR v2 (8 иголок, 1M): 65.9%
Для сравнения, результат SubQ в SWE-Bench находится между Gemini 3.1 Pro (80.6%) и Opus 4.6 (80.8%). Модель также превосходит Opus 4.7 (87.6%? — не сообщалось на тот момент) и GPT-5.5 (н/д) в MRCR v2.
Продукты и интеграция
Два варианта доступа:
- Full-Context API: контекст 12 млн токенов, стриминг, использование инструментов, конечные точки, совместимые с OpenAI. Обрабатывайте целые репозитории за один вызов с линейной стоимостью.
- SubQ Code (слой длинного контекста для кодинговых агентов): Подключается к Claude Code, Codex или Cursor. Примерно на 25% ниже счет, в 10 раз быстрее исследование, автоматическое перенаправление дорогих вызовов моделей. Установка в одну строку.
Для кого это
Для разработчиков и команд, управляющих AI-агентами, которым требуется рассуждать о целых кодовых базах, длинных историях PR или постоянном состоянии без потери качества.
📖 Прочитать полный источник: HN AI Agents
👀 Смотрите также

Memento v1.0: Постоянный сервер памяти MCP для Claude Code с 17 инструментами
Memento v1.0 — это сервер MCP с постоянной памятью для Claude Code, который поставляется с 17 инструментами, гибридным поиском, обнаружением противоречий и визуальным графом памяти. Он работает локально без облачных зависимостей и поддерживает несколько IDE, включая Claude Code, Cursor, Windsurf и OpenCode.

Контекстиум: Открытый Фреймворк Постоянного Контекста для Claude Code
Contextium — это структурированный фреймворк для git-репозиториев, который обеспечивает постоянный контекст для сессий Claude Code, используя файл CLAUDE.md в качестве маршрутизатора контекста для ленивой загрузки соответствующих markdown-файлов. Открытая версия включает шаблон с 6 примерами приложений и 27 документациями по интеграциям.

Обратная инженерия Apple Neural Engine для обучения моделей MicroGPT
Разработчик реверс-инженерировал приватные API нейронного движка Apple, чтобы создать конвейер обучения для модели MicroGPT с 110 млн параметров, достигнув энергоэффективности 6,6 TFLOPS/ватт на аппаратном обеспечении Mac с чипом M4.

AutoBe: Как слабые локальные LLM исправили архитектуру генератора AI-бэкенда
AutoBe — это открытый ИИ-агент, который создаёт полноценные бэкенд-приложения с использованием TypeScript, NestJS и Prisma. Команда обнаружила, что их первоначальный 100% успех компиляции давал неподдерживаемый код, затем они перестроили систему на модульную генерацию — что уронило успех до 40% — и использовали слабые локальные LLM, такие как qwen3-30b-a3b-thinking, для отладки неоднозначностей в схемах.