SubQ: Субквадратичная языковая модель с контекстным окном в 12 миллионов токенов

SubQ от Subquadratic — это готовая к продакшну LLM, построенная на полностью субквадратичной архитектуре разреженного внимания. Она обрабатывает до 12 млн токенов в одном запросе, работает со скоростью 150 токенов в секунду и стоит примерно в 5 раз меньше ведущих моделей, таких как GPT-5 или Opus.
Архитектура и бенчмарки
В отличие от стандартных трансформеров с attention сложности O(n²), SubQ использует механизм разреженного внимания субквадратичной сложности, который обрабатывает только релевантные связи между токенами. При 12 млн токенов это снижает вычислительные затраты на attention почти в 1000 раз. Бенчмарки (сторонняя валидация):
- SWE-Bench Verified (реальное программирование): 81.8%
- RULER @ 128K (точность на длинных контекстах): 95.0%
- MRCR v2 (8 иголок, 1M): 65.9%
Для сравнения, результат SubQ в SWE-Bench находится между Gemini 3.1 Pro (80.6%) и Opus 4.6 (80.8%). Модель также превосходит Opus 4.7 (87.6%? — не сообщалось на тот момент) и GPT-5.5 (н/д) в MRCR v2.
Продукты и интеграция
Два варианта доступа:
- Full-Context API: контекст 12 млн токенов, стриминг, использование инструментов, конечные точки, совместимые с OpenAI. Обрабатывайте целые репозитории за один вызов с линейной стоимостью.
- SubQ Code (слой длинного контекста для кодинговых агентов): Подключается к Claude Code, Codex или Cursor. Примерно на 25% ниже счет, в 10 раз быстрее исследование, автоматическое перенаправление дорогих вызовов моделей. Установка в одну строку.
Для кого это
Для разработчиков и команд, управляющих AI-агентами, которым требуется рассуждать о целых кодовых базах, длинных историях PR или постоянном состоянии без потери качества.
📖 Прочитать полный источник: HN AI Agents
👀 Смотрите также

Claude Code делегирует кодирование Mistral/DeepSeek: сохранено 57M токенов, снижение затрат на 90-100%
Навык Claude Code под названием vibe-skill делегирует низкоуровневое кодирование дешевым моделям вроде Mistral или DeepSeek, оставляя Claude планирование. После 254 запусков за 10 дней сэкономлено 57 млн токенов, достигнута экономия 90-100% с 98% успешных попыток.

Gemma Gem: Встроенный ИИ-агент для автоматизации браузера через WebGPU
Gemma Gem — это расширение для Chrome, которое запускает модель Gemma 4 от Google (2B или 4B) полностью на устройстве с использованием WebGPU, без API-ключей или облачных зависимостей. Оно предоставляет инструменты для чтения содержимого страницы, создания скриншотов, кликов по элементам, ввода текста, прокрутки и выполнения JavaScript через чат-интерфейс.

Фредди MCP-сервер: Предоставьте вашему агенту OpenClaw доступ для чтения к личным данным о здоровье
Freddy — это персональный сервер данных о здоровье, который предоставляет данные о сне, восстановлении, тренировочной нагрузке и многом другом в виде MCP-сервера, позволяя агентам OpenClaw работать с реальными данными организма.

htmLLM-124M v2 Выпущен: Специализированная модель автодополнения HTML/Bootstrap
LH-Tech-AI выпустила htmLLM-124M v2 — модель на 124 миллиона параметров, специализированную для автодополнения HTML/Bootstrap, которая достигает значения валидационной потери 0.91 и обучается примерно за 8 часов на одном GPU T4.