SubQ: Субквадратичная языковая модель с контекстным окном в 12 миллионов токенов

✍️ OpenClawRadar📅 Опубликовано: 6 мая 2026 г.🔗 Source
SubQ: Субквадратичная языковая модель с контекстным окном в 12 миллионов токенов
Ad

SubQ от Subquadratic — это готовая к продакшну LLM, построенная на полностью субквадратичной архитектуре разреженного внимания. Она обрабатывает до 12 млн токенов в одном запросе, работает со скоростью 150 токенов в секунду и стоит примерно в 5 раз меньше ведущих моделей, таких как GPT-5 или Opus.

Архитектура и бенчмарки

В отличие от стандартных трансформеров с attention сложности O(n²), SubQ использует механизм разреженного внимания субквадратичной сложности, который обрабатывает только релевантные связи между токенами. При 12 млн токенов это снижает вычислительные затраты на attention почти в 1000 раз. Бенчмарки (сторонняя валидация):

  • SWE-Bench Verified (реальное программирование): 81.8%
  • RULER @ 128K (точность на длинных контекстах): 95.0%
  • MRCR v2 (8 иголок, 1M): 65.9%

Для сравнения, результат SubQ в SWE-Bench находится между Gemini 3.1 Pro (80.6%) и Opus 4.6 (80.8%). Модель также превосходит Opus 4.7 (87.6%? — не сообщалось на тот момент) и GPT-5.5 (н/д) в MRCR v2.

Ad

Продукты и интеграция

Два варианта доступа:

  • Full-Context API: контекст 12 млн токенов, стриминг, использование инструментов, конечные точки, совместимые с OpenAI. Обрабатывайте целые репозитории за один вызов с линейной стоимостью.
  • SubQ Code (слой длинного контекста для кодинговых агентов): Подключается к Claude Code, Codex или Cursor. Примерно на 25% ниже счет, в 10 раз быстрее исследование, автоматическое перенаправление дорогих вызовов моделей. Установка в одну строку.

Для кого это

Для разработчиков и команд, управляющих AI-агентами, которым требуется рассуждать о целых кодовых базах, длинных историях PR или постоянном состоянии без потери качества.

📖 Прочитать полный источник: HN AI Agents

Ad

👀 Смотрите также

Claude Code делегирует кодирование Mistral/DeepSeek: сохранено 57M токенов, снижение затрат на 90-100%
Инструменты

Claude Code делегирует кодирование Mistral/DeepSeek: сохранено 57M токенов, снижение затрат на 90-100%

Навык Claude Code под названием vibe-skill делегирует низкоуровневое кодирование дешевым моделям вроде Mistral или DeepSeek, оставляя Claude планирование. После 254 запусков за 10 дней сэкономлено 57 млн токенов, достигнута экономия 90-100% с 98% успешных попыток.

OpenClawRadar
Gemma Gem: Встроенный ИИ-агент для автоматизации браузера через WebGPU
Инструменты

Gemma Gem: Встроенный ИИ-агент для автоматизации браузера через WebGPU

Gemma Gem — это расширение для Chrome, которое запускает модель Gemma 4 от Google (2B или 4B) полностью на устройстве с использованием WebGPU, без API-ключей или облачных зависимостей. Оно предоставляет инструменты для чтения содержимого страницы, создания скриншотов, кликов по элементам, ввода текста, прокрутки и выполнения JavaScript через чат-интерфейс.

OpenClawRadar
Фредди MCP-сервер: Предоставьте вашему агенту OpenClaw доступ для чтения к личным данным о здоровье
Инструменты

Фредди MCP-сервер: Предоставьте вашему агенту OpenClaw доступ для чтения к личным данным о здоровье

Freddy — это персональный сервер данных о здоровье, который предоставляет данные о сне, восстановлении, тренировочной нагрузке и многом другом в виде MCP-сервера, позволяя агентам OpenClaw работать с реальными данными организма.

OpenClawRadar
htmLLM-124M v2 Выпущен: Специализированная модель автодополнения HTML/Bootstrap
Инструменты

htmLLM-124M v2 Выпущен: Специализированная модель автодополнения HTML/Bootstrap

LH-Tech-AI выпустила htmLLM-124M v2 — модель на 124 миллиона параметров, специализированную для автодополнения HTML/Bootstrap, которая достигает значения валидационной потери 0.91 и обучается примерно за 8 часов на одном GPU T4.

OpenClawRadar