SubQ: Un LLM Subcuadrático con Ventana de Contexto de 12M de Tokens

SubQ de Subquadratic es un LLM listo para producción construido sobre una arquitectura de atención dispersa totalmente subcuadrática. Maneja hasta 12 millones de tokens en una sola indicación, funciona a 150 tokens por segundo y cuesta aproximadamente 1/5 de los modelos líderes como GPT-5 u Opus.
Arquitectura y Benchmarks
A diferencia de los transformadores estándar con atención O(n²), SubQ utiliza un mecanismo de atención dispersa subcuadrático que solo procesa relaciones de tokens relevantes. Con 12 millones de tokens, esto reduce el cómputo de atención en casi 1000×. Benchmarks (validados por terceros):
- SWE-Bench Verified (codificación del mundo real): 81.8%
- RULER @ 128K (precisión en contexto largo): 95.0%
- MRCR v2 (8 agujas, 1M): 65.9%
Para comparar, la puntuación SWE-Bench de SubQ se sitúa entre Gemini 3.1 Pro (80.6%) y Opus 4.6 (80.8%). El modelo también supera a Opus 4.7 (87.6%? – no reportado en el momento) y GPT-5.5 (n/r) en MRCR v2.
Productos e Integración
Dos opciones de acceso:
- API de Contexto Completo: Contexto de 12M tokens, streaming, uso de herramientas, endpoints compatibles con OpenAI. Procesa repositorios enteros en una sola llamada a costo lineal.
- SubQ Code (capa de contexto largo para agentes de codificación): Conéctalo a Claude Code, Codex o Cursor. ~25% menos de factura, exploración 10× más rápida, redirige automáticamente turnos de modelos costosos. Instalación de una línea.
Para Quién Es
Desarrolladores y equipos que ejecutan agentes de IA que necesitan razonar sobre bases de código completas, historiales largos de PR o estado persistente sin pérdida de calidad.
📖 Lee la fuente completa: HN AI Agents
👀 Ver también

Claude Code Plugin Analiza el Desperdicio de Tokens y Anomalías Localmente
Un desarrollador creó un complemento de Claude Code que diagnostica el desperdicio de tokens detectando seis tipos de anomalías a partir de datos de sesiones locales. La herramienta analizó 8.392 sesiones y encontró 1.015 anomalías, siendo ExcessiveToolUse la más común.

Agente OpenClaw Adquiere Capacidad de Llamadas Telefónicas Mediante Habilidad Personalizada
Un desarrollador creó una habilidad personalizada para agentes OpenClaw autoalojados que permite la funcionalidad de llamadas telefónicas, permitiendo al agente iniciar llamadas basadas en desencadenantes como finalizaciones de compilación o caídas de servidores. La implementación proporciona interacción por voz con todas las capacidades de chat, incluyendo búsquedas web y configuración de alertas.

Qwen 3.6 27B con MTP en V100 32GB: 54 t/s mediante la rama de llama.cpp
La rama MTP de am17an en llama.cc ejecuta Qwen 3.6 27B a 54 t/s en una V100 32GB mediante adaptador PCIe, bajando a 29-30 t/s sin MTP.

Orc: Orquestrador de Código Abierto para Múltiples Proyectos con Agentes de IA
Orc es un orquestador a nivel de sistema operativo que coordina agentes de codificación de IA en múltiples proyectos usando bash, tmux y git worktrees. Aborda conflictos de fusión, trabajo duplicado y sobrecarga de coordinación con un sistema de revisión de dos niveles y cero consumo de tokens en la orquestación.