Subquadratic presenta una ventana de contexto de 12 millones de tokens para modelos de IA

Subquadratic ha anunciado una ventana de contexto de 12 millones de tokens, afirmando un avance en mecanismos de atención subcuadráticos. Esto se compara con ventanas típicas de 128K-1M tokens en modelos actuales. La técnica permite que los modelos manejen contextos mucho más grandes sin escalamiento cuadrático de cómputo o memoria.
Detalles clave
- Ventana de contexto: 12 millones de tokens (12 veces más grande que los 128K tokens de GPT-4)
- Basada en atención subcuadrática, probablemente usando complejidad lineal o casi lineal en la longitud de la secuencia
- Permite procesar bases de código completas, documentos largos o transcripciones de video de varias horas en una sola pasada hacia adelante
- Aplicaciones potenciales: revisión de repositorios completos, análisis de documentos largos, diálogo multi-turno con historial completo
- Compatible con LLMs existentes basados en transformadores mediante reemplazo de atención plug-and-play
El enfoque reduce la atención O(n²) a casi O(n) usando técnicas como modelos de espacio de estados o factorizaciones de bajo rango. No se proporcionan números de referencia específicos en la fuente, pero se afirma que esto hace que las ventanas de 12M tokens sean prácticas en una sola GPU.
Para quién es
Ingenieros de IA que trabajan en análisis de código, procesamiento de documentos o cualquier tarea que requiera comprensión de contextos largos sin fragmentación costosa o recuperación.
📖 Leer la fuente completa: HN AI Agents
👀 Ver también

Investigación: Los agentes de Claude Code muestran contenido de MEMORY.md no verificado debido a cambios de compactación
Un usuario informa que los agentes de Claude Code están mostrando contenido de MEMORY.md sin volver a verificarlo a mitad de la tarea, relacionado con cambios en la compactación en las versiones 2.1.139 y 2.1.141. Dos factores agravantes: la conservación agresiva de las 'instrucciones del usuario' y un error en los umbrales de autocompactación.

Los usuarios reportan que Sonnet 4.6 supera a Opus 4.6 en tareas prácticas de programación.
Un desarrollador que probó los modelos de IA Claude descubrió que Opus 4.6 producía soluciones sobreingenierizadas con brechas de rendimiento, mientras que Sonnet 4.6 ofrecía correcciones más cuidadosas y eficientes con menor uso de tokens.

NVIDIA DGX Spark Community lanza Spark Arena para benchmarks reproducibles de LLM.
La comunidad NVIDIA DGX Spark ha lanzado Spark Arena, una tabla de clasificación reproducible para el rendimiento de LLM de pesos abiertos utilizando herramientas y metodología estandarizadas, con los mejores resultados actuales que incluyen gpt-oss-120b y Qwen3-Coder-Next.

Los ingenieros chinos de IA son los nuevos actores poderosos de Silicon Valley
Una periodista integrada en una casa compartida en Los Altos explora la comunidad de investigadores chinos de IA en Silicon Valley, describiendo paquetes de compensación de $200 millones, su intensa ética de trabajo y las fiestas en casa donde establecen contactos.