Modelo Subquadratic estreia janela de contexto de 12 milhões de tokens para modelos de IA

A Subquadratic anunciou uma janela de contexto de 12 milhões de tokens, afirmando um avanço nos mecanismos de atenção subquadrática. Isso se compara às janelas típicas de 128K-1M tokens em modelos atuais. A técnica permite que os modelos lidem com contextos vastamente maiores sem o escalonamento quadrático de computação ou memória.
Detalhes Principais
- Janela de contexto: 12 milhões de tokens (12x maior que os 128K tokens do GPT-4)
- Baseada em atenção subquadrática, provavelmente usando complexidade linear ou quase linear no comprimento da sequência
- Permite processar codebases grandes inteiras, documentos longos ou transcrições de vídeos de várias horas em uma única passagem direta
- Aplicações potenciais: revisão de código de repositórios inteiros, análise de documentos longos, diálogo de múltiplas voltas com histórico completo
- Compatível com LLMs existentes baseados em transformadores via substituição de atenção plug-and-play
A abordagem reduz a atenção O(n²) para quase O(n) usando técnicas como modelos de espaço de estados ou fatorações de baixo posto. Nenhum número de benchmark específico é fornecido na fonte, mas a alegação é que isso torna as janelas de 12M tokens práticas em uma única GPU.
Para Quem é
Engenheiros de IA que trabalham com análise de código, processamento de documentos ou qualquer tarefa que exija compreensão de contexto longo sem chunking ou recuperação caros.
📖 Leia a fonte completa: HN AI Agents
👀 See Also

O Desenvolvimento de IA da Uber Enfrenta Restrições Orçamentárias Apesar de Investimento de US$ 3,4 Bilhões
As iniciativas de IA da Uber estão encontrando limitações orçamentárias de acordo com seu CTO, apesar da empresa ter alocado US$ 3,4 bilhões para esses esforços. O artigo discute os desafios de escalar o desenvolvimento de IA dentro das restrições financeiras.

Claude Code v2.1.133: reversão de worktree.baseRef, caminhos de sandbox, correção de proxy para MCP OAuth
Anthropic lança a versão v2.1.133 do Claude Code CLI com uma nova configuração worktree.baseRef padrão para fresh (ramo a partir de origin/default), sandbox.bwrapPath e sandbox.socatPath para binários customizados de bubblewrap/socat, correção de proxy/mTLS para o fluxo OAuth do MCP e várias correções de bugs.
Qwen3 27B supera Gemma 4 26B em chamada de ferramentas no mundo real para pipeline de vídeo AI local
Um experimento de pipeline de vídeo com IA local mostra o Qwen3 27B lidando com chamadas de ferramentas de forma limpa, enquanto o Gemma 4 26B entrava em loops. Também aborda Said Image Turbo para geração local de imagens e orquestração OpenCode atingindo 174K de contexto.

Investigação: Agentes do Claude Code Expondo Conteúdo Não Verificado do MEMORY.md Devido a Mudanças de Compactação
Um usuário relata que os agentes do Claude Code estão exibindo conteúdo do MEMORY.md sem reverificá-lo no meio da tarefa, relacionado a mudanças na compactação nas versões 2.1.139 e 2.1.141. Dois fatores agravantes: preservação agressiva de 'instruções do usuário' e um bug nos limites de autocompactação.