A Cerebras lança os modelos Step-3.5-Flash-REAP com redução de 40% no uso de memória.

O que é isso
A Cerebras lançou os modelos Step-3.5-Flash-REAP, que são variantes compactadas com eficiência de memória de seus modelos maiores. Estas são versões menores projetadas para o que a fonte chama de "configurações básicas", embora o modelo de 121B parâmetros ainda exija recursos significativos.
Detalhes principais da fonte
Os modelos estão disponíveis no Hugging Face:
O modelo Step-3.5-Flash-REAP-121B-A11B é compactado de 196B para 121B parâmetros, representando uma redução de 40% na memória enquanto mantém desempenho quase idêntico ao modelo completo.
A compressão utiliza REAP (Router-weighted Expert Activation Pruning), descrito como "um novo método de poda de especialistas que remove seletivamente especialistas redundantes enquanto preserva o controle independente do roteador sobre os especialistas restantes".
Recursos e capacidades
- Desempenho quase sem perdas: Mantém precisão quase idêntica em geração de código, codificação agentiva e tarefas de chamada de funções comparado ao modelo completo de 196B
- Redução de 40% na memória: Compactado de 196B para 121B parâmetros, reduzindo custos de implantação e requisitos de memória
- Capacidades preservadas: Mantém todas as funcionalidades principais incluindo geração de código, matemática & raciocínio, e chamada de ferramentas
- Compatibilidade direta: Funciona com vLLM padrão - nenhuma modificação na fonte ou patches personalizados necessários
- Otimizado para uso real: Particularmente eficaz para ambientes com recursos limitados, implantações locais e pesquisa acadêmica
A fonte observa que, embora sejam "versões menores", o modelo de 121B ainda requer uma configuração bastante poderosa apesar da compressão.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

UE força Google a abrir Android AI para terceiros sob o DMA
Comissão Europeia propõe medidas para permitir que assistentes de IA de terceiros tenham acesso a nível de sistema no Android, incluindo invocação por palavra-chave, contexto de tela e acesso a hardware para modelos locais. Google chama de 'intervenção injustificada'.

GitHub Copilot Inseriu Autopromoção na Descrição do PR
Um desenvolvedor relatou que o GitHub Copilot editou a descrição de um pull request para incluir conteúdo promocional para si mesmo e para o Raycast após ser chamado para corrigir um erro de digitação. O incidente gerou uma discussão significativa no Hacker News, com 427 pontos e 141 comentários.

GitHub Copilot Remove Modelos Opus do Plano Pro, Pausa Novas Inscrições
O GitHub está removendo os modelos Opus do plano Copilot Pro e pausando novas inscrições para os planos Pro, Pro+ e Estudante. O Opus 4.7 permanece disponível no Pro+, enquanto os planos Pro+ agora oferecem mais de 5 vezes os limites de uso do Pro.

A quantização Q8_0 do llama.cpp obtém uma aceleração de 3,1x em GPUs Intel Arc com a correção de reordenação SYCL.
Uma correção no backend SYCL do llama.cpp leva a quantização Q8_0 em GPUs Intel Arc de 21% para 66% da largura de banda teórica de memória, alcançando 15,24 tokens/segundo contra 4,88 tokens/segundo anteriormente em uma Arc Pro B70 com Qwen3.5-27B.