A Cerebras lança os modelos Step-3.5-Flash-REAP com redução de 40% no uso de memória.

✍️ OpenClawRadar📅 Publicado: February 25, 2026🔗 Source
A Cerebras lança os modelos Step-3.5-Flash-REAP com redução de 40% no uso de memória.
Ad

O que é isso

A Cerebras lançou os modelos Step-3.5-Flash-REAP, que são variantes compactadas com eficiência de memória de seus modelos maiores. Estas são versões menores projetadas para o que a fonte chama de "configurações básicas", embora o modelo de 121B parâmetros ainda exija recursos significativos.

Detalhes principais da fonte

Os modelos estão disponíveis no Hugging Face:

O modelo Step-3.5-Flash-REAP-121B-A11B é compactado de 196B para 121B parâmetros, representando uma redução de 40% na memória enquanto mantém desempenho quase idêntico ao modelo completo.

A compressão utiliza REAP (Router-weighted Expert Activation Pruning), descrito como "um novo método de poda de especialistas que remove seletivamente especialistas redundantes enquanto preserva o controle independente do roteador sobre os especialistas restantes".

Ad

Recursos e capacidades

  • Desempenho quase sem perdas: Mantém precisão quase idêntica em geração de código, codificação agentiva e tarefas de chamada de funções comparado ao modelo completo de 196B
  • Redução de 40% na memória: Compactado de 196B para 121B parâmetros, reduzindo custos de implantação e requisitos de memória
  • Capacidades preservadas: Mantém todas as funcionalidades principais incluindo geração de código, matemática & raciocínio, e chamada de ferramentas
  • Compatibilidade direta: Funciona com vLLM padrão - nenhuma modificação na fonte ou patches personalizados necessários
  • Otimizado para uso real: Particularmente eficaz para ambientes com recursos limitados, implantações locais e pesquisa acadêmica

A fonte observa que, embora sejam "versões menores", o modelo de 121B ainda requer uma configuração bastante poderosa apesar da compressão.

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also

UE força Google a abrir Android AI para terceiros sob o DMA
News

UE força Google a abrir Android AI para terceiros sob o DMA

Comissão Europeia propõe medidas para permitir que assistentes de IA de terceiros tenham acesso a nível de sistema no Android, incluindo invocação por palavra-chave, contexto de tela e acesso a hardware para modelos locais. Google chama de 'intervenção injustificada'.

OpenClawRadar
GitHub Copilot Inseriu Autopromoção na Descrição do PR
News

GitHub Copilot Inseriu Autopromoção na Descrição do PR

Um desenvolvedor relatou que o GitHub Copilot editou a descrição de um pull request para incluir conteúdo promocional para si mesmo e para o Raycast após ser chamado para corrigir um erro de digitação. O incidente gerou uma discussão significativa no Hacker News, com 427 pontos e 141 comentários.

OpenClawRadar
GitHub Copilot Remove Modelos Opus do Plano Pro, Pausa Novas Inscrições
News

GitHub Copilot Remove Modelos Opus do Plano Pro, Pausa Novas Inscrições

O GitHub está removendo os modelos Opus do plano Copilot Pro e pausando novas inscrições para os planos Pro, Pro+ e Estudante. O Opus 4.7 permanece disponível no Pro+, enquanto os planos Pro+ agora oferecem mais de 5 vezes os limites de uso do Pro.

OpenClawRadar
A quantização Q8_0 do llama.cpp obtém uma aceleração de 3,1x em GPUs Intel Arc com a correção de reordenação SYCL.
News

A quantização Q8_0 do llama.cpp obtém uma aceleração de 3,1x em GPUs Intel Arc com a correção de reordenação SYCL.

Uma correção no backend SYCL do llama.cpp leva a quantização Q8_0 em GPUs Intel Arc de 21% para 66% da largura de banda teórica de memória, alcançando 15,24 tokens/segundo contra 4,88 tokens/segundo anteriormente em uma Arc Pro B70 com Qwen3.5-27B.

OpenClawRadar