DeepSeek-V4-Flash Torna o Controle de LLMs Prático para Modelos Locais

✍️ OpenClawRadar📅 Publicado: May 16, 2026🔗 Source
DeepSeek-V4-Flash Torna o Controle de LLMs Prático para Modelos Locais
Ad

O último post de Seen Goedecke argumenta que o DeepSeek-V4-Flash muda o cálculo para a direção de LLMs — a técnica de manipular ativações do modelo durante a inferência para guiar as saídas. O principal impulsionador é o DwarfStar, um fork simplificado do llama.cpp feito por antirez que roda apenas o DeepSeek-V4-Flash e incorpora a direção como um recurso de primeira classe.

O que é direção?

Direção extrai um conceito (como "responda de forma concisa") das ativações internas do modelo. Um método: alimente cem prompts duas vezes — uma vez normal, outra vez com "responda de forma concisa" anexado — depois subtraia as matrizes de ativação para obter um vetor de direção. Adicione esse vetor às ativações de qualquer prompt e o modelo se torna conciso. Uma abordagem mais avançada usa autoencoders esparsos (como os da Anthropic) para aprender padrões de características, a um custo maior.

Ad

Por que isso importa

Direção promete controle direto sobre o comportamento do modelo sem engenharia de prompt. Em vez de escrever qualificadores "você DEVE", você teria um controle deslizante para concisão ou conscienciosidade. Também é fascinante do ponto de vista da interpretabilidade — pense na fixação do Golden Gate Claude, mas sua para ajustar.

Por que não antes?

Direção tem sido uma ideia de classe média: muito grosseira para grandes laboratórios (eles apenas retreinam o modelo) e inacessível para usuários de API (sem acesso a pesos ou ativações). Modelos de pesos abertos eram muito fracos para se preocupar — até o DeepSeek-V4-Flash, que é forte o suficiente para codificação agêntica. Mesmo assim, o prompting muitas vezes supera a direção para características simples como verbosidade; a verdadeira vantagem é direcionar um conceito não-promptável como inteligência.

Goedecke planeja acompanhar o DwarfStar de perto. No momento da escrita, seu suporte a direção é rudimentar (apenas um alternador de verbosidade semelhante a prompting), mas o lançamento foi há apenas oito dias.

📖 Leia a fonte completa: HN LLM Tools

Ad

👀 See Also

Qwen3.6 27B FP8 roda 200k tokens BF16 KV Cache a 80 TPS em RTX 5000 PRO 48GB
News

Qwen3.6 27B FP8 roda 200k tokens BF16 KV Cache a 80 TPS em RTX 5000 PRO 48GB

Um usuário do Reddit compartilha uma configuração vLLM para Qwen3.6 27B FP8 com cache KV BF16 em 200k tokens, atingindo 60-90 TPS em uma única RTX 5000 PRO 48GB. Variáveis de ambiente completas, configuração e resultados de benchmark são fornecidos.

OpenClawRadar
🦀
News

Definindo 'Psicose de IA Prolífica': Quando a Alta Produção de IA Destrói o Valor

O psiquiatra Jeff Clark, MD, define 'psicose de IA prolífica' — gerar uma saída massiva de IA (milhares de linhas de código por dia) sem aumentar o valor real, porque você não consegue avaliar o próprio trabalho.

OpenClawRadar
Acesso à IA de Fronteira se Aperta: O Mito da Anthropic e a Mudança Estrutural para Lançamentos Seletivos
News

Acesso à IA de Fronteira se Aperta: O Mito da Anthropic e a Mudança Estrutural para Lançamentos Seletivos

O modelo de cibersegurança Mythos da Anthropic e a iniciativa Daybreak da OpenAI sinalizam uma nova era em que restrições econômicas e de segurança limitam a IA de ponta a empresas selecionadas sediadas nos EUA, impulsionadas por riscos de uso indevido, ameaças de destilação e controles governamentais emergentes.

OpenClawRadar
Plataforma de IA da Palantir é Usada para Rastreamento de Ajuda a Gaza no Centro de Coordenação Liderado pelos EUA
News

Plataforma de IA da Palantir é Usada para Rastreamento de Ajuda a Gaza no Centro de Coordenação Liderado pelos EUA

A Palantir Technologies mantém uma mesa permanente no Centro de Coordenação Civil-Militar liderado pelos EUA no sul de Israel, fornecendo a arquitetura tecnológica para rastrear a entrega e distribuição de ajuda a Gaza por meio de vigilância por drones e integração de dados.

OpenClawRadar