Interface de Usuário e Servidor para Autoencoders de Linguagem Natural da Anthropic no llama.cpp
Os primeiros modelos de peso aberto da Anthropic, os Autoencoders de Linguagem Natural (NLAs), são refinamentos de arquiteturas populares de peso aberto. Como não modificam a arquitetura subjacente do modelo nem o código de modelagem, a inferência com llama.cpp é direta. Um desenvolvedor empacotou todos os recursos dos NLAs — extração de ativação, explicação de ativação, reconstrução de ativação e direcionamento por edição de explicação — em um servidor llama.cpp personalizado, em conjunto com uma interface Mikupad para explicação e direcionamento de ativação no nível de token.
Principais Recursos
- Extração de ativação: Extrai ativações internas de qualquer camada do modelo base.
- Explicação de ativação: Obtém explicações legíveis para humanos das ativações extraídas.
- Reconstrução de ativação: Reconstrói ativações a partir de suas explicações.
- Direcionamento por edição de explicação: Modifica explicações e direciona a saída do modelo de acordo.
Detalhes Técnicos
O servidor é construído sobre o llama.cpp e requer o carregamento simultâneo de três modelos: o modelo base, o modelo ator e o modelo crítico. Esta é uma configuração intensiva em memória. O desenvolvedor está trabalhando em uma versão baseada em LoRA que permitiria carregar um único modelo na memória, reduzindo significativamente a pegada de memória.
A interface Mikupad fornece uma interface no nível de token para explicação e direcionamento de ativação. Você pode inspecionar quais tokens ativam determinados recursos e ajustar o comportamento do modelo editando explicações em tempo real.
Primeiros Passos
O código-fonte e as instruções de configuração estão disponíveis no Reddit. Atualmente, você precisa ter os três checkpoints do modelo NLA (base, ator, crítico) e compilar o servidor llama.cpp personalizado. A versão LoRA está por vir.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

Conectando o OpenClaw ao Qwen2.5 Coder: Viabilidade e Considerações
Explore a possibilidade de conectar o OpenClaw a um modelo local Qwen2.5 Coder com 7 bilhões de parâmetros para lidar com os limites de taxa da API Gemini 3.

Localizador de Circuitos LLM: Duplique 3 camadas para aumentar o raciocínio sem treinamento
Um novo kit de ferramentas encontra 'circuitos de raciocínio' em modelos de transformadores - blocos contíguos de 3-4 camadas que atuam como unidades cognitivas indivisíveis. Duplicar esses blocos (camadas 12-14 no Devstral-24B) melhora a dedução lógica de 0,22 para 0,76 nos benchmarks BBH sem alterações de pesos ou treinamento.

Ferramenta Gratuita de Teste de Autenticação de Bot Web da Fingerprint para Desenvolvedores de Agentes de IA
A Fingerprint lançou um endpoint público e gratuito para testar implementações de Web Bot Auth. A ferramenta valida assinaturas criptográficas em requisições HTTP, ajudando desenvolvedores de bots e agentes de IA a garantir que sua configuração WBA funcione corretamente antes de ir para produção.

Mascote Clawd Impresso em 3D com Mochi Bot Alimentado por ESP32
Um desenvolvedor criou um Clawd 3D físico inspirado no mascote do Claude Code, com um bot Mochi baseado em ESP32 e uma pequena tela. Arquivos e código disponíveis no MakerWorld e no GitHub.