Steerling-8B: Um Modelo de Linguagem Interpretável com Atribuição em Nível de Token

✍️ OpenClawRadar📅 Publicado: February 24, 2026🔗 Source
Steerling-8B: Um Modelo de Linguagem Interpretável com Atribuição em Nível de Token
Ad

Arquitetura e Capacidades do Modelo

O Steerling-8B é construído sobre uma estrutura de modelo de difusão discreta causal que permite direcionar a geração através de sequências de múltiplos tokens, em vez de apenas no nível do próximo token. O design principal decompõe os embeddings do modelo em três caminhos explícitos: aproximadamente 33.000 conceitos "conhecidos" supervisionados, aproximadamente 100.000 conceitos "descobertos" que o modelo aprende por conta própria, e um componente residual que captura as informações restantes.

O modelo utiliza funções de perda de treinamento que garantem o roteamento do sinal através dos conceitos sem comprometer o desempenho fundamental. Os conceitos alimentam os logits através de um caminho linear, permitindo que cada previsão se decomponha exatamente em contribuições por conceito. Essas contribuições podem ser editadas no momento da inferência sem necessidade de retreinamento.

Métricas de Desempenho e Interpretabilidade

Apesar de ter sido treinado com significativamente menos recursos computacionais do que modelos comparáveis, o Steerling-8B alcança desempenho competitivo em benchmarks padrão. O modelo supera tanto o LLaMA2-7B quanto o Deepseek-7B na média geral, apesar de usar menos FLOPs, e permanece dentro do alcance de modelos treinados com 2 a 10 vezes mais recursos computacionais.

Em um conjunto de validação reservado, mais de 84% da contribuição em nível de token vem do módulo de conceitos, indicando que o modelo não está apenas usando o componente residual para fazer previsões. Quando o caminho residual é removido, o desempenho em várias tarefas do LM Harness mostra apenas um pequeno efeito, sugerindo que o sinal preditivo do modelo é em grande parte roteado através dos conceitos, em vez de canais ocultos.

O Steerling pode detectar conceitos conhecidos em texto com 96,2% de AU (Área Sob a Curva).

Ad

Recursos Práticos

Para qualquer grupo de tokens de saída que o Steerling gera, os usuários podem rastrear esses tokens até:

  • Contexto de entrada: Os tokens específicos do prompt que influenciaram a saída
  • Conceitos: Tópicos compreensíveis para humanos nas representações do modelo (tanto tom como "analítico, clínico" quanto conteúdo como "Metodologias de alteração genética")
  • Dados de treinamento: As fontes de dados de treinamento que impulsionaram a saída, mostrando distribuição entre fontes como ArXiv, Wikipedia e FLAN

O modelo permite alinhamento em tempo de inferência através do controle de conceitos, substituindo milhares de exemplos de treinamento de segurança por direcionamento explícito em nível de conceito. Também permite suprimir ou amplificar conceitos específicos no momento da inferência sem necessidade de retreinamento.

Artefatos Disponíveis

  • Pesos do modelo disponíveis no Hugging Face
  • Código complementar no GitHub
  • Pacote no PyPI

📖 Leia a fonte completa: HN AI Agents

Ad

👀 See Also

civStation: Interface VLM de Código Aberto para Controle por Linguagem Natural do Civilization VI
Tools

civStation: Interface VLM de Código Aberto para Controle por Linguagem Natural do Civilization VI

civStation é uma pilha de uso de computador de código aberto que permite o controle por voz e linguagem natural do Civilization VI, traduzindo comandos de estratégia de alto nível em ações de interface do usuário por meio de um loop de observação e execução baseado em VLM.

OpenClawRadar
Mantenha Minha Garra: Serviço de Backup para Espaços de Trabalho OpenClaw
Tools

Mantenha Minha Garra: Serviço de Backup para Espaços de Trabalho OpenClaw

Keep My Claw é um serviço de backup que criptografa os dados do workspace do OpenClaw localmente antes de enviar para o Cloudflare R2. Ele gerencia arquivos de memória, tarefas cron, habilidades, credenciais e snapshots de configuração com backups agendados e restaurações com um único comando.

OpenClawRadar
pxpipe: Reduza em 60% o uso de tokens do Claude Code ao renderizar contexto como imagens
Tools

pxpipe: Reduza em 60% o uso de tokens do Claude Code ao renderizar contexto como imagens

pxpipe é um proxy local que renderiza contextos volumosos (system prompts, documentações de ferramentas, histórico) em PNGs compactos, reduzindo tokens de entrada em ~10x e custos em ~60% em cargas de trabalho densas em tokens.

OpenClawRadar
TideSurf: Ferramenta de compressão DOM reduz uso de tokens de agentes web em 30 vezes, acelera TTFT em 12 vezes
Tools

TideSurf: Ferramenta de compressão DOM reduz uso de tokens de agentes web em 30 vezes, acelera TTFT em 12 vezes

O TideSurf v0.3 converte o DOM renderizado para um formato compactado semelhante a markdown, reduzindo o consumo de tokens em 32x em páginas do GitHub em comparação com o DOM bruto, enquanto adiciona 18 ferramentas interativas para agentes de LLM.

OpenClawRadar