Localizador de Circuitos LLM: Duplique 3 camadas para aumentar o raciocínio sem treinamento

✍️ OpenClawRadar📅 Publicado: March 19, 2026🔗 Source
Localizador de Circuitos LLM: Duplique 3 camadas para aumentar o raciocínio sem treinamento
Ad

O kit de ferramentas llm-circuit-finder implementa e estende o método RYS de David Ng para descobrir e explorar 'circuitos de raciocínio' ocultos dentro de modelos de transformadores. A descoberta principal: certos blocos contíguos de camadas atuam como unidades cognitivas indivisíveis. Duplicá-los na passagem direta - mesmos pesos, sem treinamento, sem fusão - torna os modelos mensuravelmente mais inteligentes em capacidades específicas.

Resultados Principais

Devstral-Small-2-24B com camadas 12, 13, 14 duplicadas uma vez:

  • BBH Dedução Lógica: 0,22 → 0,76 (+245%)
  • GSM8K (rigoroso): 0,48 → 0,64 (+33%)
  • MBPP (geração de código): 0,72 → 0,78 (+8%)
  • Melhoria média: +8% em todas as métricas sem degradação

Qwen2.5-Coder-32B com camadas 7, 8, 9 duplicadas uma vez:

  • Sonda de raciocínio (causal + lógica + navegação): 76,5% → 94,1% (+23%)

Como Funciona

Transformadores se organizam durante o treinamento em circuitos funcionais - unidades de processamento multicamadas que realizam operações cognitivas completas. Esses circuitos são indivisíveis: duplicar uma única camada faz quase nada, mas duplicar o bloco certo de 3-4 camadas dá ao modelo uma segunda passagem por seu pipeline de raciocínio.

Diferentes modelos têm circuitos diferentes em lugares diferentes:

  • Devstral-24B (40 camadas): circuito de raciocínio nas camadas 12-14
  • Qwen2.5-32B (64 camadas): circuito de raciocínio nas camadas 7-9

Os limites são nítidos. Deslocar o bloco por uma camada em qualquer direção faz a melhoria desaparecer ou inverter.

Ad

Diferentes Padrões de Duplicação Criam Diferentes Modos

Mesmos pesos no disco, mesma VRAM para o modelo base, apenas roteamento diferente:

  • Dupla passagem 13-16: Matemática ↑↑, EQ ↑
  • Tripla passagem 13-16: Matemática ↑, EQ ↑↑
  • Intercalado 13,13,14,14,15,15,16: Matemática ↑↑↑, EQ ↓ (modo matemática pura)
  • Quádrupla passagem 13-16: Matemática —, EQ ↑↑ (modo EQ, matemática neutra)

Início Rápido

Encontre circuitos no seu modelo:

pip install gguf requests tqdm
python sweep.py \
  --model /caminho/para/modelo.gguf \
  --llama-server /caminho/para/llama-server \
  --tmpdir /dev/shm/rys \
  --results pass.jsonl \
  --block-sizes 3 4 5 \
  --stride 1 \
  --start-min 10 --start-max 20 \
  --skip-baseline \
  --port 8099 \
  --server-args --device Vulkan1,Vulkan2

Aplique um circuito conhecido:

# Duplicar camadas 12-14 no Devstral
python layer_path.py modelo.gguf melhorado.gguf \
  -p " 0..14,12,13,14,15..39 " -v

Duplicar camadas 7-9 no Qwen2.5-32B

python layer_path.py modelo.gguf melhorado.gguf
-p " 0..9,7,8,9,10..63 " -v

Exemplo de tripla passagem

python layer_path.py modelo.gguf experimento.gguf
-p " 0..16,13,14,15,16,13,14,15,16,17..39 " -v

Valide com benchmarks estabelecidos:

# Inicie o servidor com modelo modificado
llama-server -m melhorado.gguf --port 8089 -ngl 99 --device Vulkan1,Vulkan2
# Execute lm-evaluation-harness

Todo o processo de descoberta - varredura, descoberta, validação - foi feito em duas GPUs de consumo AMD (RX 7900 XT + RX 6950 XT) em uma noite.

📖 Leia a fonte completa: HN LLM Tools

Ad

👀 See Also

Reutilização de Cache KV para Conversas Longas no Apple Silicon Oferece Aceleração de 200x
Tools

Reutilização de Cache KV para Conversas Longas no Apple Silicon Oferece Aceleração de 200x

Um desenvolvedor implementou a reutilização de cache KV baseada em sessão para inferência de LLM local usando o framework MLX da Apple, alcançando uma melhoria de 200x no tempo para o primeiro token em contextos de 100K tokens. A abordagem mantém o cache KV na memória entre as voltas da conversa, processando apenas os novos tokens.

OpenClawRadar
Google Lança Sashiko: Agente de Revisão de Código com IA para Patches do Kernel Linux
Tools

Google Lança Sashiko: Agente de Revisão de Código com IA para Patches do Kernel Linux

Engenheiros do Google disponibilizaram como código aberto o Sashiko, um sistema de revisão de código com IA agentiva projetado para o kernel Linux. Ele encontrou 53% dos bugs em um conjunto não filtrado de 1.000 problemas recentes do upstream que foram perdidos por revisores humanos.

OpenClawRadar
O desenvolvedor cria um agente de pesquisa de IA local que gera podcasts a partir de tópicos ou links do YouTube
Tools

O desenvolvedor cria um agente de pesquisa de IA local que gera podcasts a partir de tópicos ou links do YouTube

Um desenvolvedor criou um agente de IA totalmente local que recebe tópicos ou links do YouTube e gera relatórios aprofundados, roteiros de podcasts conversacionais e áudio. O sistema pesquisa dinamicamente, extrai insights, refina resumos e cria conversas naturais de ida e volta.

OpenClawRadar
O servidor TOON MCP reduz os tokens de resultado de ferramentas em 30-60% no OpenClaw.
Tools

O servidor TOON MCP reduz os tokens de resultado de ferramentas em 30-60% no OpenClaw.

Um servidor MCP que comprime resultados estruturados de ferramentas JSON no formato TOON pode reduzir o uso de tokens em 30-60% para dados tabulares como consultas de banco de dados e respostas de API, ajudando a adiar a compactação da janela de contexto em sessões do OpenClaw.

OpenClawRadar