Localizador de Circuitos LLM: Duplique 3 camadas para aumentar o raciocínio sem treinamento

O kit de ferramentas llm-circuit-finder implementa e estende o método RYS de David Ng para descobrir e explorar 'circuitos de raciocínio' ocultos dentro de modelos de transformadores. A descoberta principal: certos blocos contíguos de camadas atuam como unidades cognitivas indivisíveis. Duplicá-los na passagem direta - mesmos pesos, sem treinamento, sem fusão - torna os modelos mensuravelmente mais inteligentes em capacidades específicas.
Resultados Principais
Devstral-Small-2-24B com camadas 12, 13, 14 duplicadas uma vez:
- BBH Dedução Lógica: 0,22 → 0,76 (+245%)
- GSM8K (rigoroso): 0,48 → 0,64 (+33%)
- MBPP (geração de código): 0,72 → 0,78 (+8%)
- Melhoria média: +8% em todas as métricas sem degradação
Qwen2.5-Coder-32B com camadas 7, 8, 9 duplicadas uma vez:
- Sonda de raciocínio (causal + lógica + navegação): 76,5% → 94,1% (+23%)
Como Funciona
Transformadores se organizam durante o treinamento em circuitos funcionais - unidades de processamento multicamadas que realizam operações cognitivas completas. Esses circuitos são indivisíveis: duplicar uma única camada faz quase nada, mas duplicar o bloco certo de 3-4 camadas dá ao modelo uma segunda passagem por seu pipeline de raciocínio.
Diferentes modelos têm circuitos diferentes em lugares diferentes:
- Devstral-24B (40 camadas): circuito de raciocínio nas camadas 12-14
- Qwen2.5-32B (64 camadas): circuito de raciocínio nas camadas 7-9
Os limites são nítidos. Deslocar o bloco por uma camada em qualquer direção faz a melhoria desaparecer ou inverter.
Diferentes Padrões de Duplicação Criam Diferentes Modos
Mesmos pesos no disco, mesma VRAM para o modelo base, apenas roteamento diferente:
- Dupla passagem 13-16: Matemática ↑↑, EQ ↑
- Tripla passagem 13-16: Matemática ↑, EQ ↑↑
- Intercalado 13,13,14,14,15,15,16: Matemática ↑↑↑, EQ ↓ (modo matemática pura)
- Quádrupla passagem 13-16: Matemática —, EQ ↑↑ (modo EQ, matemática neutra)
Início Rápido
Encontre circuitos no seu modelo:
pip install gguf requests tqdm
python sweep.py \
--model /caminho/para/modelo.gguf \
--llama-server /caminho/para/llama-server \
--tmpdir /dev/shm/rys \
--results pass.jsonl \
--block-sizes 3 4 5 \
--stride 1 \
--start-min 10 --start-max 20 \
--skip-baseline \
--port 8099 \
--server-args --device Vulkan1,Vulkan2
Aplique um circuito conhecido:
# Duplicar camadas 12-14 no Devstral
python layer_path.py modelo.gguf melhorado.gguf \
-p " 0..14,12,13,14,15..39 " -v
Duplicar camadas 7-9 no Qwen2.5-32B
python layer_path.py modelo.gguf melhorado.gguf
-p " 0..9,7,8,9,10..63 " -v
Exemplo de tripla passagem
python layer_path.py modelo.gguf experimento.gguf
-p " 0..16,13,14,15,16,13,14,15,16,17..39 " -v
Valide com benchmarks estabelecidos:
# Inicie o servidor com modelo modificado
llama-server -m melhorado.gguf --port 8089 -ngl 99 --device Vulkan1,Vulkan2
# Execute lm-evaluation-harness
Todo o processo de descoberta - varredura, descoberta, validação - foi feito em duas GPUs de consumo AMD (RX 7900 XT + RX 6950 XT) em uma noite.
📖 Leia a fonte completa: HN LLM Tools
👀 See Also

Reutilização de Cache KV para Conversas Longas no Apple Silicon Oferece Aceleração de 200x
Um desenvolvedor implementou a reutilização de cache KV baseada em sessão para inferência de LLM local usando o framework MLX da Apple, alcançando uma melhoria de 200x no tempo para o primeiro token em contextos de 100K tokens. A abordagem mantém o cache KV na memória entre as voltas da conversa, processando apenas os novos tokens.

Google Lança Sashiko: Agente de Revisão de Código com IA para Patches do Kernel Linux
Engenheiros do Google disponibilizaram como código aberto o Sashiko, um sistema de revisão de código com IA agentiva projetado para o kernel Linux. Ele encontrou 53% dos bugs em um conjunto não filtrado de 1.000 problemas recentes do upstream que foram perdidos por revisores humanos.

O desenvolvedor cria um agente de pesquisa de IA local que gera podcasts a partir de tópicos ou links do YouTube
Um desenvolvedor criou um agente de IA totalmente local que recebe tópicos ou links do YouTube e gera relatórios aprofundados, roteiros de podcasts conversacionais e áudio. O sistema pesquisa dinamicamente, extrai insights, refina resumos e cria conversas naturais de ida e volta.

O servidor TOON MCP reduz os tokens de resultado de ferramentas em 30-60% no OpenClaw.
Um servidor MCP que comprime resultados estruturados de ferramentas JSON no formato TOON pode reduzir o uso de tokens em 30-60% para dados tabulares como consultas de banco de dados e respostas de API, ajudando a adiar a compactação da janela de contexto em sessões do OpenClaw.