Correção da velocidade de processamento de prompts no Llama.cpp usando o parâmetro --ubatch-size

Otimização de processamento de prompts no Llama.cpp
Um usuário do Reddit compartilhou sua experiência otimizando a velocidade de processamento de prompts no Llama.cpp ao trabalhar com modelos maiores como Qwen 27B. Eles descobriram que ajustar o parâmetro --ubatch-size melhorou significativamente o desempenho.
Principais descobertas
O usuário experimentou com o parâmetro --ubatch-size após ter dificuldade para entender sua função na documentação e obter resultados mistos de assistentes de IA. Eles estavam "ajustando medidores" por diversão e usaram tentativa e erro para encontrar configurações ideais.
Para sua GPU Radeon 9070XT com 64MB de cache L3, definir --ubatch-size para 64 resultou em melhorias dramáticas de velocidade:
- O processamento de prompts se tornou "realmente utilizável para invocação de código Claude"
- O desempenho ficou "incrivelmente rápido" comparado a valores mais altos
- Eles notaram ruído de bobina da GPU ao encontrar a configuração ideal
O valor padrão de --ubatch-size parece ser 512, que o usuário descobriu gerar resultados ruins quando deixado sem ajuste. Eles reconheceram que isso pode ser óbvio para usuários mais experientes, mas compartilharam suas descobertas para ajudar outros que possam ter dificuldades semelhantes.
Esta abordagem de otimização envolve corresponder o parâmetro --ubatch-size ao tamanho específico do cache L3 da sua GPU em megabytes, o que pode ser particularmente benéfico ao trabalhar com modelos de linguagem maiores que exigem gerenciamento eficiente de memória durante o processamento de prompts.
📖 Read the full source: r/LocalLLaMA
👀 See Also

Impondo a Conformidade de Agentes de IA: Abordagens Baseadas em Linguagem e Ferramentas
Um desenvolvedor compartilha métodos práticos para melhorar a conformidade de agentes de IA, incluindo o uso de linguagem negativa em instruções iniciais e a mudança de regras flexíveis para ferramentas codificadas quando necessário.

Os Agentes de Código Claude Não Lêem Automaticamente a Documentação do Projeto
Quando o Claude Code despacha subagentes como o Sonnet para escrever código, esses agentes veem apenas o que está explicitamente incluído em seu prompt e não leem automaticamente os arquivos CLAUDE.md, MEMORY.md ou outros arquivos de contexto do projeto, a menos que sejam especificamente instruídos a fazê-lo.

Inclua os resumos de projeto do Claude no seu repositório — eles são melhores que documentos humanos
Um desenvolvedor sugere commit de resumos de projetos gerados pelo Claude ao seu repositório. Eles são bons o suficiente, levam segundos para gerar e podem ajudar futuros leitores.

OpenClaw v2026.3.13 adiciona configuração de cacheRetention por agente para economia de custos com tokens da OpenAI.
O OpenClaw v2026.3.13 adiciona a configuração cacheRetention por agente que habilita a retenção de cache de prompt de 24 horas da OpenAI, potencialmente reduzindo os custos de tokens de entrada em até 90% para agentes com ciclos de heartbeat maiores que 10 minutos.