Qwen3 27B supera Gemma 4 26B em chamada de ferramentas no mundo real para pipeline de vídeo AI local

✍️ OpenClawRadar📅 Publicado: May 13, 2026🔗 Source
Ad

Durante o fim de semana, o All About AI publicou um tutorial detalhado de um pipeline de automação de vídeo 100% local no estilo Fireship. A principal descoberta: a confiabilidade das chamadas de ferramentas divergiu drasticamente entre os dois modelos testados.

Chamadas de Ferramentas: Qwen3 27B vs Gemma 4 26B

O Gemma 4 26B entrava repetidamente em loops de chamadas de ferramentas, desperdiçando tokens com raciocínios desnecessários. O Qwen3 (especificamente Qwen 3.6 27B?) lidou com a mesma orquestração de forma limpa, sem tokens de raciocínio desperdiçados. A diferença entre os números de benchmarks e o desempenho real em fluxos de trabalho de agentes é significativa—loops de chamadas de ferramentas consomem tempo e memória GPU.

Se você está executando uma pilha de chamadas de ferramentas (OpenClaw, Aider ou um loop personalizado), a escolha do modelo importa mais do que sugere os benchmarks sintéticos. O autor solicita explicitamente números de taxa de falha para chamadas de ferramentas do Qwen3 em comparação com DeepSeek V4 em pilhas específicas.

Ad

Geração de Imagens: Said Image Turbo

Para imagens, o pipeline usou Said Image Turbo do Hugging Face—pesos abertos, sem custos de API. Funciona bem para cartões estilo meme, mas para retratos você vai querer usar Flux ou Seedream.

Orquestração: OpenCode com 174K de Contexto

Todo o pipeline foi orquestrado com OpenCode. A janela de contexto atingiu 174K tokens, e a lista de tarefas não foi concluída em uma única passagem. O operador se afastou no meio do processo e voltou para um resultado parcial—um retrato honesto do estado atual das ferramentas autônomas de IA.

Executando Remotamente

Se você não pode executar um modelo de 27B localmente, o Qwen3 está disponível em vários provedores de inferência, oferecendo os mesmos pesos e comportamento de chamadas de ferramentas sem a necessidade de GPU upfront.

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also

Os 100.000 Porquês da IA: Como a Saída Quase-Determinística dos LLMs Cria Efeitos Reveladores
News

Os 100.000 Porquês da IA: Como a Saída Quase-Determinística dos LLMs Cria Efeitos Reveladores

lcamtuf argumenta que a saída de LLMs se distingue da escrita humana não por maneirismos individuais, mas pela repetição quase determinística dos mesmos padrões complexos em muitos prompts. As capas de livros da Amazon para '100000 porquês' ilustram o ponto.

OpenClawRadar
RTX 4090 vs H100 para Ajuste Fino do Llama-3-8B: Uma Comparação de Custo-Desempenho
News

RTX 4090 vs H100 para Ajuste Fino do Llama-3-8B: Uma Comparação de Custo-Desempenho

Um desenvolvedor testou o fine-tuning do Llama-3-8B tanto em uma RTX 4090 quanto em instâncias alugadas de H100. A configuração da 4090 custou US$ 2.000 de entrada e levou 24 horas, enquanto o aluguel do H100 custou cerca de US$ 80 e foi concluído em 4 horas.

OpenClawRadar
Bram Cohen critica o 'vibe coding' e as práticas de desenvolvimento assistidas por IA
News

Bram Cohen critica o 'vibe coding' e as práticas de desenvolvimento assistidas por IA

Bram Cohen argumenta que a 'programação por vibração' — onde desenvolvedores evitam olhar para o código enquanto usam assistentes de IA — leva a uma baixa qualidade de software, usando o vazamento do código-fonte do Claude como exemplo dos problemas do dogfooding excessivo.

OpenClawRadar
O Teste Noturno da Garra Aberta: Um Salto à Frente na Automação de IA
News

O Teste Noturno da Garra Aberta: Um Salto à Frente na Automação de IA

O Teste Noturno Open Claw demonstra o potencial dos agentes de codificação alimentados por IA, transformando o processamento noturno em automação perfeita. Explore as principais conclusões e discussões da comunidade r/openclaw.

OpenClawRadar