Qwen3 27B supera Gemma 4 26B em chamada de ferramentas no mundo real para pipeline de vídeo AI local

✍️ OpenClawRadar📅 Publicado: May 13, 2026🔗 Source
Ad

Durante o fim de semana, o All About AI publicou um tutorial detalhado de um pipeline de automação de vídeo 100% local no estilo Fireship. A principal descoberta: a confiabilidade das chamadas de ferramentas divergiu drasticamente entre os dois modelos testados.

Chamadas de Ferramentas: Qwen3 27B vs Gemma 4 26B

O Gemma 4 26B entrava repetidamente em loops de chamadas de ferramentas, desperdiçando tokens com raciocínios desnecessários. O Qwen3 (especificamente Qwen 3.6 27B?) lidou com a mesma orquestração de forma limpa, sem tokens de raciocínio desperdiçados. A diferença entre os números de benchmarks e o desempenho real em fluxos de trabalho de agentes é significativa—loops de chamadas de ferramentas consomem tempo e memória GPU.

Se você está executando uma pilha de chamadas de ferramentas (OpenClaw, Aider ou um loop personalizado), a escolha do modelo importa mais do que sugere os benchmarks sintéticos. O autor solicita explicitamente números de taxa de falha para chamadas de ferramentas do Qwen3 em comparação com DeepSeek V4 em pilhas específicas.

Ad

Geração de Imagens: Said Image Turbo

Para imagens, o pipeline usou Said Image Turbo do Hugging Face—pesos abertos, sem custos de API. Funciona bem para cartões estilo meme, mas para retratos você vai querer usar Flux ou Seedream.

Orquestração: OpenCode com 174K de Contexto

Todo o pipeline foi orquestrado com OpenCode. A janela de contexto atingiu 174K tokens, e a lista de tarefas não foi concluída em uma única passagem. O operador se afastou no meio do processo e voltou para um resultado parcial—um retrato honesto do estado atual das ferramentas autônomas de IA.

Executando Remotamente

Se você não pode executar um modelo de 27B localmente, o Qwen3 está disponível em vários provedores de inferência, oferecendo os mesmos pesos e comportamento de chamadas de ferramentas sem a necessidade de GPU upfront.

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also

Qwen 3.6 27B avaliado no DeepSWE: 2% de pontuação, 70 horas, 44k tokens médios de saída
News

Qwen 3.6 27B avaliado no DeepSWE: 2% de pontuação, 70 horas, 44k tokens médios de saída

Qwen 3.6 27B (FP8, cache KV BF16, contexto de 262k) obteve 2% no DeepSWE em 70 horas. A média de tokens de saída foi de 44k por tarefa — comparável a modelos maiores como Qwen 3.6 Plus. Executado em 1x RTX6000 Pro Blackwell via RunPod.

OpenClawRadar
Opus 4.6 Médio vs Baixo: Diferenças de Desempenho e Preços
News

Opus 4.6 Médio vs Baixo: Diferenças de Desempenho e Preços

O Opus 4.6 médio custa aproximadamente 50% a mais que a versão baixa, mas resolve problemas significativos de preguiça encontrados no modelo de baixa potência. A versão média fica entre a baixa e a alta nos benchmarks de desempenho.

OpenClawRadar
A remoção do CLI do OpenClaw 0.9 causa interrupção do agente
News

A remoção do CLI do OpenClaw 0.9 causa interrupção do agente

Um usuário relatou que tentar atualizar o OpenClaw por meio de um agente de IA resultou na remoção da CLI, quebrando os comandos do gateway e a funcionalidade do chat do Telegram. O OpenClaw 0.9 abandonou completamente a CLI, removendo comandos como 'openclaw gateway start' e 'openclaw status'.

OpenClawRadar
O Claude Code adiciona execução programada de tarefas para fluxos de trabalho automatizados.
News

O Claude Code adiciona execução programada de tarefas para fluxos de trabalho automatizados.

A Anthropic habilitou a execução agendada para o Claude Code, permitindo que desenvolvedores configurem tarefas uma vez e as executem automaticamente sem necessidade de solicitação manual. O recurso suporta revisões diárias de commits, auditorias de dependências, varreduras de logs de erro e revisões de PR.

OpenClawRadar