Bug no Template de Chat do Gemma 4: Parâmetros de Ferramenta com anyOf/null Renderizados como Tipo Vazio

Um usuário do Reddit descobriu que o Gemma 4 (gemma-4-31B-it) não consegue analisar parâmetros de ferramentas que usam o padrão JSON Schema anyOf: [$ref, null] — um padrão comum para referências de objetos anuláveis. O template de chat padrão assume um campo type direto no nível superior, então esquemas como este:
{"anyOf": [{"$ref": "#/$defs/SomeObject"}, {"type": "null"}]}têm anyOf, $ref e $defs removidos, resultando em type: "" no prompt. Isso quebra a chamada de ferramentas em vários mecanismos de inferência (llama-server, outros), enquanto Qwen3.5 e gpt-oss-20b lidam corretamente.
Diagnóstico e Correção
O usuário depurou com logs detalhados do llama-server e usou o GPT-5.5-high (via codex CLI) para comparar logs entre Qwen3.5-27B-Q4_K_M e gemma-4-31B-it-Q4_K_S em um MacBook Pro. A causa raiz foi rastreada até a suposição do template de chat do Gemma de que cada parâmetro tem uma chave type direta. Uma pequena alteração no template Jinja agora preserva as estruturas anyOf, $ref e $defs.
O template Jinja corrigido está disponível no Pastebin: https://pastebin.com/p9z3BAC0
Um PR foi submetido ao repositório do Hugging Face para gemma-4-31B-it.
Conclusão
Se você usa Gemma 4 para chamadas de ferramentas/funções com referências JSON Schema anuláveis, aplique o template de chat corrigido. Usuários de Qwen3.5 ou gpt-oss-20b não são afetados.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

A Estratégia de Plataforma da Anthropic e a Resposta OpenClaw
Um desenvolvedor analisa as restrições recentes da Anthropic sobre integrações externas do Claude como uma estratégia deliberada de plataforma, defendendo a construção de stacks portáteis em vez de depender da boa vontade dos provedores.

Microsoft cancela licenças do Claude Code — Agentes de IA são caros demais para escalar
Microsoft cancela a maioria das licenças diretas do Claude Code e realoca engenheiros para o GitHub Copilot CLI. A Uber queimou seu orçamento de IA de 2026 em 4 meses. O custo por token por tarefa pode realmente aumentar.

Qwen 3.6 27B avaliado no DeepSWE: 2% de pontuação, 70 horas, 44k tokens médios de saída
Qwen 3.6 27B (FP8, cache KV BF16, contexto de 262k) obteve 2% no DeepSWE em 70 horas. A média de tokens de saída foi de 44k por tarefa — comparável a modelos maiores como Qwen 3.6 Plus. Executado em 1x RTX6000 Pro Blackwell via RunPod.

Desenvolvedor Prefere Qwen3.5-27B a Modelos Proprietários por Seu Modo de Falha
Um desenvolvedor no r/LocalLLaMA relata preferir o Qwen3.5-27B em vez do Gemini 3.1 Pro e GPT-5.3 Codex porque ele desiste de tarefas problemáticas em vez de gerar código potencialmente perigoso, como scripts Perl ou NodeJS sem restrições.