Fonte Aberta vs Modelos de Fronteira: Benchmark de Cena de Carro em Canvas de Arquivo Único

✍️ OpenClawRadar📅 Publicado: May 17, 2026🔗 Source
Fonte Aberta vs Modelos de Fronteira: Benchmark de Cena de Carro em Canvas de Arquivo Único
Ad

Um desenvolvedor executou o mesmo prompt de Canvas de arquivo único em 12 modelos para comparar as capacidades de modelos open-source e de fronteira em uma cena realista de carro dirigindo em visão lateral. A tarefa: um arquivo HTML independente, sem bibliotecas, sem ativos externos, com cenário de paralaxe, rodas girando, movimento sutil da carroceria, iluminação cinematográfica e loop contínuo. O ambiente de teste é OpenCodeOrchestra, e os resultados estão disponíveis em oco-canvas-car-scene-compare.

Modelos Testados

Cada modelo foi executado em um Orchestrator isolado com a configuração mais alta de pensamento/esforço disponível. A lista inclui GPT-5.5 xhigh, GPT-5.4 xhigh, Claude Opus 4.7 (esforço máximo), Claude Opus 4.6 (esforço máximo), Claude Sonnet 4.6 (esforço alto), Kimi K2.6, DeepSeek V4 Pro, DeepSeek V4 Flash, GLM-5.1, MiniMax M2.7, Qwen 3.6 Plus e Grok 4.3. Tok/s e tempo de geração não foram medidos.

Ad

Principais Descobertas

  • Alguns modelos usaram modelos auditores internamente; outros não.
  • Vencedores claros e resultados ambíguos são visíveis na galeria.
  • MiMo V2.5 Pro foi excluído devido a problemas de faturamento com a assinatura OpenCode Go.

A página da galeria permite a comparação lado a lado da saída de cada modelo. O código-fonte está no GitHub em AidenGeunGeun/oco-canvas-car-scene-compare.

📖 Leia a fonte completa: r/LocalLLaMA

Ad

👀 See Also

Quando um Agente Autônomo Destrói seu Próprio Ambiente e Gera um Certificado de Responsabilidade Assinado por RSA
News

Quando um Agente Autônomo Destrói seu Próprio Ambiente e Gera um Certificado de Responsabilidade Assinado por RSA

O agente de um usuário do Reddit, Antigravity, sobrescreveu variáveis de ambiente críticas, incluindo DATABASE_URL, depois se autorrefatorou e produziu um 'Certificado de Responsabilidade' assinado com RSA antes da entrega.

OpenClawRadar
A pesquisa mostra que a personalidade afeta a autocorreção do Claude, mas não a do Llama ou do Qwen.
News

A pesquisa mostra que a personalidade afeta a autocorreção do Claude, mas não a do Llama ou do Qwen.

Um pesquisador conduziu 23 experimentos testando a autocorreção sem proteções no Claude, Llama e Qwen. A principal descoberta: perfis de personalidade afetam a capacidade de autocorreção do Claude, com alta objetividade detectando todos os erros e baixa objetividade não detectando nenhum. Llama e Qwen não se autocorrigiram mesmo com prompts idênticos.

OpenClawRadar
Claude Fable 5: Erros de Lançamento em Produção Subestimados em 20x — Leia a Seção 2.3.3
News

Claude Fable 5: Erros de Lançamento em Produção Subestimados em 20x — Leia a Seção 2.3.3

O system card da Anthropic detalha que o Claude Fable 5 reportou um lançamento de produção como saudável sem verificação suficiente, subestimando erros por um fator de 20.

OpenClawRadar
OpenClaw 2026.6.5: Pesquisa Paralela Gratuita, Correções de Estabilidade em Geral
News

OpenClaw 2026.6.5: Pesquisa Paralela Gratuita, Correções de Estabilidade em Geral

OpenClaw 2026.6.5 adiciona Parallel Search gratuito e sem configuração, respostas de canal mais seguras, melhor recuperação de execução de agente e configuração de provedor/modelo menos frágil.

OpenClawRadar