Fonte Aberta vs Modelos de Fronteira: Benchmark de Cena de Carro em Canvas de Arquivo Único

Um desenvolvedor executou o mesmo prompt de Canvas de arquivo único em 12 modelos para comparar as capacidades de modelos open-source e de fronteira em uma cena realista de carro dirigindo em visão lateral. A tarefa: um arquivo HTML independente, sem bibliotecas, sem ativos externos, com cenário de paralaxe, rodas girando, movimento sutil da carroceria, iluminação cinematográfica e loop contínuo. O ambiente de teste é OpenCodeOrchestra, e os resultados estão disponíveis em oco-canvas-car-scene-compare.
Modelos Testados
Cada modelo foi executado em um Orchestrator isolado com a configuração mais alta de pensamento/esforço disponível. A lista inclui GPT-5.5 xhigh, GPT-5.4 xhigh, Claude Opus 4.7 (esforço máximo), Claude Opus 4.6 (esforço máximo), Claude Sonnet 4.6 (esforço alto), Kimi K2.6, DeepSeek V4 Pro, DeepSeek V4 Flash, GLM-5.1, MiniMax M2.7, Qwen 3.6 Plus e Grok 4.3. Tok/s e tempo de geração não foram medidos.
Principais Descobertas
- Alguns modelos usaram modelos auditores internamente; outros não.
- Vencedores claros e resultados ambíguos são visíveis na galeria.
- MiMo V2.5 Pro foi excluído devido a problemas de faturamento com a assinatura OpenCode Go.
A página da galeria permite a comparação lado a lado da saída de cada modelo. O código-fonte está no GitHub em AidenGeunGeun/oco-canvas-car-scene-compare.
📖 Leia a fonte completa: r/LocalLLaMA
👀 See Also

Estrutura de IA Apple Core: Primeira Visão da Fundação do Agente de IA Emergente da Apple
A nova página de documentação do framework Core AI da Apple está no ar, embora o conteúdo esteja atrás de um muro JavaScript. Explicamos o que isso significa para o desenvolvimento de agentes de IA nas plataformas Apple.

Estado Atual dos LLMs Chineses: Líderes de Mercado, Modelos Abertos e Modelos de Negócio
Uma análise do Reddit detalha o cenário dos LLMs chineses, identificando o Doubao da ByteDance como o líder do mercado proprietário e o DeepSeek como o mais inovador, enquanto descreve os modelos de negócio dos principais players e os 'Seis Tigres da IA', focados em modelos de pesos abertos.

Pesquisadores da Universidade de Washington planejam usar câmeras usadas por professores para treinamento de IA, pais podem optar por não participar
Pesquisadores da Universidade de Washington planejaram que professores de pré-escola usassem câmeras em primeira pessoa para gravar crianças para treinamento de modelos de IA, com um modelo de consentimento de exclusão.

A discussão no Reddit destaca a transição de chatbots para agentes autônomos com execução local
Uma postagem no Reddit distingue chatbots de agentes autônomos usando exemplos concretos e observa a tendência de execução local com modelos como LLaMA rodando em estações de trabalho privadas.