Claude vs GPT-4o: Mesmo Prompt de Pêndulo Duplo, Diferentes Convenções de Coordenadas

✍️ OpenClawRadar📅 Publicado: May 16, 2026🔗 Source
Claude vs GPT-4o: Mesmo Prompt de Pêndulo Duplo, Diferentes Convenções de Coordenadas
Ad

Um usuário do Reddit executou o mesmo prompt de pêndulo duplo no Claude e no GPT-4o lado a lado, usando um renderizador hospedeiro compartilhado, e viu dois sistemas físicos completamente diferentes em segundos. A causa: cada modelo escolheu uma convenção diferente para medir theta.

O Claude mediu theta a partir da vertical para cima (theta=0 = braço apontando para cima), enquanto o GPT-4o mediu a partir da vertical para baixo (theta=0 = braço pendurado para baixo). O renderizador hospedeiro em public/workers/simulator-host.js simplesmente lê info.theta1 e info.theta2 e desenha os braços de acordo — sem diferenças cosméticas. Portanto, a diferença visual é uma diferença física real.

Ambas as convenções são tecnicamente válidas. A maioria dos livros de mecânica clássica usa theta a partir da vertical para baixo porque torna o ponto de equilíbrio em theta=0 para aproximações de pequenos ângulos. Mas theta a partir da vertical para cima também é padrão em muitas referências. O Claude manteve sua convenção consistentemente nas equações de movimento, condições iniciais e integração (Runge Kutta). O GPT-4o usou a outra convenção silenciosamente — não comentou sobre sua escolha.

Ad

O usuário estava trabalhando no Physics Bench, um benchmark lado a lado de código aberto onde cada modelo recebe o mesmo contrato de geração: function createSimulator(...) em lib/prompt.ts. O hospedeiro possui toda a renderização; os modelos implementam apenas step, getInfo e reset. Os modelos nunca tocam em draw. Portanto, qualquer diferença visual entre os painéis é garantidamente proveniente de uma diferença real na lógica de simulação, não de escolhas de renderização.

Um teste unitário da matemática não teria captado isso. Ambos os modelos produzem física correta para suas convenções escolhidas. Você só vê a divergência ao renderizá-los lado a lado através do mesmo código de desenho. Isso ressalta a importância de especificar explicitamente as convenções de coordenadas nos prompts quando a saída é consumida por um renderizador fixo.

Veja o tópico completo do Reddit para trechos de código e detalhes do inspetor de conversação.

📖 Read the full source: r/ClaudeAI

Ad

👀 See Also

A empresa de IA da Medvi, avaliada em US$ 1,8 bilhão, enfrenta questionamentos sobre questões legais e éticas
News

A empresa de IA da Medvi, avaliada em US$ 1,8 bilhão, enfrenta questionamentos sobre questões legais e éticas

Gary Marcus critica a história viral da Medvi, uma suposta empresa de IA de US$ 1,8 bilhão construída por uma pessoa em dois meses, destacando ações coletivas por violações de spam e questões sobre relatórios de receita e conformidade.

OpenClawRadar
Uso de água em centros de dados de IA na Califórnia: Estimativas a partir de modelos físicos e de IA
News

Uso de água em centros de dados de IA na Califórnia: Estimativas a partir de modelos físicos e de IA

Uma análise da California WaterBlog usando física e quatro modelos de IA estima o uso de água por data centers de IA na Califórnia em 2.300–400.000 acre-pés/ano, com uma faixa realista de 32.000–290.000 acre-pés/ano — modesta em comparação com a agricultura.

OpenClawRadar
Claude Opus 4.7 adiciona suporte a imagens de alta resolução, orçamentos de tarefas e remove o pensamento estendido.
News

Claude Opus 4.7 adiciona suporte a imagens de alta resolução, orçamentos de tarefas e remove o pensamento estendido.

O Claude Opus 4.7 introduz suporte a imagens de alta resolução de até 2576px/3,75MP, um novo recurso de orçamento de tarefas para controlar o uso de tokens em loops agentivos, e remove orçamentos de pensamento estendido em favor do pensamento adaptativo.

OpenClawRadar
Nemotron 3 4B tem desempenho inferior ao Qwen 3.5 4B em benchmarks exigentes
News

Nemotron 3 4B tem desempenho inferior ao Qwen 3.5 4B em benchmarks exigentes

Um usuário do Reddit testou o Nemotron 3 4B Q8 contra o Qwen 3.5 4B Q8 em tarefas complexas de matemática e programação, constatando que o Nemotron falhou em produzir raciocínio correto e saída estruturada, enquanto o Qwen passou em todos os testes.

OpenClawRadar