Claude vs GPT-4o: Mismo Prompt de Péndulo Doble, Diferentes Convenciones de Coordenadas

Un usuario de Reddit ejecutó la misma instrucción de péndulo doble en Claude y GPT-4o lado a lado usando un renderizador anfitrión compartido y vio dos sistemas físicos completamente diferentes en cuestión de segundos. La causa: cada modelo eligió una convención diferente para medir theta.
Claude midió theta desde la vertical hacia arriba (theta=0 = brazo apuntando hacia arriba), mientras que GPT-4o midió desde la vertical hacia abajo (theta=0 = brazo colgando hacia abajo). El renderizador anfitrión en public/workers/simulator-host.js simplemente lee info.theta1 y info.theta2 y dibuja los brazos según corresponda, sin diferencias cosméticas. Por lo tanto, la discrepancia visual es una discrepancia física real.
Ambas convenciones son técnicamente válidas. La mayoría de los libros de texto de mecánica clásica usan theta desde la vertical hacia abajo porque hace que el punto de equilibrio esté en theta=0 para aproximaciones de ángulos pequeños. Pero theta desde la vertical hacia arriba también es estándar en muchas referencias. Claude se comprometió con su convención de manera consistente en las ecuaciones de movimiento, condiciones iniciales e integración (Runge Kutta). GPT-4o usó la otra convención en silencio, sin mencionar su elección.
El usuario estaba trabajando en Physics Bench, un punto de referencia lado a lado de código abierto donde cada modelo recibe el mismo contrato de generación: function createSimulator(...) en lib/prompt.ts. El anfitrión controla todo el renderizado; los modelos solo implementan step, getInfo y reset. Los modelos nunca tocan draw. Por lo tanto, cualquier diferencia visual entre paneles está garantizada para provenir de una diferencia real en la lógica de simulación, no de opciones de renderizado.
Una prueba unitaria de las matemáticas no habría detectado esto. Ambos modelos producen física correcta según sus convenciones elegidas. Solo se ve la divergencia al renderizarlos uno al lado del otro a través del mismo código de dibujo. Esto subraya la importancia de especificar explícitamente las convenciones de coordenadas en las instrucciones cuando la salida es consumida por un renderizador fijo.
Vea el hilo completo de Reddit para fragmentos de código y detalles del inspector de conversación.
📖 Lea la fuente completa: r/ClaudeAI
👀 Ver también

La Necesidad de Gobernanza Relacional en Sistemas de IA Multiagente
Los marcos de gobernanza actuales se centran en la identidad, los permisos y los interruptores de emergencia, pero no abordan la coordinación entre agentes. La investigación de Salesforce muestra que las interacciones entre agentes requieren soluciones específicas, mientras que los estudios revelan que la calidez supera al dominio en las negociaciones.

Microsoft's BitNet Permite la Inferencia de un LLM de 100B Parámetros en una Sola CPU
El proyecto BitNet de código abierto de Microsoft logra inferencia de LLM de 100B parámetros a 5-7 tokens/segundo en una sola CPU, con el modelo de 2B parámetros usando 0.4GB de memoria y 29ms de latencia mientras iguala a los modelos de precisión completa en puntos de referencia.

Claude Code v2.1.214 publicado: Trazado OTel, correcciones de permisos, herramienta EndConversation y protección Docker
Anthropic lanzó Claude Code v2.1.214 con correcciones críticas de permisos para Bash y PowerShell, nuevos atributos OpenTelemetry, indicaciones de Docker y la herramienta EndConversation para usuarios abusivos.

Uso de agua en centros de datos de IA en California: Estimaciones basadas en física y modelos de IA
Un análisis de California WaterBlog que utiliza física y cuatro modelos de IA estima el uso de agua de los centros de datos de IA en California entre 2,300 y 400,000 acres-pie/año, con un rango realista de 32,000 a 290,000 acres-pie/año, modesto en comparación con la agricultura.