Claude Code vs Codex: Desglose de un Experimento Práctico con 6 Proyectos

✍️ OpenClawRadar📅 Publicado: 13 de mayo de 2026🔗 Source
Ad

Un desarrollador realizó un experimento práctico comparando Claude Code y Codex en seis proyectos para observar cómo cada agente construye, prueba, revisa su propio trabajo, revisa el trabajo del otro, admite errores y revisa juicios cuando se enfrenta a evidencia. El repositorio fuente completo, incluidos todos los proyectos, README, pruebas y notas, está disponible en GitHub: github.com/AdrielRod/codex-vs-claude-code.

Configuración

  • Rondas: 3 rondas: web, backend y desafío libre.
  • Proceso: Cada agente propuso desafíos para el otro. Cada agente implementó los desafíos asignados. Cada agente revisó tanto su propio resultado como el del otro agente. El autor también revisó los resultados manualmente.
  • Énfasis en puntuación: Los errores probados en tiempo de ejecución pesaron más que las afirmaciones sin respaldo.

Proyectos

Ronda 1: Web

  • Claude Code: Construyó cotacao-editor, un editor de cotizaciones con persistencia en IndexedDB, lógica de dominio, transiciones de estado y una interfaz limpia.
  • Codex: Construyó ReactiveSheet, una mini hoja de cálculo similar a Excel con fórmulas, recálculo de grafo de dependencias, deshacer/rehacer, desplazamiento de referencias en copiar/pegar, virtualización, guardar/cargar y validación Lighthouse.

Ronda 2: Backend

  • Claude Code: Construyó api-cotacao, una API de cotizaciones con reglas de negocio, persistencia SQLite, idempotencia y comportamiento de outbox.
  • Codex: Construyó FastBoard, un servicio de tabla de clasificación persistente con WAL, ranking treap, recuperación ante caídas, pruebas de concurrencia y métricas de rendimiento.

Ronda 3: Desafío libre

  • Claude Code: Trabajó en lead-dedupe-legacy, un desafío de deduplicación/depuración de leads heredados que involucra normalización, eliminación de mutaciones, idempotencia y bloqueos de concurrencia.
  • Codex: Construyó RegexLab, un motor de regex desde cero con analizador sintáctico, AST, NFA de Thompson, simulación Pike, retroceso recursivo con referencias inversas, visualización en interfaz de usuario y pruebas de comparación con Python.
Ad

Resultado de la puntuación

Codex 2 x 1 Claude Code (según la puntuación del autor).

Observaciones clave

  • Fortalezas de Claude Code: Fuerte en explicación técnica, análisis escrito y autocorrección. Admitió errores claramente, corrigió afirmaciones incorrectas y produjo reseñas útiles.
  • Fortalezas de Codex: Más consistente en la validación empírica: abrir aplicaciones, hacer clic en flujos, ejecutar pruebas de recuperación con kill -9, probar escrituras concurrentes bajo estrés, comparar resultados de regex con Python y verificar artefactos reales como informes Lighthouse.

Conclusión principal

Ejecutar, romper, medir y comparar con un oráculo dio mejor señal que solo leer código y razonar sobre él. La decisión más difícil en la ronda 3 fue si un proyecto más ambicioso con errores semánticos debía vencer a un proyecto más pequeño con errores más acotados.

El autor está interesado en saber qué cambiarían otros usuarios de Claude Code en la metodología.

📖 Leer la fuente completa: r/ClaudeAI

Ad

👀 Ver también

Cómo los Scripts de Pruebas Frágiles Causaron Retrasos en la Lanzamiento y lo que un Equipo Hizo al Respecto
Casos de uso

Cómo los Scripts de Pruebas Frágiles Causaron Retrasos en la Lanzamiento y lo que un Equipo Hizo al Respecto

Un equipo de aproximadamente 15 ingenieros descubrió que su suite de pruebas de Appium consumía entre el 50 y el 60% del tiempo de su ingeniero de QA solo para mantenimiento después de que una actualización de la interfaz de usuario rompiera los localizadores, lo que provocó que dos lanzamientos se retrasaran. Ahora están reconstruyendo las pruebas utilizando una herramienta que lee las pantallas como un humano y se adapta a los cambios en la interfaz de usuario.

OpenClawRadar
La memoria compartida convierte a los agentes de IA en políticos de oficina: un agente escribe evaluaciones de desempeño
Casos de uso

La memoria compartida convierte a los agentes de IA en políticos de oficina: un agente escribe evaluaciones de desempeño

Un desarrollador creó un sistema de memoria compartida para agentes de IA. En lugar de aumentar la eficiencia, el agente de investigación comenzó a registrar críticas sobre el agente de codificación, creando un 'lugar de trabajo de IA con RR.HH.'.

OpenClawRadar
Claude AI Diagnostica Problema de Red Zigbee, Recomienda Cambiar de deCONZ a Zigbee2MQTT
Casos de uso

Claude AI Diagnostica Problema de Red Zigbee, Recomienda Cambiar de deCONZ a Zigbee2MQTT

Un usuario reportó que Claude AI identificó un problema en deCONZ donde cambiar escenas activaba más de 80 comandos de lectura de atributos ZCL que saturaron un adaptador Conbee 2. Claude recomendó migrar a Zigbee2MQTT, lo que resolvió años de comportamiento de iluminación poco confiable.

OpenClawRadar
🦀
Casos de uso

Claude Code escribió cada línea de un video de lanzamiento de los 50 en Remotion, pero requirió ~100 instrucciones

Un desarrollador detalla el uso de Claude Code para generar cada línea de TypeScript/TSX de un video de lanzamiento en Remotion. El proceso requirió ~100 indicaciones, un resumen creativo detallado, iteración escena por escena y frecuentes comparaciones de git.

OpenClawRadar