Grok 4.5 vs Claude Code: Cambios Aceptados por Dólar es el Verdadero Punto de Referencia

✍️ OpenClawRadar📅 Publicado: 23 de julio de 2026🔗 Source
Ad

El lanzamiento de Grok 4.5 de xAI (53% en DeepSWE 1.1 vs 59% de Opus 4.8, 29.0% pass@1 en SWE Marathon vs 26.0%, 80 tokens/segundo a $2/M de entrada, $6/M de salida) merece tratarse como una comparación práctica con Claude Code, no solo como otra afirmación en un ranking. La métrica adecuada para los desarrolladores que usan agentes de codificación de IA son los cambios aceptados por dólar con el mismo repositorio, prompt, permisos de herramientas, comando de prueba, tiempo de espera y criterio de revisión.

Ad

Detalles clave

Grok 4.5 está disponible en Grok Build, Cursor y a través de API. Admite modos de razonamiento bajo, medio y alto. Sin embargo, una prueba de terceros del 20 de julio (vía The New Stack) ejecutó Grok y Opus en modo Cursor Agent en tres tareas idénticas de Rust:

  • Corrección de errores: Ambos pasaron las pruebas iniciales.
  • Refactorización de varios archivos: Ambos la completaron, pero Opus tocó un archivo más.
  • Construcción de funciones (la prueba más práctica): Ambos funcionaron, pero Opus añadió más cobertura de pruebas y escribió la entrada del man page.

Los toques adicionales de Opus importan para los cambios aceptados por dólar: un modelo más barato que necesita un bucle de reparación extra puede no ser más barato. La comunidad recomienda registrar: éxito en pruebas iniciales, rondas de reelaboración, tokens de salida, tiempo real y correcciones del revisor.

Para quién es

Cualquier persona que use Claude Code, Cursor o Grok Build para codificación agente y quiera evaluar el costo total de los cambios entregados.

📖 Lee la fuente completa: r/ClaudeAI

Ad

👀 Ver también

Publicación de Reddit critica los flujos de trabajo de agentes de CEO virtuales, aboga por un enfoque basado en habilidades.
Noticias

Publicación de Reddit critica los flujos de trabajo de agentes de CEO virtuales, aboga por un enfoque basado en habilidades.

Una publicación en Reddit en r/openclaw critica la creación de agentes de IA con títulos de trabajo como 'desarrollador backend' o 'growth hacker' como una sobrecarga innecesaria, proponiendo en su lugar empaquetar habilidades como capacidades reutilizables que puedan ser llamadas cuando se necesiten.

OpenClawRadar
Los agentes de codificación con IA tienen dificultades para gestionar el contexto en bases de código grandes.
Noticias

Los agentes de codificación con IA tienen dificultades para gestionar el contexto en bases de código grandes.

El análisis de los agentes de codificación con IA revela que dedican entre 15 y 20 llamadas a herramientas en tareas de orientación, como buscar rutas con grep y leer middleware, antes de escribir código, consumiendo rápidamente las ventanas de contexto. Vercel logró un 100% de precisión al eliminar el 80% de las herramientas y usar bash, mientras que Pi utiliza solo 4 herramientas y un prompt de sistema de menos de 1.000 tokens.

OpenClawRadar
El error de actualización automática de OpenClaw deja directorios preflight huérfanos que llenan /tmp
Noticias

El error de actualización automática de OpenClaw deja directorios preflight huérfanos que llenan /tmp

El mecanismo de actualización automática de OpenClaw crea copias de pre-vuelo en /tmp que persisten cuando las actualizaciones fallan, lo que puede llenar el espacio en disco y bloquear futuras actualizaciones. Un usuario encontró 9 directorios huérfanos que sumaban 6.5GB en un VPS de 38GB.

OpenClawRadar
Dos nuevos modelos aparecen en OpenRouter, posiblemente variantes de DeepSeek V4.
Noticias

Dos nuevos modelos aparecen en OpenRouter, posiblemente variantes de DeepSeek V4.

Dos nuevos modelos llamados healer-alpha y hunter-alpha han aparecido en OpenRouter, con especificaciones que coinciden con detalles filtrados sobre DeepSeek V4. Las pruebas iniciales muestran que ambos modelos funcionan bien en escenarios de juego de roles sin filtrado de mensajes y con generación de tokens más rápida que GLM 5.0.

OpenClawRadar