Comparación de referencia de Qwen3.6 Plus con modelos SOTA occidentales

✍️ OpenClawRadar📅 Publicado: 5 de abril de 2026🔗 Source
Comparación de referencia de Qwen3.6 Plus con modelos SOTA occidentales
Ad

Una publicación en Reddit en r/LocalLLaMA compara Qwen3.6 Plus con varios modelos occidentales de última generación en múltiples benchmarks. La comparación incluye métricas de rendimiento específicas para cada modelo.

Resultados de los Benchmarks

La fuente proporciona estas puntuaciones exactas:

  • Qwen3.6-Plus: SWE-bench Verified 78.8, GPQA / GPQA Diamond 90.4, HLE (sin herramientas) 28.8, MMMU-Pro 78.8
  • GPT‑5.4 (xhigh): SWE-bench Verified 78.2, GPQA / GPQA Diamond 93.0, HLE (sin herramientas) 39.8, MMMU-Pro 81.2
  • Claude Opus 4.6 (thinking heavy): SWE-bench Verified 80.8, GPQA / GPQA Diamond 91.3, HLE (sin herramientas) 34.44, MMMU-Pro 77.3
  • Gemini 3.1 Pro Preview: SWE-bench Verified 80.6, GPQA / GPQA Diamond 94.3, HLE (sin herramientas) 44.7, MMMU-Pro 80.5

La publicación incluye un gráfico de comparación visual disponible en: https://preview.redd.it/6kq4tt07yrsg1.png?width=714&format=png&auto=webp&s=ad8b207fb13729ae84f5b74cec5fd84a81dcface

Ad

Evaluación del Usuario

El autor original señala que Qwen3.6 Plus es "competitivo pero no el mejor" y afirma: "Será mi nuevo modelo dado lo económico que es, pero si realmente es bueno en la vida real dependerá de más que solo benchmarks". También observa que "Opus destruye a todos los demás a pesar de ser 3º o 4º en artificalanalysis".

📖 Read the full source: r/LocalLLaMA

Ad

👀 Ver también

Colaborador de OpenClaw critica el enfoque del proyecto en la paridad pixel-perfect por sobre características modernas.
Noticias

Colaborador de OpenClaw critica el enfoque del proyecto en la paridad pixel-perfect por sobre características modernas.

Una publicación de Reddit en r/openclaw detalla cómo una solicitud de extracción (PR) de un colaborador que abordaba el escalado de resolución y la compatibilidad con altas tasas de refresco fue rechazada por desviarse de las limitaciones visuales del motor original, generando un debate sobre la dirección del proyecto.

OpenClawRadar
Claude Code v2.1.203: Lanzamiento de corrección de errores importante con recuperación de sesión en segundo plano y mejoras de rendimiento
Noticias

Claude Code v2.1.203: Lanzamiento de corrección de errores importante con recuperación de sesión en segundo plano y mejoras de rendimiento

Claude Code v2.1.203 corrige bloqueos del agente en segundo plano en macOS, recuperación de tokens caducados, problemas de herencia de PATH y reduce el tamaño del binario en 7 MB con ahorro de memoria de inicio.

OpenClawRadar
Título del artículo: Código Abierto vs Modelos Frontera: Benchmark de Escena de Coche en Lienzo de Archivo Único
Noticias

Título del artículo: Código Abierto vs Modelos Frontera: Benchmark de Escena de Coche en Lienzo de Archivo Único

Un desarrollador probó 12 modelos, incluidos GPT-5.5, Claude Opus 4.7 y Qwen 3.6 Plus, en una tarea de animación de un coche conduciendo en un lienzo HTML de un solo archivo, con resultados comparados públicamente.

OpenClawRadar
El conteo de carbohidratos de IA falla en reproducibilidad: 27K consultas muestran una dispersión de 429g en una sola foto
Noticias

El conteo de carbohidratos de IA falla en reproducibilidad: 27K consultas muestran una dispersión de 429g en una sola foto

Un estudio de 26,904 consultas de IA en 4 modelos encontró que Gemini 2.5 Pro varió sus estimaciones de carbohidratos para una sola foto de paella de 55g a 484g, un potencial cambio de 42.9 unidades de insulina. Claude mostró solo un 2.4% de variación media.

OpenClawRadar