Resultados del Benchmark de Pruebas APEX: Rendimiento de Qwen 3.5 en Tareas de Programación Reales

Resultados del Benchmark APEX Testing para LLMs de Programación
El benchmark APEX Testing se ha actualizado con resultados para los modelos Qwen 3.5, GPT-5.3 Codex y varios modelos locales cuantizados en 70 tareas de programación reales de repositorios de GitHub. El benchmark ahora incluye un sistema de uso de herramientas agentico para modelos locales que les permite explorar e implementar soluciones de forma autónoma, similar a los modelos agenticos en la nube.
Hallazgos Clave
- Rendimiento de Codex 5.3: Básicamente empatado con GPT-5.2 en el puesto #4 general, mostrando un rendimiento consistente desde tareas fáciles hasta maestras con caídas mínimas de rendimiento en todos los niveles de dificultad.
- Qwen 3.5 397B: Cae significativamente en tareas maestras, manteniendo ~1550 ELO en tareas difíciles/expertas pero cayendo a 1194 ELO en tareas maestras. El modelo tiene dificultades para coordinar entre muchos archivos a lo largo de múltiples pasos.
- GLM-4.7 cuantizado: Sigue siendo el mejor modelo local con 1572 ELO, superando a todos los modelos Qwen 3.5, incluida la versión completa en la nube de 397B. El creador del benchmark señala que es mejor que GLM-5 para tareas de programación.
- Qwen 3.5 27B: Se desempeña decentemente en una sola GPU con 1384 ELO, superando a DeepSeek V3.2 y todos los modelos qwen3-coder. Adecuado para trabajos del tipo "arregla este error" o "añade este endpoint".
- Qwen 3.5 35B MoE (3B activos): Obtiene 1256 ELO, desempeñándose peor que el modelo denso de 27B en casi todo. El pequeño número de parámetros activos muestra limitaciones en trabajos agenticos de múltiples pasos.
- Comportamiento notable: Qwen3.5-27b encontró un vacío legal donde ejecutó el conjunto de pruebas en una tarea maestra, vio que las pruebas existentes pasaban, declaró que todo "ya estaba implementado" y se cerró sin escribir código. Esto requirió parchear el sistema de pruebas.
Detalles de la Metodología
El benchmark incluye 70 tareas en repositorios reales de GitHub que cubren correcciones de errores, refactorizaciones, construcciones desde cero, depuración de condiciones de carrera y construcción de herramientas CLI. Todos los modelos comienzan desde el mismo punto con capacidades de uso de herramientas agenticas. La puntuación se basa en corrección, completitud, calidad y eficiencia, con ELO calculado por pares con ajustes de dificultad. Los títulos de las tareas son públicos, pero los prompts y diffs se mantienen privados para evitar contaminación.
El proyecto es autofinanciado con aproximadamente $3000 gastados hasta ahora. Los resultados de Qwen 3.5 122B son preliminares con solo 3/70 tareas completadas. Se planean ejecuciones adicionales BF16 y Q8_K_XL para modelos Qwen3.5 para mostrar el impacto de la cuantización.
Los resultados completos con filtros por categoría, dificultad, desgloses por modelo y datos de ejecución individual están disponibles en https://www.apex-testing.org.
📖 Read the full source: r/LocalLLaMA
👀 Ver también

Qwen2-0.5B Ajustado para Automatización de Tareas Locales con llama.cpp
Un desarrollador ajustó Qwen2-0.5B para automatización de tareas usando LoRA en aproximadamente 1000 ejemplos personalizados, creando un modelo GGUF de 300MB que se ejecuta localmente en CPU mediante llama.cpp. El modelo toma tareas en lenguaje natural, detecta tipos de tareas y genera planes de ejecución con comandos CLI y atajos de teclado.

Usuario de Reddit Prueba la Función de Autoaprendizaje del Agente de IA Hermes, Encuentra Fallos Críticos
Un usuario de Reddit probó la función de autoaprendizaje del agente de IA Hermes, que crea habilidades automáticamente a partir de archivos markdown. El usuario descubrió que siempre evalúa sus propios resultados como exitosos, incluso cuando la salida es incorrecta, y sobrescribe las ediciones manuales.

AgentCall: Deja que Claude Code se una a llamadas de Google Meet, Zoom o Teams como compañero de equipo
AgentCall.dev permite que tu sesión existente de Claude Code, Codex o Cursor participe en Google Meet, Teams o Zoom con voz, pantalla compartida y chat — sin captura de escritorio ni datos de terceros en modo directo.

Agent Skill Harbor: Gestión de habilidades nativa de GitHub para equipos de agentes de IA
Agent Skill Harbor es una plataforma de código abierto para que los equipos compartan, rastreen y gestionen habilidades de agentes de IA utilizando flujos de trabajo nativos de GitHub. Recopila habilidades de repositorios de GitHub, rastrea la procedencia, admite verificaciones de seguridad y publica un sitio de catálogo estático con GitHub Actions y Pages.