El Benchmark OpenClaw Muestra que Qwen3.5:27B Supera a Otros LLMs Locales en Tareas de Agente

✍️ OpenClawRadar📅 Publicado: 28 de marzo de 2026🔗 Source
El Benchmark OpenClaw Muestra que Qwen3.5:27B Supera a Otros LLMs Locales en Tareas de Agente
Ad

Configuración y Resultados de la Evaluación Comparativa

Un usuario probó 7 modelos locales en 22 tareas reales de agentes utilizando OpenClaw en una Raspberry Pi 5 con una RTX 3090 ejecutando Ollama. Las tareas incluyeron leer correos electrónicos, programar reuniones, crear tareas, detectar phishing, manejar errores y automatización del navegador.

El ganador por un amplio margen fue qwen3.5:27b-q4_K_M con un 59.4%. El subcampeón (qwen3.5:35b) obtuvo solo un 23.2%. Todos los demás modelos obtuvieron puntajes por debajo del 5%.

Ad

Hallazgos Clave

  • El modelo cuantizado de 27B superó a la versión más grande de 35B por 2.5x
  • Un modelo de 30B obtuvo el último lugar con un 1.6%
  • El pensamiento medio funcionó mejor: demasiado pensamiento en realidad perjudicó el rendimiento
  • Ningún modelo pudo completar tareas de automatización del navegador
  • El principal diferenciador entre ganadores y perdedores fue si el modelo podía encontrar y usar herramientas de línea de comandos
  • La mayoría de los modelos ni siquiera pudieron encontrar herramientas básicas como la función de correo electrónico

Esta evaluación comparativa proporciona datos concretos sobre cómo diferentes LLMs locales funcionan como agentes de IA en escenarios prácticos. La brecha significativa de rendimiento entre el modelo superior y los demás sugiere que la capacidad de encontrar herramientas es un cuello de botella crítico para los agentes LLM locales.

📖 Read the full source: r/LocalLLaMA

Ad

👀 Ver también

AlterSpec v1.0: Aplicación de Políticas en Tiempo de Ejecución para Agentes de IA
Herramientas

AlterSpec v1.0: Aplicación de Políticas en Tiempo de Ejecución para Agentes de IA

AlterSpec v1.0 es un motor de ejecución de cumplimiento de políticas de código abierto que se sitúa entre los agentes de IA y sus herramientas, evaluando las acciones frente a políticas definidas en YAML antes de su ejecución. Proporciona decisiones de permitir/denegar/revisar, firma criptográfica de políticas y registro de auditoría.

OpenClawRadar
Extensión Codex Chrome agrega automatización del navegador en segundo plano entre pestañas
Herramientas

Extensión Codex Chrome agrega automatización del navegador en segundo plano entre pestañas

La nueva extensión de Chrome de Codex en macOS/Windows permite la ejecución paralela de tareas en el navegador en pestañas de fondo sin tomar el control — cubriendo flujos de depuración, paneles, investigación y actualizaciones de CRM.

OpenClawRadar
Runtime: Agentes de Codificación en Entorno Aislado para Cada Miembro del Equipo
Herramientas

Runtime: Agentes de Codificación en Entorno Aislado para Cada Miembro del Equipo

Runtime (YC P26) proporciona infraestructura de agentes de codificación en sandbox que permite a los no ingenieros usar Claude Code, Codex y otros agentes de forma segura. Crea instantáneas de entornos multiservicio (Docker, Kafka, Redis, bases de datos sembradas) que arrancan en milisegundos, con protecciones a nivel de infraestructura.

OpenClawRadar
Propuesta de Claude: Memoria de Alcance y Aislamiento Hermético de Instancias
Herramientas

Propuesta de Claude: Memoria de Alcance y Aislamiento Hermético de Instancias

Una propuesta formal a Anthropic de un usuario avanzado: alcance de memoria global/local y aislamiento hermético de instancias para Claude, permitiendo sesiones deterministas y auditables.

OpenClawRadar