El Benchmark OpenClaw Muestra que Qwen3.5:27B Supera a Otros LLMs Locales en Tareas de Agente

Configuración y Resultados de la Evaluación Comparativa
Un usuario probó 7 modelos locales en 22 tareas reales de agentes utilizando OpenClaw en una Raspberry Pi 5 con una RTX 3090 ejecutando Ollama. Las tareas incluyeron leer correos electrónicos, programar reuniones, crear tareas, detectar phishing, manejar errores y automatización del navegador.
El ganador por un amplio margen fue qwen3.5:27b-q4_K_M con un 59.4%. El subcampeón (qwen3.5:35b) obtuvo solo un 23.2%. Todos los demás modelos obtuvieron puntajes por debajo del 5%.
Hallazgos Clave
- El modelo cuantizado de 27B superó a la versión más grande de 35B por 2.5x
- Un modelo de 30B obtuvo el último lugar con un 1.6%
- El pensamiento medio funcionó mejor: demasiado pensamiento en realidad perjudicó el rendimiento
- Ningún modelo pudo completar tareas de automatización del navegador
- El principal diferenciador entre ganadores y perdedores fue si el modelo podía encontrar y usar herramientas de línea de comandos
- La mayoría de los modelos ni siquiera pudieron encontrar herramientas básicas como la función de correo electrónico
Esta evaluación comparativa proporciona datos concretos sobre cómo diferentes LLMs locales funcionan como agentes de IA en escenarios prácticos. La brecha significativa de rendimiento entre el modelo superior y los demás sugiere que la capacidad de encontrar herramientas es un cuello de botella crítico para los agentes LLM locales.
📖 Read the full source: r/LocalLLaMA
👀 Ver también

AlterSpec v1.0: Aplicación de Políticas en Tiempo de Ejecución para Agentes de IA
AlterSpec v1.0 es un motor de ejecución de cumplimiento de políticas de código abierto que se sitúa entre los agentes de IA y sus herramientas, evaluando las acciones frente a políticas definidas en YAML antes de su ejecución. Proporciona decisiones de permitir/denegar/revisar, firma criptográfica de políticas y registro de auditoría.

Extensión Codex Chrome agrega automatización del navegador en segundo plano entre pestañas
La nueva extensión de Chrome de Codex en macOS/Windows permite la ejecución paralela de tareas en el navegador en pestañas de fondo sin tomar el control — cubriendo flujos de depuración, paneles, investigación y actualizaciones de CRM.

Runtime: Agentes de Codificación en Entorno Aislado para Cada Miembro del Equipo
Runtime (YC P26) proporciona infraestructura de agentes de codificación en sandbox que permite a los no ingenieros usar Claude Code, Codex y otros agentes de forma segura. Crea instantáneas de entornos multiservicio (Docker, Kafka, Redis, bases de datos sembradas) que arrancan en milisegundos, con protecciones a nivel de infraestructura.

Propuesta de Claude: Memoria de Alcance y Aislamiento Hermético de Instancias
Una propuesta formal a Anthropic de un usuario avanzado: alcance de memoria global/local y aislamiento hermético de instancias para Claude, permitiendo sesiones deterministas y auditables.