El Benchmark OpenClaw Muestra que Qwen3.5:27B Supera a Otros LLMs Locales en Tareas de Agente

Configuración y Resultados de la Evaluación Comparativa
Un usuario probó 7 modelos locales en 22 tareas reales de agentes utilizando OpenClaw en una Raspberry Pi 5 con una RTX 3090 ejecutando Ollama. Las tareas incluyeron leer correos electrónicos, programar reuniones, crear tareas, detectar phishing, manejar errores y automatización del navegador.
El ganador por un amplio margen fue qwen3.5:27b-q4_K_M con un 59.4%. El subcampeón (qwen3.5:35b) obtuvo solo un 23.2%. Todos los demás modelos obtuvieron puntajes por debajo del 5%.
Hallazgos Clave
- El modelo cuantizado de 27B superó a la versión más grande de 35B por 2.5x
- Un modelo de 30B obtuvo el último lugar con un 1.6%
- El pensamiento medio funcionó mejor: demasiado pensamiento en realidad perjudicó el rendimiento
- Ningún modelo pudo completar tareas de automatización del navegador
- El principal diferenciador entre ganadores y perdedores fue si el modelo podía encontrar y usar herramientas de línea de comandos
- La mayoría de los modelos ni siquiera pudieron encontrar herramientas básicas como la función de correo electrónico
Esta evaluación comparativa proporciona datos concretos sobre cómo diferentes LLMs locales funcionan como agentes de IA en escenarios prácticos. La brecha significativa de rendimiento entre el modelo superior y los demás sugiere que la capacidad de encontrar herramientas es un cuello de botella crítico para los agentes LLM locales.
📖 Read the full source: r/LocalLLaMA
👀 Ver también

Modo: IDE de IA de código abierto con desarrollo basado en especificaciones y enlaces de agentes
Modo es un IDE de escritorio de código abierto basado en el editor Void que agrega flujos de trabajo de desarrollo basados en especificaciones, ganchos de agentes y archivos de dirección. Estructura las indicaciones en requisitos, diseño y tareas antes de generar código.

Protocolo de Memoria Abierta: Un Almacén de Memoria para Claude, ChatGPT, Cursor
Open Memory Protocol (OMP) es una especificación neutral y servidor de referencia para memoria portátil de IA. Ejecuta un servidor autogestionado vía Docker o npx, conecta Claude mediante MCP, y comparte memoria automáticamente con ChatGPT y Cursor.

Los ganchos de código de Claude evitan la interferencia entre pestañas de Chrome en múltiples sesiones.
Un desarrollador creó tres hooks (session-start, capture-tab-id, enforce-tab-id) que anclan cada sesión de Claude Code a su propia pestaña de Chrome, evitando que las sesiones accedan accidentalmente a las pestañas de otras sesiones durante ejecuciones de pruebas y llenados de formularios.
Investigador Desarrolla Habilidad de Verificación de Veracidad para Código Claude, Encuentra Alucinaciones en su Propia Documentación
Un investigador creó una habilidad de Claude Code llamada /veracity-tweaked-555 que descompone documentos en afirmaciones atómicas y verifica cada una mediante búsqueda web utilizando 16 agentes paralelos en 4 oleadas. Al auditarse a sí misma, la habilidad obtuvo 62/100 debido a estadísticas fabricadas y afirmaciones exageradas en su propia documentación.