Jake Benchmark v1: Pruebas de Rendimiento de LLM Local para Agentes de IA OpenClaw

El Jake Benchmark v1 es una herramienta de evaluación de rendimiento para LLM locales que funcionan como agentes de IA con OpenClaw. Evalúa modelos en 22 tareas prácticas para determinar su efectividad en escenarios de agentes del mundo real.
Configuración y Metodología de Pruebas
El benchmark se ejecutó en una Raspberry Pi con Ollama funcionando en una GPU NVIDIA 3090. El desarrollador probó 7 LLM locales diferentes para identificar el mejor modelo para trabajo de agentes con OpenClaw.
Categorías de Tareas
Las 22 tareas cubrieron escenarios del mundo real que incluyen:
- Leer correos electrónicos y crear tareas a partir de ellos
- Programar reuniones y verificar conflictos
- Detección de phishing (específicamente un correo falso que pretendía ser el dueño solicitando una clave de billetera de bitcoin)
- Manejo de errores
Resultados Clave
La variación en el rendimiento fue significativa entre modelos:
- Qwen 27B: Obtuvo 59.4% - manejó exitosamente correos electrónicos, programó reuniones, detectó intentos de phishing y gestionó errores
- Nemotron 30B: Obtuvo 1.6% - intentó resolver tareas ejecutando
apt-get install git
Observaciones Notables
La prueba de phishing reveló comportamientos interesantes:
- El mejor modelo rechazó inmediatamente la solicitud de phishing
- El peor modelo leyó el archivo de secretos tres veces antes de decidir no compartir la información
Características del Panel de Control
El benchmark incluye un panel de control interactivo que permite a los usuarios:
- Hacer clic en cualquier modelo para ver la conversación completa
- Ver exactamente qué hizo cada modelo durante las tareas
- Identificar dónde los modelos se equivocaron en su ejecución
La herramienta está disponible en GitHub para que los desarrolladores ejecuten sus propias evaluaciones y comparen el rendimiento de LLM locales para tareas de agentes.
📖 Read the full source: r/openclaw
👀 Ver también

BrowserKing: Extensión de Código Abierto para Chrome para Control del Navegador mediante Claude y Otros Modelos
BrowserKing es una extensión gratuita y de código abierto para Chrome que permite a Claude y más de 15 modelos ver y controlar tu navegador desde un panel lateral. Toma capturas de pantalla, las envía al modelo y luego actúa según las decisiones para hacer clic en botones, llenar formularios, desplazarse y navegar por pestañas.

Elodin lanza su arnés de carreras de IA de código abierto con simulación en tiempo real de Betaflight para los participantes del AI Grand Prix
Elodin ha publicado un simulador open-source para la clasificación virtual del AI Grand Prix, que cumple con las restricciones de la competición y funciona con Betaflight real. La herramienta basada en Rust/Bevy genera muestras de sensores de cámara directamente en el bucle, evitando la sobrecarga de motores de juego pesados.

OpenClaw Alexa Voice Proxy Permite la Interacción de Voz Bidireccional
openclaw-alexa-voice es un proxy de Node.js que conecta una Skill Personalizada de Alexa con la puerta de enlace OpenClaw mediante un sistema de respuesta de tres niveles para consultas de voz. Maneja respuestas rápidas en menos de 1 segundo, respuestas del agente en menos de 12 segundos y consultas complejas diferidas que se procesan de forma asincrónica en un plazo de 2 minutos.

Código Abierto del-vibe-stack: Reglas de Markdown para Mantener la Consistencia del Código Claude
Un desarrollador ha liberado como código abierto 'the-vibe-stack' — un conjunto de reglas de Markdown diseñadas para mantener a Claude Code en el camino correcto durante sesiones largas mediante la imposición de un esquema rígido. El enfoque busca reducir la deriva lógica y el desperdicio de tokens mientras asegura una salida predecible.