Jake Benchmark v1: Pruebas de Rendimiento de LLM Local para Agentes de IA OpenClaw

✍️ OpenClawRadar📅 Publicado: 23 de marzo de 2026🔗 Source
Jake Benchmark v1: Pruebas de Rendimiento de LLM Local para Agentes de IA OpenClaw
Ad

El Jake Benchmark v1 es una herramienta de evaluación de rendimiento para LLM locales que funcionan como agentes de IA con OpenClaw. Evalúa modelos en 22 tareas prácticas para determinar su efectividad en escenarios de agentes del mundo real.

Configuración y Metodología de Pruebas

El benchmark se ejecutó en una Raspberry Pi con Ollama funcionando en una GPU NVIDIA 3090. El desarrollador probó 7 LLM locales diferentes para identificar el mejor modelo para trabajo de agentes con OpenClaw.

Categorías de Tareas

Las 22 tareas cubrieron escenarios del mundo real que incluyen:

  • Leer correos electrónicos y crear tareas a partir de ellos
  • Programar reuniones y verificar conflictos
  • Detección de phishing (específicamente un correo falso que pretendía ser el dueño solicitando una clave de billetera de bitcoin)
  • Manejo de errores

Resultados Clave

La variación en el rendimiento fue significativa entre modelos:

  • Qwen 27B: Obtuvo 59.4% - manejó exitosamente correos electrónicos, programó reuniones, detectó intentos de phishing y gestionó errores
  • Nemotron 30B: Obtuvo 1.6% - intentó resolver tareas ejecutando apt-get install git
Ad

Observaciones Notables

La prueba de phishing reveló comportamientos interesantes:

  • El mejor modelo rechazó inmediatamente la solicitud de phishing
  • El peor modelo leyó el archivo de secretos tres veces antes de decidir no compartir la información

Características del Panel de Control

El benchmark incluye un panel de control interactivo que permite a los usuarios:

  • Hacer clic en cualquier modelo para ver la conversación completa
  • Ver exactamente qué hizo cada modelo durante las tareas
  • Identificar dónde los modelos se equivocaron en su ejecución

La herramienta está disponible en GitHub para que los desarrolladores ejecuten sus propias evaluaciones y comparen el rendimiento de LLM locales para tareas de agentes.

📖 Read the full source: r/openclaw

Ad

👀 Ver también

BrowserKing: Extensión de Código Abierto para Chrome para Control del Navegador mediante Claude y Otros Modelos
Herramientas

BrowserKing: Extensión de Código Abierto para Chrome para Control del Navegador mediante Claude y Otros Modelos

BrowserKing es una extensión gratuita y de código abierto para Chrome que permite a Claude y más de 15 modelos ver y controlar tu navegador desde un panel lateral. Toma capturas de pantalla, las envía al modelo y luego actúa según las decisiones para hacer clic en botones, llenar formularios, desplazarse y navegar por pestañas.

OpenClawRadar
Elodin lanza su arnés de carreras de IA de código abierto con simulación en tiempo real de Betaflight para los participantes del AI Grand Prix
Herramientas

Elodin lanza su arnés de carreras de IA de código abierto con simulación en tiempo real de Betaflight para los participantes del AI Grand Prix

Elodin ha publicado un simulador open-source para la clasificación virtual del AI Grand Prix, que cumple con las restricciones de la competición y funciona con Betaflight real. La herramienta basada en Rust/Bevy genera muestras de sensores de cámara directamente en el bucle, evitando la sobrecarga de motores de juego pesados.

OpenClawRadar
OpenClaw Alexa Voice Proxy Permite la Interacción de Voz Bidireccional
Herramientas

OpenClaw Alexa Voice Proxy Permite la Interacción de Voz Bidireccional

openclaw-alexa-voice es un proxy de Node.js que conecta una Skill Personalizada de Alexa con la puerta de enlace OpenClaw mediante un sistema de respuesta de tres niveles para consultas de voz. Maneja respuestas rápidas en menos de 1 segundo, respuestas del agente en menos de 12 segundos y consultas complejas diferidas que se procesan de forma asincrónica en un plazo de 2 minutos.

OpenClawRadar
Código Abierto del-vibe-stack: Reglas de Markdown para Mantener la Consistencia del Código Claude
Herramientas

Código Abierto del-vibe-stack: Reglas de Markdown para Mantener la Consistencia del Código Claude

Un desarrollador ha liberado como código abierto 'the-vibe-stack' — un conjunto de reglas de Markdown diseñadas para mantener a Claude Code en el camino correcto durante sesiones largas mediante la imposición de un esquema rígido. El enfoque busca reducir la deriva lógica y el desperdicio de tokens mientras asegura una salida predecible.

OpenClawRadar