Pruebas de referencia de tonterías: resistencia de LLM a indicaciones sin sentido

✍️ OpenClawRadar📅 Publicado: 25 de febrero de 2026🔗 Source
Pruebas de referencia de tonterías: resistencia de LLM a indicaciones sin sentido
Ad

Qué mide el Bullshit Benchmark

El Bullshit Benchmark es una herramienta para probar si los modelos de lenguaje grandes (LLM) identifican y rechazan indicaciones sin sentido en lugar de responderlas con confianza. Mide cuánto está dispuesto un modelo a seguir un absurdo obvio, abordando la preocupación de que los modelos puedan autoinducir alucinaciones al intentar ser útiles en lugar de señalar indicaciones problemáticas.

Resultados clave del benchmark

Según el material fuente, los modelos Claude muestran un rendimiento significativamente mejor que los modelos Gemini en la detección de sinsentidos. Los resultados respaldan la intuición de que los modelos Claude son mejores en esta capacidad específica.

Un ejemplo del benchmark muestra que Claude identificó con éxito una pregunta sin sentido mientras que Gemini falló. Específicamente, Gemini 3.1 Pro no logró detectar una pregunta obviamente absurda incluso con un alto esfuerzo de pensamiento habilitado, generando en su lugar una respuesta sin sentido.

La fuente sugiere que el enfoque de post-entrenamiento de Anthropic contribuye al mejor rendimiento de Claude, señalando que los LLM tienden naturalmente hacia un pensamiento asociativo superficial que genera relaciones espurias entre conceptos. Anthropic parece haber abordado este problema en su pipeline de post-entrenamiento.

Ad

Por qué esto importa para los agentes de IA de codificación

Para los desarrolladores que utilizan asistentes de codificación con IA, la capacidad de un modelo para reconocer indicaciones sin sentido es crucial. Cuando los modelos responden con confianza a preguntas absurdas en lugar de rechazarlas, pueden desorientar a los usuarios y generar código o explicaciones incorrectos. Este benchmark proporciona una forma concreta de evaluar este comportamiento de seguridad específico en diferentes modelos.

Puedes ver los resultados completos del benchmark en https://petergpt.github.io/bullshit-benchmark/viewer/index.html.

📖 Read the full source: r/ClaudeAI

Ad

👀 Ver también

iai-mcp: Un demonio local para memoria persistente de OpenClaw entre sesiones
Herramientas

iai-mcp: Un demonio local para memoria persistente de OpenClaw entre sesiones

iai-mcp es un daemon de código abierto que captura todas las conversaciones de OpenClaw, las almacena en tres niveles de memoria con incrustaciones neuronales locales y cifrado AES-256, y devuelve el contexto relevante en nuevas sesiones: recuerdo textual >99 %, recuperación <100 ms, costo de inicio de sesión <3k tokens.

OpenClawRadar
Claude Code v2.1.59 agrega memoria automática, comando de copia y mejoras en la terminal.
Herramientas

Claude Code v2.1.59 agrega memoria automática, comando de copia y mejoras en la terminal.

Claude Code v2.1.59 introduce el guardado automático de contexto en la memoria automática con gestión de /memory, añade un comando /copy para la selección interactiva de bloques de código, y mejora las sugerencias de prefijos para comandos compuestos de bash.

OpenClawRadar
Toolport: Una puerta de enlace local para gestionar servidores MCP una vez en todas las aplicaciones
Herramientas

Toolport: Una puerta de enlace local para gestionar servidores MCP una vez en todas las aplicaciones

Toolport es una aplicación de escritorio gratuita y de código abierto, y una puerta de enlace local que centraliza las configuraciones de servidores MCP, almacena claves API en el llavero del sistema operativo y añade capas de seguridad para agentes de IA.

OpenClawRadar
Explorando LiveDocs: Un Cuaderno de Análisis de Datos Nativo de IA
Herramientas

Explorando LiveDocs: Un Cuaderno de Análisis de Datos Nativo de IA

LiveDocs ofrece un entorno de cuaderno reactivo que permite a los equipos de datos realizar análisis de varios pasos y mantener el análisis de principio a fin con la ayuda de un agente de IA.

OpenClawRadar