Pruebas de referencia de tonterías: resistencia de LLM a indicaciones sin sentido

✍️ OpenClawRadar📅 Publicado: 25 de febrero de 2026🔗 Source
Pruebas de referencia de tonterías: resistencia de LLM a indicaciones sin sentido
Ad

Qué mide el Bullshit Benchmark

El Bullshit Benchmark es una herramienta para probar si los modelos de lenguaje grandes (LLM) identifican y rechazan indicaciones sin sentido en lugar de responderlas con confianza. Mide cuánto está dispuesto un modelo a seguir un absurdo obvio, abordando la preocupación de que los modelos puedan autoinducir alucinaciones al intentar ser útiles en lugar de señalar indicaciones problemáticas.

Resultados clave del benchmark

Según el material fuente, los modelos Claude muestran un rendimiento significativamente mejor que los modelos Gemini en la detección de sinsentidos. Los resultados respaldan la intuición de que los modelos Claude son mejores en esta capacidad específica.

Un ejemplo del benchmark muestra que Claude identificó con éxito una pregunta sin sentido mientras que Gemini falló. Específicamente, Gemini 3.1 Pro no logró detectar una pregunta obviamente absurda incluso con un alto esfuerzo de pensamiento habilitado, generando en su lugar una respuesta sin sentido.

La fuente sugiere que el enfoque de post-entrenamiento de Anthropic contribuye al mejor rendimiento de Claude, señalando que los LLM tienden naturalmente hacia un pensamiento asociativo superficial que genera relaciones espurias entre conceptos. Anthropic parece haber abordado este problema en su pipeline de post-entrenamiento.

Ad

Por qué esto importa para los agentes de IA de codificación

Para los desarrolladores que utilizan asistentes de codificación con IA, la capacidad de un modelo para reconocer indicaciones sin sentido es crucial. Cuando los modelos responden con confianza a preguntas absurdas en lugar de rechazarlas, pueden desorientar a los usuarios y generar código o explicaciones incorrectos. Este benchmark proporciona una forma concreta de evaluar este comportamiento de seguridad específico en diferentes modelos.

Puedes ver los resultados completos del benchmark en https://petergpt.github.io/bullshit-benchmark/viewer/index.html.

📖 Read the full source: r/ClaudeAI

Ad

👀 Ver también

VibeIndex.ai: Centro de búsqueda para más de 90K habilidades de IA, MCPs y complementos con escaneo de seguridad
Herramientas

VibeIndex.ai: Centro de búsqueda para más de 90K habilidades de IA, MCPs y complementos con escaneo de seguridad

Un investigador coreano de IA ha creado vibeindex.ai, un centro de búsqueda que indexa más de 90,000 habilidades de IA, servidores MCP y complementos con actualizaciones cada hora y escaneo de seguridad utilizando Cisco Skill Scanner en 17 categorías de amenazas.

OpenClawRadar
La herramienta de lectura de Claude Code reduce silenciosamente la calidad de las imágenes, provocando alucinaciones
Herramientas

La herramienta de lectura de Claude Code reduce silenciosamente la calidad de las imágenes, provocando alucinaciones

La herramienta `read` de Claude Code reduce silenciosamente la resolución de las imágenes antes de que el modelo las vea, provocando resultados degradados y alucinaciones no reconocidas al extraer texto de capturas de pantalla.

OpenClawRadar
Consola del Piloto: Panel Web para Gestionar Redes de Agentes de IA Privados
Herramientas

Consola del Piloto: Panel Web para Gestionar Redes de Agentes de IA Privados

Un desarrollador utilizó Claude para construir Pilot Console, una interfaz web para gestionar redes privadas de agentes basadas en Pilot Protocol. El panel de control proporciona configuración visual, incorporación de agentes, monitoreo de flotas y control API para flujos de trabajo multiagente.

OpenClawRadar
boxBot: Un altavoz inteligente de código abierto impulsado por Claude y Hailo AI
Herramientas

boxBot: Un altavoz inteligente de código abierto impulsado por Claude y Hailo AI

Un desarrollador construyó un altavoz inteligente llamado boxBot utilizando Claude para el control de hardware basado en agentes, Raspberry Pi, acelerador de IA Hailo y SDK personalizado, código abierto en GitHub.

OpenClawRadar