Pruebas de referencia de tonterías: resistencia de LLM a indicaciones sin sentido

Qué mide el Bullshit Benchmark
El Bullshit Benchmark es una herramienta para probar si los modelos de lenguaje grandes (LLM) identifican y rechazan indicaciones sin sentido en lugar de responderlas con confianza. Mide cuánto está dispuesto un modelo a seguir un absurdo obvio, abordando la preocupación de que los modelos puedan autoinducir alucinaciones al intentar ser útiles en lugar de señalar indicaciones problemáticas.
Resultados clave del benchmark
Según el material fuente, los modelos Claude muestran un rendimiento significativamente mejor que los modelos Gemini en la detección de sinsentidos. Los resultados respaldan la intuición de que los modelos Claude son mejores en esta capacidad específica.
Un ejemplo del benchmark muestra que Claude identificó con éxito una pregunta sin sentido mientras que Gemini falló. Específicamente, Gemini 3.1 Pro no logró detectar una pregunta obviamente absurda incluso con un alto esfuerzo de pensamiento habilitado, generando en su lugar una respuesta sin sentido.
La fuente sugiere que el enfoque de post-entrenamiento de Anthropic contribuye al mejor rendimiento de Claude, señalando que los LLM tienden naturalmente hacia un pensamiento asociativo superficial que genera relaciones espurias entre conceptos. Anthropic parece haber abordado este problema en su pipeline de post-entrenamiento.
Por qué esto importa para los agentes de IA de codificación
Para los desarrolladores que utilizan asistentes de codificación con IA, la capacidad de un modelo para reconocer indicaciones sin sentido es crucial. Cuando los modelos responden con confianza a preguntas absurdas en lugar de rechazarlas, pueden desorientar a los usuarios y generar código o explicaciones incorrectos. Este benchmark proporciona una forma concreta de evaluar este comportamiento de seguridad específico en diferentes modelos.
Puedes ver los resultados completos del benchmark en https://petergpt.github.io/bullshit-benchmark/viewer/index.html.
📖 Read the full source: r/ClaudeAI
👀 Ver también

VibeIndex.ai: Centro de búsqueda para más de 90K habilidades de IA, MCPs y complementos con escaneo de seguridad
Un investigador coreano de IA ha creado vibeindex.ai, un centro de búsqueda que indexa más de 90,000 habilidades de IA, servidores MCP y complementos con actualizaciones cada hora y escaneo de seguridad utilizando Cisco Skill Scanner en 17 categorías de amenazas.

La herramienta de lectura de Claude Code reduce silenciosamente la calidad de las imágenes, provocando alucinaciones
La herramienta `read` de Claude Code reduce silenciosamente la resolución de las imágenes antes de que el modelo las vea, provocando resultados degradados y alucinaciones no reconocidas al extraer texto de capturas de pantalla.

Consola del Piloto: Panel Web para Gestionar Redes de Agentes de IA Privados
Un desarrollador utilizó Claude para construir Pilot Console, una interfaz web para gestionar redes privadas de agentes basadas en Pilot Protocol. El panel de control proporciona configuración visual, incorporación de agentes, monitoreo de flotas y control API para flujos de trabajo multiagente.

boxBot: Un altavoz inteligente de código abierto impulsado por Claude y Hailo AI
Un desarrollador construyó un altavoz inteligente llamado boxBot utilizando Claude para el control de hardware basado en agentes, Raspberry Pi, acelerador de IA Hailo y SDK personalizado, código abierto en GitHub.