Tests de référence absurdes Résistance des LLM aux invites dénuées de sens

✍️ OpenClawRadar📅 Publié: February 25, 2026🔗 Source
Tests de référence absurdes Résistance des LLM aux invites dénuées de sens
Ad

Ce que mesure le Bullshit Benchmark

Le Bullshit Benchmark est un outil permettant de tester si les grands modèles de langage (LLM) identifient et résistent aux invites absurdes plutôt que d'y répondre avec assurance. Il mesure à quel point un modèle est prêt à suivre un non-sens évident, abordant les inquiétudes selon lesquelles les modèles pourraient induire eux-mêmes des hallucinations en essayant d'être utiles au lieu de signaler les invites problématiques.

Résultats clés du benchmark

Selon le matériel source, les modèles Claude montrent des performances nettement supérieures à celles des modèles Gemini dans la détection du non-sens. Les résultats confirment l'intuition que les modèles Claude sont meilleurs dans cette capacité spécifique.

Un exemple du benchmark montre que Claude identifie avec succès une question absurde tandis que Gemini échoue. Plus précisément, Gemini 3.1 Pro n'a pas réussi à détecter une question manifestement absurde, même avec un effort de réflexion élevé activé, générant à la place une réponse dénuée de sens.

La source suggère que l'approche de post-formation d'Anthropic contribue aux meilleures performances de Claude, notant que les LLM ont naturellement tendance à adopter une pensée associative superficielle qui génère des relations fallacieuses entre les concepts. Anthropic semble avoir abordé ce problème dans son pipeline de post-formation.

Ad

Pourquoi cela importe pour les agents d'IA de codage

Pour les développeurs utilisant des assistants de codage par IA, la capacité d'un modèle à reconnaître les invites absurdes est cruciale. Lorsque les modèles répondent avec assurance à des questions dépourvues de sens au lieu de résister, ils peuvent induire en erreur les utilisateurs et générer du code ou des explications incorrects. Ce benchmark offre un moyen concret d'évaluer ce comportement de sécurité spécifique à travers différents modèles.

Vous pouvez consulter les résultats complets du benchmark à https://petergpt.github.io/bullshit-benchmark/viewer/index.html.

📖 Lire la source complète : r/ClaudeAI

Ad

👀 See Also

Infracost réduit l'utilisation des tokens Claude de 79% en reconcevant l'interface CLI pour les agents IA
Tools

Infracost réduit l'utilisation des tokens Claude de 79% en reconcevant l'interface CLI pour les agents IA

Infracost a repensé son CLI pour les appelants d'agents IA, réduisant les tokens de sortie de Claude de 79 % et le coût API de 67 % par rapport à une référence Claude seule. Les axes clés : prédicat pushdown dans le CLI et un format de sortie économe en tokens.

OpenClawRadar
🦀
Tools

Keenable SELECT : Exécuter des requêtes SQL sur les résultats de recherche Web

Keenable SELECT est un serveur MCP qui vous permet d'interroger le web avec SQL. Un seul appel peut rechercher plus de 1 000 pages, filtrer avec des clauses WHERE précises et extraire des champs via LLM—le tout dans une seule instruction SELECT.

OpenClawRadar
ETL-D Serveur MCP : Analyse CSV Déterministe pour Claude afin de Prévenir les Hallucinations Financières
Tools

ETL-D Serveur MCP : Analyse CSV Déterministe pour Claude afin de Prévenir les Hallucinations Financières

Un développeur a créé ETL-D, un serveur MCP open-source pour Claude Desktop qui traite les fichiers CSV en trois couches déterministes pour éviter les hallucinations de points décimaux dans les données financières. Il utilise des analyseurs Python pour les formats connus, atteint des temps de réponse d'environ 70 ms avec 0 appel LLM pour 200 requêtes parallèles, et n'utilise les LLM qu'en secours pour le texte à haute entropie.

OpenClawRadar
Passerelle API x402 pour les Bots OpenClaw : Un Seul Point d'Accès Remplace 18 Clés API
Tools

Passerelle API x402 pour les Bots OpenClaw : Un Seul Point d'Accès Remplace 18 Clés API

Une passerelle API x402 élimine le besoin de multiples clés API dans les bots OpenClaw en fournissant l'accès à 18 services, dont un routeur LLM intelligent, la recherche web, les cartes, les voyages, la nourriture, l'IA et les données financières, via un seul point d'accès authentifié par des crédits de portefeuille USDC.

OpenClawRadar