Tests de référence absurdes Résistance des LLM aux invites dénuées de sens

✍️ OpenClawRadar📅 Publié: February 25, 2026🔗 Source
Tests de référence absurdes Résistance des LLM aux invites dénuées de sens
Ad

Ce que mesure le Bullshit Benchmark

Le Bullshit Benchmark est un outil permettant de tester si les grands modèles de langage (LLM) identifient et résistent aux invites absurdes plutôt que d'y répondre avec assurance. Il mesure à quel point un modèle est prêt à suivre un non-sens évident, abordant les inquiétudes selon lesquelles les modèles pourraient induire eux-mêmes des hallucinations en essayant d'être utiles au lieu de signaler les invites problématiques.

Résultats clés du benchmark

Selon le matériel source, les modèles Claude montrent des performances nettement supérieures à celles des modèles Gemini dans la détection du non-sens. Les résultats confirment l'intuition que les modèles Claude sont meilleurs dans cette capacité spécifique.

Un exemple du benchmark montre que Claude identifie avec succès une question absurde tandis que Gemini échoue. Plus précisément, Gemini 3.1 Pro n'a pas réussi à détecter une question manifestement absurde, même avec un effort de réflexion élevé activé, générant à la place une réponse dénuée de sens.

La source suggère que l'approche de post-formation d'Anthropic contribue aux meilleures performances de Claude, notant que les LLM ont naturellement tendance à adopter une pensée associative superficielle qui génère des relations fallacieuses entre les concepts. Anthropic semble avoir abordé ce problème dans son pipeline de post-formation.

Ad

Pourquoi cela importe pour les agents d'IA de codage

Pour les développeurs utilisant des assistants de codage par IA, la capacité d'un modèle à reconnaître les invites absurdes est cruciale. Lorsque les modèles répondent avec assurance à des questions dépourvues de sens au lieu de résister, ils peuvent induire en erreur les utilisateurs et générer du code ou des explications incorrects. Ce benchmark offre un moyen concret d'évaluer ce comportement de sécurité spécifique à travers différents modèles.

Vous pouvez consulter les résultats complets du benchmark à https://petergpt.github.io/bullshit-benchmark/viewer/index.html.

📖 Lire la source complète : r/ClaudeAI

Ad

👀 See Also

Lat.md : Un Graphe de Connaissance Basé sur Markdown pour les Bases de Code
Tools

Lat.md : Un Graphe de Connaissance Basé sur Markdown pour les Bases de Code

Lat.md crée un graphe de connaissances pour les bases de code en utilisant des fichiers markdown interconnectés dans un répertoire lat.md/. Il résout les problèmes d'échelle liés à la documentation monolithique en reliant les sections avec [[liens wiki]], en se connectant au code source via des commentaires comme // @lat: [[section-id]], et en fournissant des outils CLI pour la validation et la recherche.

OpenClawRadar
MiniMax Music 2.5 Générateur de Musique IA Lancé avec un Contrôle Audio de Qualité Studio
Tools

MiniMax Music 2.5 Générateur de Musique IA Lancé avec un Contrôle Audio de Qualité Studio

MiniMax Music 2.5 est un modèle de génération musicale par IA qui crée des chansons de qualité studio avec une sortie Hi-Fi 44,1 kHz, plus de 100 instruments et un contrôle de précision au niveau des paragraphes utilisant plus de 14 balises structurelles pour diriger la structure des chansons.

OpenClawRadar
Cowork Context Management Kit Résout le Problème de Surcharge de Fichiers de Claude
Tools

Cowork Context Management Kit Résout le Problème de Surcharge de Fichiers de Claude

Un développeur a créé un kit de gestion de contexte pour Cowork après que Claude AI lisait les 462 fichiers de leur dossier de projet, causant des problèmes de performance et des contradictions. La solution comprend des instructions globales, un système de fichiers manifeste et une compétence Cowork pour prioriser les documents pertinents.

OpenClawRadar
Code Claude utilisé pour simuler plus de 4 000 parties de Loup-garou aveugle avec des LLM
Tools

Code Claude utilisé pour simuler plus de 4 000 parties de Loup-garou aveugle avec des LLM

Un développeur a utilisé Claude Code pour créer un simulateur où des LLM jouent à Loup-garou en une nuit sans informations, exécutant environ 4 600 parties avec des modèles d'OpenAI et xAI. L'expérience a révélé des schémas de vote cohérents basés sur les noms malgré des signaux de jeu minimaux.

OpenClawRadar