Dégradation de la qualité contextuelle chez les agents d'IA : les taux d'hallucination augmentent avec le nombre de tokens

✍️ OpenClawRadar📅 Publié: March 28, 2026🔗 Source
Dégradation de la qualité contextuelle chez les agents d'IA : les taux d'hallucination augmentent avec le nombre de tokens
Ad

Résultats des tests de performance de la fenêtre contextuelle

Un développeur a testé la dégradation de la qualité du contexte à travers différents comptes de tokens dans les agents d'IA, révélant des problèmes de performance significatifs à mesure que la taille du contexte augmente.

Principales conclusions des tests

Les tests ont mesuré plusieurs métriques critiques :

  • Taux d'hallucination par taille de contexte :
    • 10 000 tokens : ~3 %
    • 50 000 tokens : ~11 %
    • 200 000 tokens : ~28 %
    • 1 million de tokens : incertain, mais la tendance montre une dégradation croissante
  • Précision du rappel : Aucun modèle testé (y compris GPT-4, Claude ou les modèles locaux) n'a atteint 90 % de rappel sur les informations des 10 premiers tours une fois que le contexte a dépassé 50 000 tokens.
  • Efficacité des tokens : À 200 000 tokens, le pourcentage de contexte réellement pertinent pour la requête actuelle tombe en dessous de 12 % dans la plupart des tâches d'agent, ce qui signifie qu'environ 188 000 tokens ajoutent du bruit que le modèle doit raisonner autour.
Ad

Analyse du problème

Le problème semble être une famine d'attention plutôt qu'un oubli. Le contexte initial entre en compétition avec le contexte récent, le contexte récent l'emportant généralement en raison d'une pertinence positionnelle plus élevée. Cela provoque une dilution progressive des contraintes définies en début de session (comme "utiliser PostgreSQL, pas d'ORM") à mesure que plus de contexte s'accumule.

Au tour 89 avec 200 000 tokens, l'attention du modèle est tellement répartie sur le contexte que les contraintes initiales disparaissent effectivement.

Solutions actuelles et limites

De nombreux développeurs ajoutent des bases de données vectorielles pour récupérer des "souvenirs" pertinents, ce qui aide quelque peu. Cependant, cette approche récupère un contenu sémantiquement similaire plutôt que ce dont l'agent a besoin pour un raisonnement correct. Par exemple, "utiliser PostgreSQL" n'est pas sémantiquement similaire à "écris-moi un point de terminaison de connexion" même s'il doit être dans le contexte pour une exécution appropriée.

Le développeur cherche des retours sur la correspondance de ces résultats avec les expériences en production et sur les approches qui ont réellement fonctionné pour d'autres.

📖 Lire la Source complète : r/LocalLLaMA

Ad

👀 See Also

Autoresearch pousse Qwen3.5-397B à 20,34 tok/s sur M5 Max via le streaming SSD
News

Autoresearch pousse Qwen3.5-397B à 20,34 tok/s sur M5 Max via le streaming SSD

Un développeur a atteint une vitesse d'inférence de 20,34 tokens/seconde pour le modèle Qwen3.5-397B de 209 Go sur un MacBook Pro M5 Max avec 128 Go de RAM en utilisant le streaming SSD et 36 expériences systématiques. Ce résultat représente une accélération de 2x par rapport au point de référence du M5 Max et de 4,67x par rapport au résultat original du M3 Max.

OpenClawRadar
🦀
News

OpenClaw版本再次延迟发布:v2026.7.1升级测试出现问题

La sortie d'OpenClaw prévue le 18 août est retardée, car les tests ont révélé des problèmes avec les installations neuves et les mises à niveau depuis la v2026.7.1 et les versions antérieures. Aucune nouvelle date n'a été fixée.

OpenClawRadar
Protocole de Convergence Quumble v5 : Résultats de l'Expérimentation LLM Multi-Architecture
News

Protocole de Convergence Quumble v5 : Résultats de l'Expérimentation LLM Multi-Architecture

Le Protocole de Convergence Quumble v5 teste si des instances indépendantes de LLM convergent sur des descriptions de créatures imaginaires lorsqu'on leur donne des mots dépourvus de sens. Les résultats montrent que Claude (Opus 4.6 & Sonnet 4.6) et GPT-5.3 ont indépendamment produit une créature petite, ronde, douce, teintée de lavande, bioluminescente et qui bourdonne à partir du mot 'quumble'.

OpenClawRadar
Agent.Email : Les agents d'IA s'inscrivent via curl, réclamés par OTP humain
News

Agent.Email : Les agents d'IA s'inscrivent via curl, réclamés par OTP humain

Agent.Email d'AgentMail permet aux agents IA de se créer une boîte mail via curl, puis un humain la revendique avec un OTP. Accès restreint jusqu'à la revendication, limitation par IP.

OpenClawRadar