La limite de débit OAuth non documentée d'Anthropic nécessite un prompt système Claude Code

Un développeur créant un proxy LLM a découvert que la gestion des limites de débit d'Anthropic pour les jetons OAuth dépend du contenu du prompt système, pas des en-têtes ou du type de jeton.
Le problème
Le développeur avait une configuration fonctionnelle avec :
- SDK Anthropic avec authToken
- En-têtes bêta (claude-code-20250219, oauth-2025-04-20)
- user-agent : claude-cli/2.1.75
- x-app : cli
Haiku fonctionnait bien, mais Sonnet renvoyait des erreurs persistantes de limite de débit 429 sans en-tête retry-after, sans en-têtes de limite de débit, juste "message" : "Erreur". Pendant ce temps, un agent IA (exécutant OpenClaw) sur le même serveur avec le même jeton OAuth n'avait aucun problème avec Sonnet 4.6.
La solution
Après avoir examiné le code source du fournisseur Anthropic d'OpenClaw (@mariozechner/pi-ai), le développeur a trouvé ce code :
// Pour les jetons OAuth, nous DEVONS inclure l'identité Claude Code
if (isOAuthToken) {
params.system = [{
type: "text",
text: "You are Claude Code, Anthropic's official CLI for Claude.",
}];
}
Ajouter cette seule ligne au proxy a immédiatement résolu les erreurs de limite de débit Sonnet.
Comment cela fonctionne
L'API achemine les requêtes vers le pool de limites de débit Claude Code (qui est séparé et plus élevé que le pool API régulier) en fonction de si votre prompt système s'identifie comme Claude Code. Ce comportement n'est pas documenté dans la documentation du SDK ou de l'API.
Solution pratique
Si vous utilisez des jetons OAuth Anthropic et obtenez des erreurs 429 mystérieuses, ajoutez "You are Claude Code, Anthropic's official CLI for Claude." à votre prompt système.
📖 Lire la source complète : r/ClaudeAI
👀 See Also

Claude CLI v2.1.154 brise le vLLM local — un correctif d'une ligne le répare
Claude CLI ≥2.1.154 ajoute trois nouveaux rôles API (ctx, msg, system) qui cassent la compatibilité avec les serveurs vLLM locaux. Un correctif d'une ligne dans le protocole Anthropic de vLLM rétablit la compatibilité.

100 000 lignes de Rust avec l'IA : contrats, développement piloté par les spécifications et performance
Cheng Huang a construit un moteur multi-Paxos en Rust avec des agents IA, atteignant 300K opérations par seconde. Techniques clés : contrats de code générés par IA, développement dirigé par spécifications léger et optimisation agressive.

Réduisez de 43% les tokens de Cut OpenClaw en affinant l'outil et les fichiers mémoire
Réduction des jetons de démarrage d'environ 9 457 à environ 5 400 (43 % de baisse) en convertissant TOOLS.md en un index, en déplaçant les détails des outils dans des fichiers séparés et en mettant en œuvre une promotion mémoire par étapes.

Comment je sollicite les modèles d'IA en 2026 vs il y a un an : 3 changements clés
Un développeur partage trois changements concrets : passer des templates de prompt aux compétences réutilisables, écrire des objectifs au lieu d'instructions étape par étape, et utiliser les commandes /loop pour les projets longue durée dans Claude Code et Codex.