Correction de la vitesse de traitement des prompts dans Llama.cpp à l'aide du paramètre --ubatch-size

Optimisation du traitement des invites dans Llama.cpp
Un utilisateur de Reddit a partagé son expérience d'optimisation de la vitesse de traitement des invites dans Llama.cpp lors de l'utilisation de modèles plus volumineux comme Qwen 27B. Il a découvert que l'ajustement du paramètre --ubatch-size améliorait considérablement les performances.
Principales découvertes
L'utilisateur a expérimenté avec le paramètre --ubatch-size après avoir eu du mal à comprendre son fonctionnement à partir de la documentation et avoir obtenu des résultats mitigés avec les assistants IA. Il "ajustait les jauges" par plaisir et a utilisé la méthode essai-erreur pour trouver les paramètres optimaux.
Pour son GPU Radeon 9070XT avec 64 Mo de cache L3, le réglage de --ubatch-size à 64 a entraîné des améliorations spectaculaires de vitesse :
- Le traitement des invites est devenu "réellement utilisable pour l'invocation de code Claude"
- Les performances étaient "extrêmement rapides" par rapport à des valeurs plus élevées
- Il a remarqué un sifflement de bobine du GPU lors de la découverte du réglage optimal
La valeur par défaut de --ubatch-size semble être 512, ce que l'utilisateur a trouvé donner de mauvais résultats lorsqu'elle n'est pas modifiée. Il a reconnu que cela pourrait être évident pour les utilisateurs plus expérimentés, mais a partagé ses découvertes pour aider d'autres personnes qui pourraient rencontrer des difficultés similaires.
Cette approche d'optimisation consiste à faire correspondre le paramètre --ubatch-size à la taille spécifique du cache L3 de votre GPU en mégaoctets, ce qui peut être particulièrement bénéfique lors de l'utilisation de modèles de langage plus volumineux qui nécessitent une gestion efficace de la mémoire pendant le traitement des invites.
📖 Read the full source: r/LocalLLaMA
👀 See Also
Conseil de performance : Verrouiller la VRAM/RAM du modèle local avec LimitMEMLOCK=infinity
Une astuce pour les unités systemd des serveurs de modèles locaux LM Studio : ajoutez LimitMEMLOCK=infinity sous [Service] afin d'empêcher le pagination des poids du modèle lorsque ceux-ci tiennent dans la VRAM et la RAM.

Traduire en fr : Crochet d'utilisation de l'outil de publication personnalisé pour le chargement à la demande de CLAUDE.md en dehors de l'arborescence du projet
Un développeur partage une solution personnalisée de crochet PostToolUse qui permet à Claude Code de lire les fichiers CLAUDE.md de répertoires en dehors de l'arborescence du projet actuel à la demande, répondant ainsi aux limitations du comportement de chargement intégré.

Comment réparer les approximations CSS de Claude Code avec un système de design
Un développeur a constaté que Claude Code régénère sans cesse du HTML/CSS mal aligné car il conçoit à l'aveugle sans retour visuel. La solution : fournir un système de design complet avec des variables d'espacement, de couleurs et de typographie, puis séparer les instructions HTML et CSS.

Correction de l'Erreur Auth 400 : Utilisation du Package mnemonic de Python pour Éviter les Déclencheurs du Filtre BIP39
Un utilisateur de Reddit a identifié que le filtre de contenu d'Anthropic déclenche une erreur 400 lorsque des agents IA tentent d'écrire la liste complète de mots BIP39 (2048 mots anglais standardisés) dans du code Python. La solution consiste à utiliser le package Python mnemonic à la place, qui contient la liste de mots en interne.