Anam Cara-3 : Avancées dans les avatars IA interactifs

Anam a publié son dernier modèle, cara-3, conçu pour créer des avatars interactifs. L'avatar utilise un pipeline en deux étapes où un transformateur de diffusion convertit l'audio en embeddings de mouvement (incluant la position de la tête, le regard des yeux, la forme des lèvres et l'expression). Ces embeddings sont ensuite appliqués à une image de référence pour générer des trames vidéo, permettant d'animer n'importe quel visage sans nécessiter de réentraînement.
Notamment, Cara-3 peut atteindre un temps jusqu'à la première trame d'environ 70 ms sur un H200, ce qui permet de nombreuses sessions d'avatar simultanées sur un seul GPU. Cette vitesse est en partie due à la variante novatrice de correspondance de flux utilisée pour la transformation audio-mouvement, les techniques conventionnelles s'étant avérées instables.
Une évaluation indépendante en aveugle a montré que Cara-3 surpassait des concurrents comme HeyGen, Tavus et D-ID, obtenant un score 24 % plus élevé en moyenne sur diverses métriques. La réactivité, mise en évidence par un coefficient de corrélation de Spearman de 0,697, s'avère avoir plus d'impact sur l'expérience utilisateur que la qualité visuelle (0,473).
Anam a également rendu open source le backbone de son pipeline de données d'entraînement, Metaxy, pour faciliter le développement itératif sans reprendre des étapes coûteuses.
📖 Lire la source complète : HN AI Agents
👀 See Also

Alibaba va interdire Claude Code sur le lieu de travail en raison de risques présumés de porte dérobée
Selon une source, Alibaba interdirait Claude Code sur son lieu de travail en raison de risques présumés de porte dérobée. Cette décision met en lumière les préoccupations croissantes en matière de sécurité concernant les agents de codage IA dans les environnements professionnels.

Étude de l'ETH Zurich : Un contexte excessif réduit les performances des agents d'IA en programmation
Une étude de l'ETH Zurich a testé quatre agents de codage sur 138 tâches réelles de GitHub et a constaté que les fichiers de contexte générés par LLM réduisaient les taux de réussite des tâches de 2 à 3 % tout en augmentant les coûts d'inférence de 20 %. Le contexte écrit par l'homme n'a amélioré la réussite que d'environ 4 % avec des augmentations de coûts significatives.

Fuite de l'OS AI léger de Windows 11 basé sur Edge, non publié par Microsoft
Une version allégée de Windows 11 AI OS de Microsoft, centrée sur Edge, a fuité. Destinée aux appareils modestes et aux workflows IA, elle intègre Edge comme composant principal.

DeepSeek v4 Flash sur Mac Studio : un LLM local détecte de vrais bugs dans le code du compilateur
Un développeur partage que DeepSeek v4 Flash fonctionnant sur un Mac Studio de 128 Go identifie avec succès des bugs valides dans une base de code de compilateur, une tâche impossible avec les LLM locaux il y a 5 mois.