Anam Cara-3 : Avancées dans les avatars IA interactifs

Anam a publié son dernier modèle, cara-3, conçu pour créer des avatars interactifs. L'avatar utilise un pipeline en deux étapes où un transformateur de diffusion convertit l'audio en embeddings de mouvement (incluant la position de la tête, le regard des yeux, la forme des lèvres et l'expression). Ces embeddings sont ensuite appliqués à une image de référence pour générer des trames vidéo, permettant d'animer n'importe quel visage sans nécessiter de réentraînement.
Notamment, Cara-3 peut atteindre un temps jusqu'à la première trame d'environ 70 ms sur un H200, ce qui permet de nombreuses sessions d'avatar simultanées sur un seul GPU. Cette vitesse est en partie due à la variante novatrice de correspondance de flux utilisée pour la transformation audio-mouvement, les techniques conventionnelles s'étant avérées instables.
Une évaluation indépendante en aveugle a montré que Cara-3 surpassait des concurrents comme HeyGen, Tavus et D-ID, obtenant un score 24 % plus élevé en moyenne sur diverses métriques. La réactivité, mise en évidence par un coefficient de corrélation de Spearman de 0,697, s'avère avoir plus d'impact sur l'expérience utilisateur que la qualité visuelle (0,473).
Anam a également rendu open source le backbone de son pipeline de données d'entraînement, Metaxy, pour faciliter le développement itératif sans reprendre des étapes coûteuses.
📖 Lire la source complète : HN AI Agents
👀 See Also

Concessionnaire BMW retire son offre de rachat après une erreur d'un chatbot IA, précédent de l'affaire Air Canada
Un concessionnaire BMW de Toronto a révoqué une offre de rachat générée par son chatbot IA, suscitant des questions juridiques. Le précédent d'Air Canada tient les entreprises responsables des erreurs de leurs chatbots.

Titre : Les Mac pour LLM local et OpenClaw : le goulot d'étranglement du traitement des prompts rend le cloud moins cher
Un développeur partage que les Mac sont lents pour le traitement des prompts par rapport aux GPU Nvidia, ce qui rend les modèles cloud comme Deepseek plus rentables pour les agents IA, sauf si la vie privée nécessite une inférence locale.

inclusionAI dévoile Ling-2.6-1T : modèle à trillion de paramètres en architecture hybride avec attention éparse et pensée rapide
Ling-2.6-1T est un nouveau modèle open-source de mille milliards de paramètres qui combine MLA et Attention Linéaire pour une efficacité en contexte long, en utilisant la Suppression de Redondance de Processus Contextuel pour réduire les chaînes de pensée verbeuses. Il atteint un SOTA open-source sur AIME26, SWE-bench Verified, BFCL-V4, TAU2-Bench et IFBench.

Application Claude Desktop Télécharge Silencieusement un Fichier de 13 Go à Chaque Lancement Sans Option de Désactivation
L'application de bureau Claude télécharge automatiquement un fichier d'environ 12,95 Go appelé claudevm.bundle à chaque lancement, même pour les utilisateurs qui n'utilisent pas Claude Code. Le support d'Anthropic a confirmé que cela est intentionnel et que les utilisateurs individuels n'ont aucun moyen de le désactiver.