Mercure 2 : Modèle basé sur la diffusion pour le codage IA en temps réel

Qu'est-ce que Mercury 2
Mercury 2 est un modèle d'IA basé sur la diffusion qui génère des tokens en parallèle plutôt que séquentiellement, en utilisant un processus qui affine la sortie sur plusieurs étapes. Cette approche diffère des modèles autorégressifs traditionnels qui décodent les tokens un par un.
Spécifications techniques
- Méthode de génération : Génération basée sur la diffusion au lieu d'un décodage séquentiel token par token
- Approche de traitement : Génère les tokens en parallèle et les affine sur quelques étapes
- Performances : Revendique 1 009 tokens/sec sur les GPU NVIDIA Blackwell
- Tarification : 0,25 $ par million de tokens en entrée, 0,75 $ par million de tokens en sortie
- Fenêtre de contexte : 128 000 tokens
- Capacité de raisonnement : Raisonnement ajustable
- Intégration d'outils : Utilisation native d'outils avec sortie JSON alignée sur le schéma
- Compatibilité API : Compatible avec l'API OpenAI
Cas d'utilisation ciblés
Les développeurs positionnent Mercury 2 pour :
- Assistants de codage
- Boucles agentiques (chaînes d'inférence multi-étapes)
- Systèmes vocaux en temps réel
- Pipelines RAG/recherche avec récupération multi-sauts
📖 Lire la source complète : r/LocalLLaMA
👀 See Also

Claude-Code v2.1.31 : Principales mises à jour et corrections de bogues
Claude-Code v2.1.31 a été publié avec des améliorations importantes incluant des indications de reprise de session, la prise en charge de l'IME japonais et des corrections de bugs pour la gestion des PDF et les requêtes API.

DeepSeek-V4 Pro et Flash : 1,6 T de paramètres, contexte de 1 M de tokens, attention hybride
DeepSeek-V4-Pro (1,6 billion de paramètres, 49B activés) et V4-Flash (284B de paramètres, 13B activés) prennent en charge un contexte de 1 million de tokens. La nouvelle attention hybride (CSA + HCA) réduit les FLOPs d'inférence par token à 27% et le cache KV à 10% de ceux de DeepSeek-V3.2.

Les agents d'IA ont besoin de primitives de restauration, pas seulement d'autonomie
Un développeur affirme que les frameworks d'agents doivent adopter des concepts de bases de données comme ACID, les sagas et les actions compensatoires pour gérer les échecs partiels, plutôt que de compter sur les LLM pour « se débrouiller ».

Les modèles de pointe d'OpenAI et Codex désormais disponibles sur AWS
Les modèles de pointe d'OpenAI et Codex sont désormais disponibles sur AWS, permettant aux entreprises d'utiliser OpenAI via leurs environnements AWS et processus d'approvisionnement existants.