antirez's DS4 : Exécuter DeepSeek V4 Flash avec 1M de contexte sur Mac Metal et DGX

✍️ OpenClawRadar📅 Publié: May 10, 2026🔗 Source
antirez's DS4 : Exécuter DeepSeek V4 Flash avec 1M de contexte sur Mac Metal et DGX
Ad

Salvatore Sanfilippo, le créateur de Redis (antirez), vient de publier un nouveau projet appelé DS4 sur GitHub. L'objectif : faire fonctionner DeepSeek V4 Flash avec une fenêtre de contexte de 1 million de tokens sur du matériel Apple Silicon (Metal). Il a également posté une vidéo le montrant en action sur un système NVIDIA DGX.

Ce que fait DS4

DS4 utilise des techniques novatrices pour adapter une fenêtre de contexte de 1M pour DeepSeek V4 Flash sur du matériel Mac Metal (par exemple, les puces de la série M). Il a également été démontré sur un DGX, ce qui suggère qu'il pourrait fonctionner sur des GPU haut de gamme comme le Pro 6000 avec des fenêtres de contexte légèrement plus petites à vitesse plus élevée. On évoque un éventuel support futur pour AMD.

Ad

Ce qui est inclus

  • Points de terminaison serveur : Le serveur DS4 fournit déjà des API compatibles avec OpenAI et Anthropic, facilitant l'intégration dans des outils d'agents de codage comme Cursor, Continue.dev ou des agents personnalisés.
  • Dépôt GitHub : https://github.com/antirez/ds4/ — consultez le README pour les instructions d'installation, qui impliquent probablement une compilation avec le support Metal et le téléchargement des poids de DeepSeek V4 Flash.
  • Vidéo de démonstration : Il y a quelques heures, antirez a posté une vidéo sur X montrant le projet en action sur un DGX : https://x.com/antirez/status/2053381973226184749

À qui cela s'adresse

Développeurs disposant d'un Mac haut de gamme (par exemple, Mac Studio, MacBook Pro avec M1 Max/Ultra ou M2/M3) ou de GPU NVIDIA souhaitant exécuter un LLM local puissant avec une très grande fenêtre de contexte pour des agents de codage ou de la recherche.

Appel à la communauté

L'auteur du post Reddit encourage toute personne disposant de matériel puissant à consulter le projet et à contribuer — que ce soit en testant, en signalant des bogues ou en optimisant pour les GPU AMD. Le projet en est à ses débuts, donc l'implication de la communauté pourrait accélérer la compatibilité.

📖 Lire la source complète : r/LocalLLaMA

Ad

👀 See Also

cq : Un système de partage de connaissances local-first pour agents d'IA de codage
Tools

cq : Un système de partage de connaissances local-first pour agents d'IA de codage

cq de Mozilla.ai est un outil open-source qui permet aux agents d'IA de codage de partager des 'unités de connaissance' sur les pièges courants via un stockage SQLite local, avec un partage d'équipe optionnel via une API Docker. Il s'installe comme plugin Claude Code ou serveur MCP OpenCode.

OpenClawRadar
Lightning MLX : Moteur IA local rapide pour usage agentique sur Apple Silicon délivre 220 tok/s sur Qwen 35B-A3B
Tools

Lightning MLX : Moteur IA local rapide pour usage agentique sur Apple Silicon délivre 220 tok/s sur Qwen 35B-A3B

Lightning MLX revendique l'inférence IA locale la plus rapide sur Apple Silicon, optimisé pour les agents de codage et l'appel d'outils. Les benchmarks montrent 40,67 tok/s sur Qwen3.6-27B et 220,86 tok/s sur Qwen3.6-35B-A3B depuis un MacBook Max M5 (128 Go).

OpenClawRadar
Quatre compétences de ClawHub pour les données de recherche en temps réel dans les agents IA
Tools

Quatre compétences de ClawHub pour les données de recherche en temps réel dans les agents IA

Quatre compétences ClawHub offrent des capacités de recherche structurée pour les agents IA : Google (web, actualités, images, cartes), Amazon (recherche de produits sur 12 marchés), Walmart (recherche de produits avec filtres de livraison) et YouTube (recherche vidéo avec transcriptions). Installation via les commandes clawhub install avec une seule clé API.

OpenClawRadar
DÉLICE : Un Orchestrateur Local Utilise Plusieurs Sessions ChatGPT en tant qu'Agents Coordonnés
Tools

DÉLICE : Un Orchestrateur Local Utilise Plusieurs Sessions ChatGPT en tant qu'Agents Coordonnés

DELIGHT est un orchestrateur local qui exécute simultanément plusieurs sessions ChatGPT cachées dans le navigateur, les coordonnant comme une équipe d'agents sans nécessiter de clés API ou de ressources GPU. Il se connecte à OpenClaw comme couche d'action pour appliquer des modifications à des fichiers réels et exécuter des tests.

OpenClawRadar