DS4 de antirez: Ejecutando DeepSeek V4 Flash con Contexto de 1M en Mac Metal y DGX

✍️ OpenClawRadar📅 Publicado: 10 de mayo de 2026🔗 Source
DS4 de antirez: Ejecutando DeepSeek V4 Flash con Contexto de 1M en Mac Metal y DGX
Ad

El creador de Redis, Salvatore Sanfilippo (antirez), acaba de lanzar un nuevo proyecto llamado DS4 en GitHub. El objetivo: hacer que DeepSeek V4 Flash funcione con una ventana de contexto de 1M de tokens en hardware Apple Silicon (Metal). También publicó un video donde se ejecuta en un sistema NVIDIA DGX.

Qué hace DS4

DS4 aprovecha técnicas novedosas para ajustar una ventana de contexto de 1M para DeepSeek V4 Flash en hardware Mac Metal (por ejemplo, chips de la serie M). También se ha demostrado en un DGX, lo que sugiere que podría funcionar en GPU de gama alta como la Pro 6000 con ventanas de contexto ligeramente más pequeñas y mayor velocidad. Se especula sobre un futuro soporte para AMD.

Qué incluye

  • Endpoints de servidor: El servidor DS4 ya proporciona endpoints de API compatibles con OpenAI y Anthropic, lo que facilita su integración con herramientas de codificación agentivas como Cursor, Continue.dev o agentes personalizados.
  • Repositorio de GitHub: https://github.com/antirez/ds4/ — consulta el README para obtener instrucciones de configuración, que probablemente incluyan compilar con soporte Metal y descargar los pesos de DeepSeek V4 Flash.
  • Video de demostración: Hace unas horas, antirez publicó un video en X mostrando el proyecto funcionando en un DGX: https://x.com/antirez/status/2053381973226184749
Ad

Para quién es

Desarrolladores con hardware Mac de gama alta (por ejemplo, Mac Studio, MacBook Pro con M1 Max/Ultra o M2/M3) o GPU NVIDIA que quieran ejecutar un LLM local potente con una ventana de contexto muy grande para agentes de codificación o investigación.

Llamado a la acción de la comunidad

El usuario de Reddit anima a cualquiera que tenga hardware potente a probar el proyecto y contribuir, ya sea probando, informando errores u optimizando para GPU AMD. El proyecto está en una etapa temprana, por lo que la participación de la comunidad podría acelerar la compatibilidad.

📖 Lee la fuente completa: r/LocalLLaMA

Ad

👀 Ver también

SkillsGate: Mercado de Código Abierto para Habilidades de Agentes de Programación con IA
Herramientas

SkillsGate: Mercado de Código Abierto para Habilidades de Agentes de Programación con IA

SkillsGate es un mercado de código abierto que indexa más de 45,000 habilidades para agentes de codificación con IA como Claude Code, Cursor y Windsurf. Ofrece búsqueda semántica con incrustaciones vectoriales e instalación con un solo comando mediante npx.

OpenClawRadar
Capa de memoria autoalojada para Claude se ejecuta gratis en Cloudflare
Herramientas

Capa de memoria autoalojada para Claude se ejecuta gratis en Cloudflare

Un servidor MCP de Cloudflare Worker permite a Claude recordar y recuperar notas mediante búsqueda semántica usando Workers AI y Vectorize, todo en el nivel gratuito.

OpenClawRadar
Problemas Técnicos y Controversia Comunitaria de Ollama
Herramientas

Problemas Técnicos y Controversia Comunitaria de Ollama

Ollama, una popular herramienta local de LLM, enfrenta críticas por minimizar su dependencia de llama.cpp, problemas de cumplimiento de licencias y problemas técnicos con su backend personalizado, incluyendo regresiones de rendimiento y errores reintroducidos.

OpenClawRadar
La Ruta Rápida de Búsqueda de Memoria QMD de OpenClaw Tenía Errores Silenciosos
Herramientas

La Ruta Rápida de Búsqueda de Memoria QMD de OpenClaw Tenía Errores Silenciosos

La búsqueda de memoria integrada de OpenClaw utiliza coincidencia básica de palabras clave, pero los usuarios pueden cambiar a QMD para búsqueda semántica en los archivos markdown del espacio de trabajo. Una ruta rápida a través de MCPorter estaba rota con tres errores que hacían que cada llamada fallara silenciosamente y recurriera a la ejecución CLI más lenta.

OpenClawRadar