antirez的DS4:在Mac Metal和DGX上运行具有100万上下文窗口的DeepSeek V4 Flash

Создатель Redis Сальваторе Санфилиппо (antirez) только что выпустил новый проект под названием DS4 на GitHub. Цель: запустить DeepSeek V4 Flash с контекстным окном в 1 млн токенов на оборудовании Apple Silicon (Metal). Он также опубликовал видео его работы на системе NVIDIA DGX.
Что делает DS4
DS4 использует новые методы, чтобы вместить контекстное окно в 1 млн токенов для DeepSeek V4 Flash на Mac Metal (например, чипы серии M). Также было продемонстрировано на DGX, что предполагает возможность работы на высокопроизводительных GPU, таких как Pro 6000, с несколько меньшим контекстным окном, но с более высокой скоростью. Есть предположения о будущей поддержке AMD.
Что включено
- Серверные конечные точки: сервер DS4 уже предоставляет API-интерфейсы, совместимые с OpenAI и Anthropic, что позволяет легко интегрировать его в инструменты агентного кодирования, такие как Cursor, Continue.dev или пользовательские агенты.
- Репозиторий GitHub: https://github.com/antirez/ds4/ — ознакомьтесь с README для получения инструкций по установке, которые, вероятно, включают компиляцию с поддержкой Metal и загрузку весов DeepSeek V4 Flash.
- Видеодемонстрация: несколько часов назад antirez опубликовал видео на X, показывающее его работу на DGX: https://x.com/antirez/status/2053381973226184749
Для кого это
Разработчики с высокопроизводительным оборудованием Mac (например, Mac Studio, MacBook Pro с M1 Max/Ultra или M2/M3) или GPU NVIDIA, которые хотят запустить мощную локальную LLM с очень большим контекстным окном для кодирующих агентов или исследований.
Призыв к действию сообщества
Автор поста на Reddit призывает всех, у кого есть мощное оборудование, ознакомиться с проектом и внести свой вклад — будь то тестирование, сообщение об ошибках или оптимизация для GPU AMD. Проект находится на ранней стадии, поэтому участие сообщества может ускорить обеспечение совместимости.
📖 Read the full source: r/LocalLLaMA
👀 Смотрите также

Gemma4 26B-A4B обеспечивает быструю локальную работу с поддержкой веб-поиска и изображений.
Модель gemma-4-26B-A4B демонстрирует производительность около 145 токенов в секунду на RTX 4090 и включает поддержку веб-поиска MCP и работы с изображениями в чат-приложениях. В блоге подробно описана настройка и использование на разных платформах, включая Mac и iPhone.

OpenObscure: Открытый локальный брандмауэр конфиденциальности для ИИ-агентов
OpenObscure — это открытый межсетевой экран для защиты приватности, работающий на устройстве и располагающийся между ИИ-агентами и провайдерами языковых моделей. Он использует FF1 Format-Preserving Encryption для шифрования персональных данных перед отправкой запроса с вашего устройства. Включает обнаружение PII с полнотой 99,7%, сканирование когнитивного межсетевого экрана и работает на macOS/Linux/Windows с поддержкой iOS/Android.

Клодигочи: Физическое устройство Тамагочи, которое питается активностью кода Клода
Клодиготчи — это физическое настольное существо, работающее на ESP32 с ЖК-экраном, которое подключается к Claude Code через плагин. Система голода устройства реагирует на активность кодирования, с визуальными состояниями и звуковыми эффектами, которые усиливаются, когда Claude оставляют бездействующим.

ClawPy: Минимальная однодокументная реализация OpenClaw на Python с памятью опыта
Разработчик создал ClawPy — упрощённый скрипт на Python, который реализует механику автономного выполнения задач OpenClaw с системой постоянного опыта, обучающейся на прошлых ошибках и успехах.