antirezs DS4: Ausführen von DeepSeek V4 Flash mit 1M Kontext auf Mac Metal und DGX

Redis-Erfinder Salvatore Sanfilippo (antirez) hat gerade ein neues Projekt namens DS4 auf GitHub veröffentlicht. Ziel: DeepSeek V4 Flash mit einem 1M-Token-Kontextfenster auf Apple Silicon (Metal) Hardware zum Laufen zu bringen. Er hat auch ein Video gepostet, das es auf einem NVIDIA DGX-System zeigt.
Was DS4 macht
DS4 nutzt neuartige Techniken, um ein 1M-Kontextfenster für DeepSeek V4 Flash auf Mac Metal Hardware (z.B. M-Serie-Chips) unterzubringen. Es wurde auch auf einer DGX demonstriert, was darauf hindeutet, dass es auf High-End-GPUs wie der Pro 6000 mit etwas kleineren Kontextfenstern und höherer Geschwindigkeit funktionieren könnte. Es gibt Spekulationen über zukünftige AMD-Unterstützung.
Enthaltene Komponenten
- Server-Endpunkte: Der DS4-Server bietet bereits OpenAI- und Anthropic-kompatible API-Endpunkte, was die Integration in agentische Codierungstools wie Cursor, Continue.dev oder benutzerdefinierte Agenten erleichtert.
- GitHub-Repo: https://github.com/antirez/ds4/ — siehe README für Einrichtungsanweisungen, die wahrscheinlich das Kompilieren mit Metal-Unterstützung und das Herunterladen der DeepSeek V4 Flash-Gewichte beinhalten.
- Video-Demo: Vor ein paar Stunden hat antirez ein Video auf X gepostet, das die Ausführung auf einer DGX zeigt: https://x.com/antirez/status/2053381973226184749
Für wen es gedacht ist
Entwickler mit High-End-Mac-Hardware (z.B. Mac Studio, MacBook Pro mit M1 Max/Ultra oder M2/M3) oder NVIDIA-GPUs, die ein leistungsstarkes lokales LLM mit einem sehr großen Kontextfenster für Codierungsagenten oder Forschung ausführen möchten.
Aufruf an die Community
Der Reddit-Poster ermutigt alle mit leistungsstarker Hardware, sich das Projekt anzusehen und beizutragen – sei es durch Testen, Melden von Fehlern oder Optimieren für AMD-GPUs. Das Projekt befindet sich in einem frühen Stadium, daher könnte das Engagement der Community die Kompatibilität beschleunigen.
📖 Lies die vollständige Quelle: r/LocalLLaMA
👀 Siehe auch

Jentic Mini: Selbst gehostete API- und Aktionsausführungsschicht für OpenClaw
Jentic Mini ist eine selbst gehostete API- und Aktionsausführungsschicht, die zwischen KI-Agenten und externen APIs sitzt, Anmeldedaten in einem verschlüsselten Tresor speichert und bereichsbezogene Toolkits mit individuell widerrufbaren Schlüsseln bereitstellt. Beim Hinzufügen von Anmeldedaten importiert es automatisch über 10.000 OpenAPI-Spezifikationen und Arazzo-Workflow-Quellen.

Pilotprotokoll: Netzwerkschicht für OpenClaw-Agenten
Pilot Protocol ist eine Open-Source-Netzwerkschicht, die die Konnektivität zwischen OpenClaw-Agenten auf verschiedenen Maschinen verwaltet. Sie bietet permanente virtuelle Adressen, verschlüsselte UDP-Tunnel und NAT-Traversal ohne VPNs oder ngrok.

Claude-Skills-Maintainer sucht Feedback zu 181 Agent Skills Library
Reza, der Betreuer von claude-skills, bittet die Community um Feedback zu seiner Open-Source-Bibliothek, die 181 Agenten-Fähigkeiten, 250 Python-Tools und 15 Agenten-Personas enthält, die über 11 KI-Codierungstools hinweg funktionieren. Er hinterfragt, ob der isolierte Fähigkeitsansatz effektiv ist, und möchte Input zu fehlenden Fähigkeiten, persona-basierten Agenten und Tool-Integrationen.

Claw Voice Feature fügt 11Labs API-Unterstützung mit CarPlay-Integration hinzu
Claw Voice integriert sich in CarPlay und ermöglicht benutzerdefinierte Stimmen über die 11Labs API, sodass Sie während der Fahrt natürliche, fließende Gespräche mit Ihrem Agenten führen können.