Echo-TTS auf Apple Silicon portiert mit MLX für native TTS mit Sprachklonierung

Echo-TTS, ein 2,4-Milliarden-Parameter-Diffusionstransformer (DiT)-Modell für Text-zu-Sprache mit Sprachklonierung, wurde von CUDA auf MLX portiert, um nativ auf Apple M-Series-Chips zu laufen. Die Portierung ermöglicht es dem Modell, Sprache in einer Zielstimme zu erzeugen, wenn Text und eine kurze Audioaufnahme einer sprechenden Person gegeben sind.
Leistung und Benchmarks
Auf einem Basis-Mac mini M4 mit 16 GB erzeugt das Modell einen kurzen 5-Sekunden-Sprachklon in etwa 10 Sekunden. Klone von bis zu 30 Sekunden dauern ungefähr 60 Sekunden zur Erstellung.
Hauptmerkmale
- 8-Bit-Quantisierung: Reduziert den Speicherverbrauch von etwa 6 GB auf etwa 4 GB, läuft schneller mit vernachlässigbarem Qualitätsverlust.
- Blockweise Erzeugung: Ermöglicht Streaming und Audiofortsetzungen.
Entwicklungsdetails
Dies war eine KI-unterstützte Portierung. Claude Opus 4.6 übernahm Spezifikation und Validierung, GPT-5.3-Codex führte die Implementierung durch, und der Entwickler steuerte das Projekt durch OpenClaw.
Das Repository ist verfügbar unter github.com/mznoj/echo-tts-mlx.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

Pilot-Konsole: Web-Dashboard zur Verwaltung privater KI-Agenten-Netzwerke
Ein Entwickler hat Claude genutzt, um Pilot Console zu erstellen, eine Web-UI zur Verwaltung privater Agenten-Netzwerke, die auf dem Pilot Protocol basieren. Das Dashboard bietet visuelle Einrichtung, Agenten-Onboarding, Flottenüberwachung und API-Steuerung für Multi-Agenten-Workflows.

HTML-Artefakte ersetzen Google Docs für technische Dokumentation, aber es fehlt die Kommentarfunktion
Claude-generierte HTML-Artefakte ersetzen Google Docs für lange, technische Inhalte wie Spike-Auswertungen und Architekturnoten, aber die Sandbox-iframe-Natur verhindert Inline-Kommentare und Überprüfungsfunktionen.

Open-Foundry: Ein Framework für Multi-Agenten-Debatten mit Claude Code
Open-foundry ist ein Python-Framework, das mehrere Claude Code-Agenten zu einem Gremium zusammenstellt, um komplexe Fragen zu debattieren, und dabei vollständig einsehbare Argumentationspfade mit Transkripten, Orchestrator-Protokollen und Arbeitsnotizen pro Agent erzeugt.
Forscher entwickelt Wahrheitsprüfungs-Funktion für Claude Code, findet Hallucinationen in eigener Dokumentation
Ein Forscher entwickelte eine Claude Code-Fähigkeit namens /veracity-tweaked-555, die Dokumente in atomare Behauptungen zerlegt und jede über Websuche verifiziert, wobei 16 parallele Agenten über 4 Wellen hinweg eingesetzt werden. Bei einer Selbstprüfung erzielte die Fähigkeit 62/100 Punkte aufgrund von erfundenen Statistiken und übertriebenen Behauptungen in ihrer eigenen Dokumentation.