Inline-Visualisierer: Lokale KI-Modelle können jetzt interaktive HTML-Visualisierungen rendern

Inline Visualizer ist ein Plugin für Open WebUI, das lokalen KI-Modellen die Fähigkeit verleiht, interaktive HTML/SVG-Visualisierungen direkt im Chat darzustellen, mit bidirektionaler Kommunikation zwischen visuellen Elementen und dem KI-Modell.
Was es tut
Das Plugin stellt Modellen ein Design-System und ein Rendering-Tool zur Verfügung. Modelle schreiben HTML/SVG-Fragmente, die das Tool in eine thematisierte Hülle mit Dark-Mode-Unterstützung einpackt und sie inline im Chat darstellt. Eine JavaScript-Brücke erlaubt es Elementen innerhalb der Visualisierungen, Nachrichten zurück an die Chat-Oberfläche zu senden.
Hauptmerkmale
- Funktioniert mit jedem Modell, das Tool Calling unterstützt: Qwen, Mistral, Gemma, DeepSeek, Gemini, Claude, GPT
- BSD-3-lizenziert – forken, modifizieren, nach Belieben nutzen
- Keine Iframes-in-Iframes, keine externen Dienste, keine API-Schlüssel erforderlich
- Interaktive Elemente können Nachrichten zurück an das KI-Modell senden
Beispiel-Anwendungsfälle
- Architekturdiagramme, bei denen ein Klick auf einen Knoten die KI nach dieser Komponente fragt
- Chart.js-Dashboards mit korrekter Dark/Light-Mode-Thematisierung
- Interaktive Quizze, bei denen die KI Ihre Antworten bewertet
- Präferenzformulare, die Auswahlmöglichkeiten sammeln und an das Modell senden
- Erklärungen mit ausklappbaren Abschnitten und Hover-Effekten
- Buchstäblich jedes HTML/SVG/JS, das das Modell schreiben kann
Anforderungen
- Open WebUI (selbst gehostet)
- Beliebiges Modell mit Tool-Calling-Unterstützung
- Weniger als 1 Minute, um zwei Dateien einzufügen und der Installationsanleitung zu folgen
Leistungsbetrachtungen
Der Ersteller weist darauf hin, dass die Leistung von den Tokens pro Sekunde (TPS) Ihres Modells abhängt. Bei einstelligen TPS müssen Sie möglicherweise etwa eine Minute warten, bis gerenderte Artefakte erscheinen. Die Demo verwendet Claude Haiku für Geschwindigkeit, aber das Tool wurde mit Qwen3.5 27b getestet (langsamer, aber funktional).
Installation
Das Plugin (Tool + Skill) ist verfügbar unter https://github.com/Classic298/open-webui-plugins. Ein Installations-Tutorial befindet sich in der README-Datei des Plugin-Ordners.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

KV-Cache-Wiederverwendung für lange Gespräche auf Apple Silicon ermöglicht 200-fache Beschleunigung
Ein Entwickler implementierte eine sitzungsbasierte Wiederverwendung des KV-Caches für lokale LLM-Inferenz mit Apples MLX-Framework und erreichte eine 200-fache Verbesserung der Zeit bis zum ersten Token bei einer Kontextlänge von 100K. Der Ansatz behält den KV-Cache im Speicher über Gesprächsrunden hinweg und verarbeitet nur neue Tokens.

Claude Code-Benutzer erstellt /discuss-Befehl für schreibgeschützte Unterhaltungen
Ein Claude Code-Benutzer erstellte eine 25-zeilige benutzerdefinierte Fähigkeit namens /discuss, die schreibgeschützte Gespräche ohne Dateiänderungen ermöglicht. Der Befehl erlaubt Code-Erkundung, Recherche und Diskussion, während Änderungen verhindert werden, indem das Flag --dangerously-skip-permissions mit integrierter Sicherheit verwendet wird.

Seien Sie mein Butler: Multi-Agenten-Pipeline zur Überprüfung von KI-Code
Be My Butler ist eine Open-Source-Multi-Agent-Pipeline, in der verschiedene KI-Modelle den Code des jeweils anderen durch blinde Überprüfung bewerten. Das System behebt das Problem, dass KI-Agenten ihren eigenen Code fälschlicherweise als funktionsfähig melden.

Echo-TTS auf Apple Silicon portiert mit MLX für native TTS mit Sprachklonierung
Echo-TTS, ein 2,4-Milliarden-Parameter-Diffusionsmodell für Text-zu-Sprache mit Sprachklonierung, wurde von CUDA auf MLX portiert, um nativ auf Apple M-Series-Chips zu laufen. Auf einem Basis-Mac mini M4 mit 16 GB dauert die Erstellung eines 5-Sekunden-Sprachklons etwa 10 Sekunden, während 30-Sekunden-Klone ungefähr 60 Sekunden benötigen.