Lokales KI-Bildkritik-Tool nutzt Ollama Vision-Modelle für Feedback

Ein Entwickler hat eine kostenlose Desktop-Anwendung veröffentlicht, die KI-Bildkritik mit lokalen Vision-Modellen über Ollama bietet. Das Tool analysiert KI-generierte Bilder und erstellt strukturierte Feedback-Berichte, ohne Cloud-Dienste zu benötigen.
Hauptfunktionen
- Läuft zu 100 % lokal mit Ollama-Vision-Modellen
- Verwendet standardmäßig llama3.2-vision, kann aber auf andere Vision-Modelle umgestellt werden
- Erstellt übersichtliche Berichte mit spezifischen Abschnitten
- Funktioniert sowohl mit Flux/SD3 Anime-Stil-Generierungen als auch mit fotorealistischen Bildern
Berichtsstruktur
- Was gut aussieht - Positive Aspekte des Bildes
- Was verbessert werden könnte - Bereiche, die Verbesserung benötigen
- Schnellbewertungen - Bewertungen für Anatomie, Farbharmonie und Stimmung
- Gesamtbewertung - Mit Begründung für die Einschätzung
- Prompt-Optimierungsvorschlag - Spezifische Formulierungen, die zu Prompts hinzugefügt werden können, um bessere nächste Generationen zu erhalten
Anforderungen
Das Tool erfordert, dass Ollama bereits installiert ist und ein Vision-Modell geladen wurde. Der Entwickler weist darauf hin, dass dieses Tool nicht für Sie geeignet ist, wenn Sie Ollama nicht eingerichtet haben.
Aktueller Status und Feedback-Anfrage
Der Entwickler hat Screenshots der Anwendungsoberfläche und zwei Beispielanalysen geteilt. Er sucht Feedback von Nutzern, die tatsächlich mit Vision-Modellen arbeiten, und fragt, welche zusätzlichen Funktionen nützlich wären. Genannte mögliche Verbesserungen umfassen mehr Bewertungskategorien, Stapelverarbeitungsfähigkeiten und verschiedene Fokusoptionen.
📖 Read the full source: r/LocalLLaMA
👀 Siehe auch

Verwendung von Claude zur Automatisierung der Mobile-App-QA mit Capacitor WebViews
Ein Entwickler hat ein automatisiertes QA-System mit Claude erstellt, um eine auf Capacitor basierende mobile App auf Android und iOS zu testen. Der Ansatz nutzt das Chrome DevTools Protocol für Android WebViews und Screenshots für visuelle Analysen, wobei die Android-Einrichtung 90 Minuten dauert, verglichen mit 6+ Stunden für iOS.
Cocall.ai MCP: Ausgehende Telefonanrufe mit Echtzeit-Mensch-Eskalation
Cocall.ai ist ein MCP für Claude, das ausgehende Telefonanrufe mit einem Vollduplex-Sprache-zu-Sprache-Modell ermöglicht. Es kann während eines Anrufs pausieren, um Ihnen eine spezifische Frage zu stellen, anstatt zu raten, IVR-Menüs navigieren und Anrufe bei Bedarf an Sie übergeben.

Lore: MCP-Server, der KI-Agenten-Sitzungsverlauf zwischen Tools teilt
Lore ist ein MCP-Server, der KI-Agentensitzungen in einem lokalen SQLite-Speicher indiziert und jedem Agenten – unabhängig vom Tool – den Zugriff auf die Sitzungshistorie eines anderen ermöglicht. Neue Clientsitzungen ohne gemeinsamen Kontext, aber Agenten können auf Anfrage vergangene Gespräche abrufen.

Deblank: Tool zur Entfernung von Code-Formatierung für LLM-Token-Reduzierung
Deblank ist ein Open-Source-Tool, das Code-Formatierung (Einrückungen, Leerzeichen, Zeilenumbrüche) entfernt, bevor Code an LLMs gesendet wird, wodurch die Token um ~30 % für Java/C++ und ~9 % für Python bei ~76 ms Latenz reduziert werden. Es unterstützt Python, Java, C/C++, C#, JS/TS und Go.