Der Human Creativity Benchmark: Trennung von Konvergenz und Divergenz in der KI-Kreativitätsbewertung

Der neue Human Creativity Benchmark (HCB) von Contra Labs befasst sich mit einem Kernproblem bei der Bewertung KI-generierter kreativer Arbeit: Kreative Aufgaben haben keine objektive Wahrheit. Traditionelle Benchmarks betrachten Uneinigkeit der Bewerter als Rauschen, das durch Mehrheitsentscheidungen oder Schiedsverfahren behoben werden muss. Der HCB trennt stattdessen Konvergenz (Übereinstimmung bei teilbaren Best Practices) von Divergenz (echte Unterschiede im ästhetischen Geschmack).
Wichtigste Erkenntnisse
- Konvergenz ist hoch bei überprüfbaren Achsen: Einhaltung der Aufgabenstellung, Benutzerfreundlichkeit und technische Korrektheit (z. B. Lesbarkeit, Layout).
- Divergenz dominiert bei geschmacksgesteuerten Achsen: Visuelle Anziehungskraft, Stimmung, konzeptionelles Risiko.
- Desktop-Apps und Landingpages zeigen die höchste Konvergenz; Videoanzeigen und Markenassets bleiben am divergentesten.
- Kein aktuelles generatives Modell ist zuverlässig sowohl korrekt (konvergent) als auch steuerbar (divergent auf Anfrage).
- Mode Collapse wird als praktisches Problem identifiziert: Modelle konvergieren auf sichere, durchschnittliche Ästhetik, wenn sie die gleiche Aufgabenstellung erhalten.
Methodik
Der HCB definiert Bewertungsachsen auf einem Spektrum von objektiv überprüfbar bis inhärent subjektiv. Für jede Achse wird die Übereinstimmung der Bewerter gemessen. Konvergenz spiegelt gemeinsame Standards wie visuelle Hierarchie, Farbkontrast und Darstellungsqualität wider. Divergenz erfasst persönlichen Geschmack – essentiell für kreative Arbeitsabläufe, bei denen Fachleute mehrere Richtungen für Erkundung und Iteration benötigen.
Auswirkungen auf KI-Agenten
Für Entwickler, die KI-Codierungsagenten verwenden, unterstreicht dieser Benchmark, dass kreative Tools sowohl Zuverlässigkeit (Befolgen von Anweisungen) als auch Steuerbarkeit (Anpassung an den persönlichen Geschmack) bieten müssen. Der HCB bietet ein Framework, um diese Dimensionen getrennt zu bewerten, anstatt Divergenz in eine einzige Qualitätsbewertung einzuebnen. Agenten, die differenzierte Ausgaben nicht unterstützen, riskieren, für echte kreative Arbeit unbrauchbar zu sein.
📖 Lesen Sie die vollständige Quelle: HN AI Agents
👀 Siehe auch

SkillOpt: Optimierung von Markdown-Fähigkeitsdateien als trainierbare Parameter für KI-Agenten
SkillOpt formalisiert den Ad-hoc-Prozess des Bearbeitens von Markdown-Skill-Dateien für KI-Codierungsagenten, indem es Frontier-Modelle nutzt, um begrenzte Änderungen vorzuschlagen, die an Validierungssätzen geprüft werden. Die besten Skills konvergieren mit 1-4 akzeptierten Änderungen aus vielen Vorschlägen und lassen sich zwischen Modellen wie Codex und Claude Code übertragen.
TextGen (text-generation-webui) wird native Desktop-App mit portablen Builds
TextGen, die Open-Source-Alternative zu LM Studio, hat sich von einer Web-UI zu einer Desktop-App ohne Installation für Windows, Linux und macOS mit portablen Builds, vollständiger Privatsphäre und erweiterter Quantisierungsunterstützung entwickelt.

Hyper iOS App: Sprachnotizen-App mit Echtzeit-Transkription und Aktionserkennung
Hyper ist eine iOS-Sprachaufnahme-App, die Gespräche in Echtzeit transkribiert, Zusammenfassungen und Aktionspunkte liefert und mittels Wakeword-Erkennung Abfragen während des Gesprächs ermöglicht. Sie ist für unstrukturierte Meetings wie 1:1-Gespräche, Kaffeepausen und Standups konzipiert.

Claude Code Session Dashboard: Open-Source-Tool zur Überwachung mehrerer Sitzungen
Ein Open-Source-Dashboard, das mehrere Claude-Code-Sitzungen gleichzeitig überwacht und Token-Verbrauch, Kosten, Sitzungsstatus, Kontextfenster-Nutzung und aktive Subagenten anzeigt. Die Installation erfordert drei Befehle: git clone, cd und npm install && npm start.