Der Human Creativity Benchmark: Trennung von Konvergenz und Divergenz in der KI-Kreativitätsbewertung

Der neue Human Creativity Benchmark (HCB) von Contra Labs befasst sich mit einem Kernproblem bei der Bewertung KI-generierter kreativer Arbeit: Kreative Aufgaben haben keine objektive Wahrheit. Traditionelle Benchmarks betrachten Uneinigkeit der Bewerter als Rauschen, das durch Mehrheitsentscheidungen oder Schiedsverfahren behoben werden muss. Der HCB trennt stattdessen Konvergenz (Übereinstimmung bei teilbaren Best Practices) von Divergenz (echte Unterschiede im ästhetischen Geschmack).
Wichtigste Erkenntnisse
- Konvergenz ist hoch bei überprüfbaren Achsen: Einhaltung der Aufgabenstellung, Benutzerfreundlichkeit und technische Korrektheit (z. B. Lesbarkeit, Layout).
- Divergenz dominiert bei geschmacksgesteuerten Achsen: Visuelle Anziehungskraft, Stimmung, konzeptionelles Risiko.
- Desktop-Apps und Landingpages zeigen die höchste Konvergenz; Videoanzeigen und Markenassets bleiben am divergentesten.
- Kein aktuelles generatives Modell ist zuverlässig sowohl korrekt (konvergent) als auch steuerbar (divergent auf Anfrage).
- Mode Collapse wird als praktisches Problem identifiziert: Modelle konvergieren auf sichere, durchschnittliche Ästhetik, wenn sie die gleiche Aufgabenstellung erhalten.
Methodik
Der HCB definiert Bewertungsachsen auf einem Spektrum von objektiv überprüfbar bis inhärent subjektiv. Für jede Achse wird die Übereinstimmung der Bewerter gemessen. Konvergenz spiegelt gemeinsame Standards wie visuelle Hierarchie, Farbkontrast und Darstellungsqualität wider. Divergenz erfasst persönlichen Geschmack – essentiell für kreative Arbeitsabläufe, bei denen Fachleute mehrere Richtungen für Erkundung und Iteration benötigen.
Auswirkungen auf KI-Agenten
Für Entwickler, die KI-Codierungsagenten verwenden, unterstreicht dieser Benchmark, dass kreative Tools sowohl Zuverlässigkeit (Befolgen von Anweisungen) als auch Steuerbarkeit (Anpassung an den persönlichen Geschmack) bieten müssen. Der HCB bietet ein Framework, um diese Dimensionen getrennt zu bewerten, anstatt Divergenz in eine einzige Qualitätsbewertung einzuebnen. Agenten, die differenzierte Ausgaben nicht unterstützen, riskieren, für echte kreative Arbeit unbrauchbar zu sein.
📖 Lesen Sie die vollständige Quelle: HN AI Agents
👀 Siehe auch
Hax: Ein minimalistischer Terminal-nativer Codierungs-Agent in C
Hax ist ein einzelnes natives C-Binary, das sofort startet, nur wenige MB RAM verbraucht und lokale LLMs als erstklassige Bürger behandelt. Es erkennt llama.cpp und andere Anbieter automatisch, ohne Konfigurationsblöcke.

Spectral: Erfassen Sie App-Traffic, um MCP-Server für OpenClaw-Agenten zu generieren
Spectral ist ein Open-Source-Tool, das den Datenverkehr von jeder Anwendung erfasst, ihn mit einem LLM analysiert und einen funktionierenden MCP-Server generiert, wodurch OpenClaw-Agenten die echte API der App direkt aufrufen können, anstatt sich auf Browser-Automatisierung zu verlassen.

aco-system: Ein komplettes Unternehmens-Betriebssystem für Claude, das User Stories schreibt, Aufgaben unterteilt und PRs überprüft
Ein Reddit-Nutzer berichtete, wie aco-system ein einzelnes GitHub-Issue in einen vollständig validierten PR mit Tests verwandelte – vollständig von Claude gesteuert. Inklusive Generierung von User Stories, Aufgabenaufteilung, Geheimnisprüfung und PR-Review.

Effizientes Token-Management mit Open-Source-MCP-Servern: Pare
Pare MCP-Server reduzieren Token-Abfälle und verbessern die Effizienz, wenn KI-Coding-Agenten Entwicklertools nutzen, indem sie strukturierte Ausgaben bereitstellen.