Человеческий бенчмарк креативности: отделение конвергенции от дивергенции в оценке творческих способностей ИИ

✍️ OpenClawRadar📅 Опубликовано: 1 мая 2026 г.🔗 Source
Человеческий бенчмарк креативности: отделение конвергенции от дивергенции в оценке творческих способностей ИИ
Ad

Новый Human Creativity Benchmark (HCB) от Contra Labs решает ключевую проблему оценки творческих работ, созданных ИИ: у творческих задач нет эталонного ответа. Традиционные бенчмарки считают разногласия оценщиков шумом, который устраняется голосованием большинства или арбитражем. HCB вместо этого разделяет конвергенцию (согласие по общим лучшим практикам) и дивергенцию (истинные различия в эстетическом вкусе).

Ключевые выводы

  • Конвергенция высока по проверяемым осям: соответствие промпту, удобство использования, техническая корректность (например, читаемость, вёрстка).
  • Дивергенция преобладает по осям, связанным со вкусом: визуальная привлекательность, настроение, концептуальный риск.
  • Настольные приложения и лендинги показывают наибольшую конвергенцию; видеореклама и бренд-активы остаются наиболее дивергентными.
  • Ни одна текущая генеративная модель не является одновременно корректной (конвергентной) и управляемой (дивергентной по запросу).
  • Коллапс мод определен как практическая проблема: модели сходятся к безопасным, усреднённым эстетикам при получении одного и того же брифа.
Ad

Методология

HCB определяет оси оценки в спектре от объективно проверяемых до изначально субъективных. Для каждой оси измеряется согласованность оценщиков. Конвергенция отражает общие стандарты, такие как визуальная иерархия, цветовой контраст и качество рендеринга. Дивергенция улавливает личный вкус — что важно для творческих процессов, где профессионалам нужно несколько направлений для исследования и итераций.

Последствия для ИИ-агентов

Для разработчиков, использующих ИИ-агенты для кодирования, этот бенчмарк подчёркивает, что творческие инструменты должны предлагать как надёжность (следование инструкциям), так и управляемость (адаптацию к личному вкусу). HCB предоставляет основу для оценки этих аспектов по отдельности, а не сглаживания дивергенции в единую оценку качества. Агенты, которые не поддерживают дифференцированный вывод, рискуют оказаться непригодными для настоящей творческой работы.

📖 Читать полный источник: HN AI Agents

Ad

👀 Смотрите также

SmallClaw v1.0.2 добавляет систему фоновых задач для локальных LLM.
Инструменты

SmallClaw v1.0.2 добавляет систему фоновых задач для локальных LLM.

SmallClaw v1.0.2 представляет фоновый движок задач, который автономно выполняет многоэтапные рабочие процессы с проверкой шагов для решения проблем надежности небольших моделей. Обновление было протестировано на моделях класса 4B, таких как qwen3:4b, на машинах с 8 ГБ памяти.

OpenClawRadar
Плагин OpenClaw A2A: Прямой обмен сообщениями между агентами через Интернет
Инструменты

Плагин OpenClaw A2A: Прямой обмен сообщениями между агентами через Интернет

Плагин OpenClaw A2A обеспечивает прямую передачу файлов и сообщений между OpenClaw и другими агентами через интернет без сторонних сервисов, таких как WhatsApp или электронная почта.

OpenClawRadar
Фреймворк с открытым исходным кодом для мультиагентных систем, извлечённый из утечки кода Claude.
Инструменты

Фреймворк с открытым исходным кодом для мультиагентных систем, извлечённый из утечки кода Claude.

Разработчик извлек систему оркестрации мультиагентов из утекшего исходного кода Claude Code и перестроил ее в модель-независимый фреймворк с открытым исходным кодом под лицензией MIT. Фреймворк на TypeScript объемом 8 000 строк включает планирование задач, меж-агентное взаимодействие и встроенные инструменты.

OpenClawRadar
Метод квантования JANG повышает производительность MLX для больших моделей
Инструменты

Метод квантования JANG повышает производительность MLX для больших моделей

Новый метод квантизации под названием JANG позволяет запускать большие модели, такие как MiniMax-M2.5 и Qwen 3.5, на фреймворке Apple MLX с существенно лучшей производительностью, чем стандартная квантизация MLX, достигая скоростей, близких к нативным, при сохранении точности, сопоставимой с квантизациями более высокого битрейта.

OpenClawRadar