Человеческий бенчмарк креативности: отделение конвергенции от дивергенции в оценке творческих способностей ИИ

Новый Human Creativity Benchmark (HCB) от Contra Labs решает ключевую проблему оценки творческих работ, созданных ИИ: у творческих задач нет эталонного ответа. Традиционные бенчмарки считают разногласия оценщиков шумом, который устраняется голосованием большинства или арбитражем. HCB вместо этого разделяет конвергенцию (согласие по общим лучшим практикам) и дивергенцию (истинные различия в эстетическом вкусе).
Ключевые выводы
- Конвергенция высока по проверяемым осям: соответствие промпту, удобство использования, техническая корректность (например, читаемость, вёрстка).
- Дивергенция преобладает по осям, связанным со вкусом: визуальная привлекательность, настроение, концептуальный риск.
- Настольные приложения и лендинги показывают наибольшую конвергенцию; видеореклама и бренд-активы остаются наиболее дивергентными.
- Ни одна текущая генеративная модель не является одновременно корректной (конвергентной) и управляемой (дивергентной по запросу).
- Коллапс мод определен как практическая проблема: модели сходятся к безопасным, усреднённым эстетикам при получении одного и того же брифа.
Методология
HCB определяет оси оценки в спектре от объективно проверяемых до изначально субъективных. Для каждой оси измеряется согласованность оценщиков. Конвергенция отражает общие стандарты, такие как визуальная иерархия, цветовой контраст и качество рендеринга. Дивергенция улавливает личный вкус — что важно для творческих процессов, где профессионалам нужно несколько направлений для исследования и итераций.
Последствия для ИИ-агентов
Для разработчиков, использующих ИИ-агенты для кодирования, этот бенчмарк подчёркивает, что творческие инструменты должны предлагать как надёжность (следование инструкциям), так и управляемость (адаптацию к личному вкусу). HCB предоставляет основу для оценки этих аспектов по отдельности, а не сглаживания дивергенции в единую оценку качества. Агенты, которые не поддерживают дифференцированный вывод, рискуют оказаться непригодными для настоящей творческой работы.
📖 Читать полный источник: HN AI Agents
👀 Смотрите также

SmallClaw v1.0.2 добавляет систему фоновых задач для локальных LLM.
SmallClaw v1.0.2 представляет фоновый движок задач, который автономно выполняет многоэтапные рабочие процессы с проверкой шагов для решения проблем надежности небольших моделей. Обновление было протестировано на моделях класса 4B, таких как qwen3:4b, на машинах с 8 ГБ памяти.

Плагин OpenClaw A2A: Прямой обмен сообщениями между агентами через Интернет
Плагин OpenClaw A2A обеспечивает прямую передачу файлов и сообщений между OpenClaw и другими агентами через интернет без сторонних сервисов, таких как WhatsApp или электронная почта.

Фреймворк с открытым исходным кодом для мультиагентных систем, извлечённый из утечки кода Claude.
Разработчик извлек систему оркестрации мультиагентов из утекшего исходного кода Claude Code и перестроил ее в модель-независимый фреймворк с открытым исходным кодом под лицензией MIT. Фреймворк на TypeScript объемом 8 000 строк включает планирование задач, меж-агентное взаимодействие и встроенные инструменты.

Метод квантования JANG повышает производительность MLX для больших моделей
Новый метод квантизации под названием JANG позволяет запускать большие модели, такие как MiniMax-M2.5 и Qwen 3.5, на фреймворке Apple MLX с существенно лучшей производительностью, чем стандартная квантизация MLX, достигая скоростей, близких к нативным, при сохранении точности, сопоставимой с квантизациями более высокого битрейта.