인간 창의성 벤치마크: AI 창의성 평가에서 수렴과 발산의 분리

Contra Labs의 새로운 인간 창의성 벤치마크(HCB)는 AI 생성 창의적 작업을 평가하는 핵심 문제를 해결합니다. 창의적 작업에는 절대적 기준이 없습니다. 기존 벤치마크는 평가자 간의 의견 불일치를 잡음으로 간주하여 다수결 투표나 조정을 통해 해결합니다. 반면 HCB는 수렴(공유 가능한 모범 사례에 대한 합의)과 발산(미적 취향의 진정한 차이)을 분리합니다.
주요 발견
- 수렴은 검증 가능한 축(프롬프트 준수, 사용성, 기술적 정확성(예: 가독성, 레이아웃))에서 높습니다.
- 발산은 취향 중심의 축(시각적 매력, 분위기, 개념적 위험)에서 지배적입니다.
- 데스크톱 앱과 랜딩 페이지는 가장 높은 수렴을 보이고, 광고 동영상과 브랜드 자산은 가장 발산적입니다.
- 현재 어떤 생성형 모델도 신뢰할 수 있을 정도로 정확(수렴)하면서도 조종 가능(요청 시 발산)하지 않습니다.
- 모드 붕괴는 실질적인 문제로 확인되었습니다. 동일한 브리핑을 받았을 때 모델이 안전하고 평균적인 미학에 수렴하는 현상입니다.
방법론
HCB는 평가 축을 객관적으로 검증 가능한 것에서부터 본질적으로 주관적인 것까지의 스펙트럼으로 정의합니다. 각 축에 대해 평가자 간 일치도를 측정합니다. 수렴은 시각적 계층, 색상 대비, 렌더링 품질과 같은 공유된 기준을 반영합니다. 발산은 개인적 취향을 포착하며, 전문가가 탐색과 반복을 위해 여러 방향이 필요한 창의적 워크플로우에 필수적입니다.
AI 에이전트에 대한 시사점
AI 코딩 에이전트를 사용하는 개발자의 경우, 이 벤치마크는 창의적 도구가 신뢰성(지침 따르기)과 조종 가능성(개인 취향에 맞게 조정)을 모두 제공해야 함을 강조합니다. HCB는 이러한 차원을 단일 품질 점수로 평탄화하지 않고 별도로 평가할 수 있는 프레임워크를 제공합니다. 차별화된 출력을 지원하지 않는 에이전트는 실제 창의적 작업에 사용할 수 없을 위험이 있습니다.
📖 Read the full source: HN AI Agents
👀 See Also
Zillow-풀: 수동 부동산 조사를 자동 거래 파이프라인으로 전환한 오픈클로 스킬
한 개발자가 OpenClaw에 'zillow-full'을 구축하여 부동산별 Zestimate, 세금 이력, 가격 이력 및 비교 항목을 가져옵니다. 매일 밤 크론 작업이 조건에 따라 매물을 평가한 결과, 도매 거래가 월 2건에서 11건으로 증가했습니다.
Claudy: macOS용 Claude Code 네이티브 래퍼 - 다중 세션, 자동 계정 전환, 드래프트 커밋 지원
Claudy는 SwiftUI + SwiftData로 구축된 네이티브 macOS 앱으로, Claude Code를 래핑하여 멀티 세션 관리, 속도 제한 시 자동 계정 전환, 작업 중 체크포인트를 위한 드래프트 커밋, Skills/MCPs/Commands 마켓플레이스를 제공합니다.

Codegraph: 사전 색인된 지식 그래프가 클로드/커서 도구 호출을 94% 줄임
Codegraph는 심볼 관계, 호출 그래프, 코드 구조에 대한 사전 색인된 지식 그래프를 사용하여 API 도구 호출을 최대 94%까지 줄이고, Claude, Cursor, Codex, OpenCode 에이전트의 사용 속도를 약 77% 향상시킵니다.

OpenClaw의 기본 마크다운 메모리를 뜯어내고 Node.js/Postgres API 레이어로 대체했습니다
한 개발자가 OpenClaw의 기본 메모리 코어 플러그인을 비활성화하고 타입 기반 Node.js/Express + PostgreSQL 백엔드를 구축했습니다. 컨텍스트 드리프트가 0으로 감소했습니다.