인간 창의성 벤치마크: AI 창의성 평가에서 수렴과 발산의 분리

Contra Labs의 새로운 인간 창의성 벤치마크(HCB)는 AI 생성 창의적 작업을 평가하는 핵심 문제를 해결합니다. 창의적 작업에는 절대적 기준이 없습니다. 기존 벤치마크는 평가자 간의 의견 불일치를 잡음으로 간주하여 다수결 투표나 조정을 통해 해결합니다. 반면 HCB는 수렴(공유 가능한 모범 사례에 대한 합의)과 발산(미적 취향의 진정한 차이)을 분리합니다.
주요 발견
- 수렴은 검증 가능한 축(프롬프트 준수, 사용성, 기술적 정확성(예: 가독성, 레이아웃))에서 높습니다.
- 발산은 취향 중심의 축(시각적 매력, 분위기, 개념적 위험)에서 지배적입니다.
- 데스크톱 앱과 랜딩 페이지는 가장 높은 수렴을 보이고, 광고 동영상과 브랜드 자산은 가장 발산적입니다.
- 현재 어떤 생성형 모델도 신뢰할 수 있을 정도로 정확(수렴)하면서도 조종 가능(요청 시 발산)하지 않습니다.
- 모드 붕괴는 실질적인 문제로 확인되었습니다. 동일한 브리핑을 받았을 때 모델이 안전하고 평균적인 미학에 수렴하는 현상입니다.
방법론
HCB는 평가 축을 객관적으로 검증 가능한 것에서부터 본질적으로 주관적인 것까지의 스펙트럼으로 정의합니다. 각 축에 대해 평가자 간 일치도를 측정합니다. 수렴은 시각적 계층, 색상 대비, 렌더링 품질과 같은 공유된 기준을 반영합니다. 발산은 개인적 취향을 포착하며, 전문가가 탐색과 반복을 위해 여러 방향이 필요한 창의적 워크플로우에 필수적입니다.
AI 에이전트에 대한 시사점
AI 코딩 에이전트를 사용하는 개발자의 경우, 이 벤치마크는 창의적 도구가 신뢰성(지침 따르기)과 조종 가능성(개인 취향에 맞게 조정)을 모두 제공해야 함을 강조합니다. HCB는 이러한 차원을 단일 품질 점수로 평탄화하지 않고 별도로 평가할 수 있는 프레임워크를 제공합니다. 차별화된 출력을 지원하지 않는 에이전트는 실제 창의적 작업에 사용할 수 없을 위험이 있습니다.
📖 Read the full source: HN AI Agents
👀 See Also
채팅에서 바로 링크드인 포스트로 클로드: 전체 워크플로우
Reddit 사용자가 Contentdrips MCP 커넥터를 활용해 Claude AI 채팅에서 직접 LinkedIn 게시물을 작성, 디자인, 게시하는 워크플로우를 공유했습니다.

SimplePDF Copilot: PDF 양식 작성을 위한 클라이언트 사이드 AI 도구 호출
SimplePDF Copilot은 클라이언트 측 도구 호출을 사용해 LLM이 PDF 필드를 채우고, 필드를 추가하고, 페이지를 삭제하는 등의 작업을 수행할 수 있게 합니다. PDF는 브라우저를 떠나지 않습니다.

OpenClaw 기술은 자체 실행을 가능하게 하여 에이전트 전환을 줄입니다.
OpenClaw 에이전트를 위한 새로운 스킬이 개발되어, 에이전트가 다음 단계를 파악한 후 '다음에 할 일은 다음과 같습니다'라는 메시지를 출력하고 작업을 인간 운영자에게 넘겨주는 일반적인 문제를 해결합니다. 이 스킬을 통해 에이전트는 등록, 게시, 답장, 서명 등 특정 작업을 스스로 수행할 수 있게 됩니다.

Tacit: 클로드 코드와 오퍼스 4.7로 구축한 LLM 최우선 프로그래밍 언어
Tacit은 Claude Code와 Opus 4.7을 사용하여 설계 및 구현된 실험적인 LLM-우선 프로그래밍 언어입니다. 인간의 편의성을 제거하여 토큰 사용을 최소화하며, 중간 이상의 LLM(Sonnet 이상)이 Tacit 코드를 작성하는 방법을 가르치는 프라이머를 제공합니다.