44,212개의 클로드 코드 로그에서 '프롬프트 천 개당 욕설 횟수' 지표로 개발자의 좌절감을 추적하다

/u/ChartBuilder라는 필명으로 게시물을 올린 개발자가 Claude Code 사용 시 좌절감을 정량화하기 위해 fpk(프롬프트 1,000개당 욕설 횟수)라는 지표를 만들었습니다. 데이터는 5개월, 44,212개의 프롬프트, 6,120개의 세션에 걸쳐 있습니다.
모델별 주요 수치
- claude-opus-4-5: 38.11 fpk
- claude-opus-4-7: 11.11 fpk
- claude-haiku-4-5: 0.00 fpk (서브 에이전트로만 사용, 오케스트레이터로는 사용 안 함)
두 Opus 버전 간 좌절감이 3.4배 감소했으며, 이는 Anthropic의 공식적인 품질 회복(2~3월의 성능 저하 이후)과 밀접하게 일치하지만, 릴리스 노트만으로는 확인할 수 없는 부분입니다.
Claude Code CLI 버전별 fpk
- 2.1.30-69 시대: 40 fpk
- 2.1.100+ 시대: 12 fpk
- 최악의 단일 버전: 2.1.42, 173.79 fpk
- 최고: 2.1.110, 300개 이상의 프롬프트에서 0.00 fpk
핵심 인사이트: 대부분의 좌절감은 환경 문제에서 비롯됨
작성자는 다음과 같이 지적합니다: "대부분의 욕설은 모델을 향한 것이 아니었습니다. gh auth 실패, 도커 문제, 스크린샷 오작동 같은 환경적 마찰에 대한 것이었습니다. 모델은 대부분 제 좌절감을 목격하는 무심한 증인일 뿐, 원인이 아닙니다."
하지만 때로는 모델이 원인이기도 합니다. 전체 글에는 기억에 남는 폭발적인 발언들을 모은 "최고 히트" 모음도 포함되어 있습니다.
재현 가능한 도구
개발자는 자신의 Claude Code 로그에서 fpk를 계산할 수 있는 도구를 공개했습니다:
- 방법론이 포함된 전체 글: mpiv.ai/blog/fpk-f-bombs-per-thousand-the-dev-experience-metric-you-didnt-know-you-needed
- 감사 도구가 포함된 오픈소스 저장소: github.com/MPIsaac-Per/claude-code-ops-audit
Claude Code를 많이 사용하고 있다면, 실제로 겪고 있는 마찰을 정량적으로 파악할 수 있는 이 지표를 도입할 가치가 있습니다. 모델 간 및 CLI 버전 간 차이는 Anthropic의 회복을 구체적으로 보여주며, 분노의 환경적 원인은 모든 팀이 해결할 수 있는 부분입니다.
📖 전체 출처 읽기: r/ClaudeAI
👀 See Also

지문 인식의 AI 에이전트 개발자를 위한 무료 웹 봇 인증 테스트 도구
Fingerprint가 Web Bot Auth 구현을 테스트하기 위한 무료 공개 엔드포인트를 출시했습니다. 이 도구는 HTTP 요청의 암호화 서명을 검증하여 봇 및 AI 에이전트 개발자가 프로덕션 환경에 배포하기 전에 WBA 설정이 올바르게 작동하는지 확인할 수 있도록 돕습니다.

명령 센터: 품질에 진심인 사람들을 위한 AI 코딩 환경
Command Center는 AI 생성 코드의 어려운 부분, 즉 검토, 리팩터링, 그리고 전통적인 엔지니어링 규율을 갖춘 배포에 초점을 맞춘 에이전트 기반 코딩 환경입니다. 워크스루, 리팩터링 에이전트, 스냅샷 복구 기능을 포함합니다.

TestThread: AI 에이전트를 위한 오픈 소스 테스트 프레임워크
TestThread는 라이브 엔드포인트에 대해 테스트를 실행하고 AI 진단과 함께 통과/실패 결과를 제공하며, 의미론적 매칭, PII 감지, CI/CD 통합과 같은 기능을 포함한 AI 에이전트용 오픈 소스 테스트 프레임워크입니다.
Anthropic의 llama.cpp 기반 자연어 오토인코더를 위한 UI 및 서버
Anthropic의 오픈 가중치 Natural Language Autoencoder를 위한 맞춤형 llama.cpp 서버와 Mikupad UI입니다. 활성화 추출, 설명, 재구성 및 설명 편집을 통한 조종을 지원합니다.