Codestrap 창립자들, AI 코딩 지표 비판하며 품질 문제 경고

AI 자문 서비스 Codestrap의 창립자 도리안 스마일리와 코너 딕스는 기업 조직들이 참조 아키텍처나 사용 사례에 대한 확립된 플레이북이 없어 AI를 효과적으로 도입하는 데 어려움을 겪고 있다고 주장합니다. 그들은 많은 회사들이 실제 영향력을 측정할 적절한 피드백 루프가 부족한 채 AI 전략을 갖춘 척하고 있다고 말합니다.
문제적인 지표와 결함 있는 결과
스마일리는 현재 AI 코딩 평가가 잘못된 지표에 초점을 맞추고 있다고 말합니다: "코드 라인 수, [풀 리퀘스트] 건수, 이들은 부채입니다. 이는 엔지니어링 우수성의 척도가 아닙니다." 그는 배포 빈도, 프로덕션까지의 리드 타임, 변경 실패율, 평균 복구 시간, 인시던트 심각도를 적절한 엔지니어링 지표로 꼽습니다.
잘못된 측정의 결과를 설명하기 위해 스마일리는 최근 AI를 사용해 SQLite를 Rust로 재작성한 시도를 인용합니다: "모든 단위 테스트를 통과했고, 코드 구조는 올바르게 보입니다. 하지만 실제 SQLite보다 3.7배 더 많은 코드 라인 수를 가지면서 성능은 2,000배나 떨어집니다. 데이터베이스에서 2,000배나 나쁜 성능은 실행 불가능한 제품입니다."
기본적인 LLM의 한계
딕스는 현재 LLM 기술의 근본적인 문제점을 지적합니다: "그들에게 새로운 사실을 가르치기 어렵습니다. 사실을 안정적으로 검색하기 어렵습니다. 신경망을 통한 순전파는 비결정론적입니다. 특히 다음 토큰 예측의 효율성을 높이기 위해 내적 독백을 활용하는 추론 모델을 사용할 때는 매번 다른 답변을 얻을 수밖에 없습니다."
스마일리는 덧붙입니다: "그리고 귀납적 추론 능력이 없습니다. 모델은 자신의 작업을 확인할 수 없습니다. 자신이 제공한 답변이 맞는지 알지 못합니다. 이는 LLM 기술에서 아직 아무도 해결하지 못한 근본적인 문제들입니다."
제안된 새로운 측정 접근법
창립자들은 AI 지원 엔지니어링을 위해 특화된 새로운 지표를 개발해야 한다고 주장합니다. 스마일리는 한 가지 잠재적 지표로 "승인된 풀 리퀘스트(공식적으로 수용된 소프트웨어 변경)에 도달하기까지 소모된 토큰 수 측정"을 제안합니다. 그는 조직들이 실험하고 피드백 루프에서 반복해야 한다고 강조하며, "AI는 코딩 맥락에서도 여전히 잘 작동하지 않는다"고 말합니다.
딕스는 최근 아마존과 AWS 중단 사태를 잠재적 미래 문제의 지표로 언급하지만, 아마존은 이 사건들이 AI와 무관하다고 밝혔습니다.
📖 Read the full source: HN AI Agents
👀 See Also
앤트로픽 연구원: AI가 인류 전체를 죽일 확률 10% 이상 — 정렬 계획 부재
Anthropic 안전 연구원 Evan Hubinger는 향후 10년 내에 AI로 인한 실존적 위험이 10%를 초과할 것이라고 경고하며, Anthropic이 초지능 정렬에 대한 계획을 아직 갖고 있지 않다고 밝혔습니다.
Claude Code v2.1.208: 스크린 리더 모드, Vim 리맵, 메모리 누수 수정 등
Claude Code v2.1.208에서 화면 읽기 모드, vim 삽입 모드 리맵, 프로세스 래퍼를 추가하고, MCP stdio, LSP, 도구 결과 페이로드의 메모리 누수를 포함한 수많은 버그를 수정했습니다.

Anthropic, 6월부터 OpenClaw를 통해 Claude의 구독 사용 허용
Anthropic이 6월부터 OpenClaw를 통해 Claude의 구독 기반 사용을 허용할 예정이라고 OpenClaw Dev 트위터 계정이 발표했습니다.

OpenClaw 기여자가 프로젝트의 현대적 기능보다 픽셀 단위 완벽 동등성에 집중하는 것을 비판합니다
r/openclaw의 레딧 게시물은 해상도 스케일링과 고주사율 지원을 다루는 기여자의 PR이 원본 엔진의 시각적 제약에서 벗어났다는 이유로 거절되면서 프로젝트 방향에 대한 논쟁을 불러일으킨 사건을 상세히 설명합니다.