AI 탄수화물 계산 재현성 실패: 1장 사진에 27K 쿼리에서 429g 편차 발생

새로 발표된 프리프린트 논문은 OpenAI GPT-5.4, Anthropic Claude Sonnet 4.6, Google Gemini 2.5 Pro, Google Gemini 3.1 Pro 등 네 가지 AI 모델을 간단한 작업으로 테스트했다: 음식 사진에서 탄수화물을 추정하는 것이다. 동일한 13장의 사진, 동일한 프롬프트, 동일한 설정으로 모델당 500회 이상(총 26,904회 쿼리) 반복했다. 결과는 가장 낮은 무작위성 설정에서도 재현성이 모델마다 극심하게 다름을 보여준다.
주요 발견 사항
- 최악의 편차: Gemini 2.5 Pro가 단일 빠에야 사진에 대해 추정한 범위는 55g에서 484g — 429g 차이였다. 인슐린 대 탄수화물 비율 1:10으로 계산하면 인슐린 42.9단위에 해당한다. 치명적일 수 있는 수치다.
- 중간 변동 계수: Claude 2.4%, GPT-5.4 8.4%, Gemini 3.1 Pro 10.3%, Gemini 2.5 Pro 11.0%.
- 중간 인슐린 변동: Claude 0.9U, GPT-5.4 2.3U, Gemini 3.1 Pro 2.9U, Gemini 2.5 Pro 4.7U.
- 최악의 인슐린 변동: Claude 13.6U, GPT-5.4 16.6U, Gemini 3.1 Pro 16.2U, Gemini 2.5 Pro 42.9U.
“정확히 틀린” 문제
세 모델(Claude, Gemini 2.5 Pro, Gemini 3.1 Pro)은 기준값이 40g(빵 한 조각당 20g으로 포장 라벨에 표시)인 치즈 샌드위치에 대해 독립적으로 약 28g으로 수렴했다. Claude는 510회 쿼리에서 변동 계수 0.3%에 불과했지만, 모든 쿼리가 12g 낮게 추정했다 — 약 1.2U의 일관된 부족 투여였다. GPT-5.4는 반대 방향으로 치우쳐 평균 약 74g으로 높은 변동성을 보였다.
음식 식별 오류
- 베이크웰 타르트: Claude는 100% “린저 토르테”라고 불렀다. GPT-5.4는 “잼 타르트” 또는 “케이크 바”라고 불렀다. Gemini 3.1 Pro만 99.8% 정확히 식별했다.
- 크레마 카탈라나: 네 모델 중 세 모델이 100% “크렘 브륄레”라고 불렀다. Gemini 3.1 Pro는 쿼리의 3.4%만 정확히 맞췄다.
- 치즈 샌드위치: Gemini 3.1 Pro는 쿼리의 17.4%에서 “델리 고기”를 환각했다 — 탄수화물 추정치를 부풀릴 가능성이 있다.
인슐린 투약 위험
강력한 기준값이 있는 5개 이미지에서 Claude는 “임상적으로 유의미한”(2-5U 오류) 또는 “심각한 저혈당 위험”(5U 초과 오류) 영역에 속하는 쿼리가 전혀 없는 유일한 모델이었다. Claude의 쿼리 100%가 안전 또는 중간 영역에 속했다. 다른 모델들은 모든 이미지에서 위험한 이상값을 생성했다.
결론: AI 탄수화물 계산 앱에서 나오는 단일 숫자는 사용자에게 추정치의 근본적인 분포에 대한 가시성을 제공하지 않는다. 높은 일관성(Claude)이 정확성을 보장하지 않는다. 낮은 일관성(Gemini)은 어떤 결과든 생성할 수 있다. 프로덕션 시스템은 이러한 변동성을 고려해야 한다.
📖 전체 출처 읽기: HN AI Agents
👀 See Also

Anthropic, 메시징 통합을 위한 Claude 코드 채널 출시
Anthropic이 Claude Code Channels를 출시하여 개발자들이 Telegram이나 Discord에서 Claude Code 세션에 DM을 보내 파일 편집, 테스트 실행, git 작업을 포함한 전체 도구 접근 권한을 가질 수 있게 되었습니다. 이 기능은 유료 Anthropic 플랜이 필요하며, OpenClaw의 20개 이상 플랫폼 지원에 비해 2개 플랫폼만 지원합니다.
Claude Code v2.1.140: 에이전트 도구 매칭, /goal 중단, Windows 이벤트 루프 지연 문제 수정
v2.1.140에서는 Agent 도구의 subagent_type 일치가 대소문자 및 구분자에 관계없이 작동하도록 개선되었으며, disableAllHooks 사용 시 /goal이 멈추는 문제가 수정되었고, 실행 파일 누락으로 인한 Windows 이벤트 루프 지연이 해결되었습니다. 그 외 다양한 개선 사항이 포함되어 있습니다.

OpenClaw API 비용, 5.5시간 만에 275달러 기록, 연간 20만 달러 이상으로 전망
OpenAI의 GPT-5.4 API로 OpenClaw를 테스트하는 개발자가 오전 11시부터 오후 4시 30분 사이에 275달러를 지출했는데, 이 사용률을 연간으로 환산하면 20만 달러를 넘어섭니다.

클로드 시스템 프롬프트 준수도가 긴 대화에서 저하됩니다
클로드 기반 에이전트는 40-50개의 메시지 이후 시스템 프롬프트 준수가 저하되며, 포맷팅 규칙이 무시되고 제약 조건이 잊혀지는 현상이 나타납니다. 이 문제는 시스템 프롬프트가 컨텍스트 창 내에서 대화 기록과 주의 가중치를 놓고 경쟁하기 때문에 발생합니다.