ThermoQA: 열역학 공학 문제 293개 계산 문제로 LLM 성능을 평가하는 공개 벤치마크

ThermoQA 벤치마크 개요
ThermoQA는 3단계에 걸친 293개의 자유형 계산 문제로 구성된 공학 열역학용 오픈 벤치마크입니다:
- 1단계: 물성치 조회 (110개 질문) — 예: "5 MPa, 400°C에서 물의 엔탈피는 얼마인가?"
- 2단계: 구성요소 분석 (101개 질문) — 터빈, 압축기, 열교환기에 대한 에너지/엔트로피/엑서지 계산
- 3단계: 전체 사이클 분석 (82개 질문) — 랭킨, 브레이튼, 복합 사이클 가스 터빈
정답은 CoolProp(IAPWS-IF97)에서 제공됩니다. 객관식이 아닌 — 모델은 정확한 수치를 생성해야 합니다.
리더보드 결과 (3회 실행 평균)
- 1. Claude Opus 4.6: 1단계: 96.4%, 2단계: 92.1%, 3단계: 93.6%, 종합: 94.1%
- 2. GPT-5.4: 1단계: 97.8%, 2단계: 90.8%, 3단계: 89.7%, 종합: 93.1%
- 3. Gemini 3.1 Pro: 1단계: 97.9%, 2단계: 90.8%, 3단계: 87.5%, 종합: 92.5%
- 4. DeepSeek-R1: 1단계: 90.5%, 2단계: 89.2%, 3단계: 81.0%, 종합: 87.4%
- 5. Grok 4: 1단계: 91.8%, 2단계: 87.9%, 3단계: 80.4%, 종합: 87.3%
- 6. MiniMax M2.5: 1단계: 85.2%, 2단계: 76.2%, 3단계: 52.7%, 종합: 73.0%
주요 발견 사항
- 단계별 순위 변동: Gemini는 1단계(97.9%)에서 선두지만 3단계(87.5%)에서는 3위로 하락합니다. Opus는 조회에서 3위지만 사이클 분석에서는 1위로, 증기표 암기 ≠ 추론 능력을 보여줍니다.
- 초임계 물이 모든 것을 깨뜨림: 44.5% 포인트 차이. 모델들은 교과서 표를 암기하지만 임계점 근처의 비선형 영역을 처리하지 못합니다. 한 모델은 정답이 2,586 kJ/kg인데 h = 1,887 kJ/kg을 제시했으며 — 27% 오류입니다.
- R-134a는 맹점: 모든 모델이 냉매 문제에서 44–63%로 떨어지는 반면 물 문제에서는 75–98%를 기록하며, 훈련 데이터 편향을 보여줍니다.
- 실행 간 일관성 10배 차이: GPT-5.4 σ = ±0.1%(3단계) 대 DeepSeek-R1 σ = ±2.5%(2단계).
오픈소스 리소스
📖 Read the full source: r/LocalLLaMA
👀 See Also

클로드는 엔지니어링 기억이 부족하다: 온콜 장애로 드러난 디버깅 여정의 일화적 회상缺失
개발자가 1500개 파일의 모노레포에서 Kafka 버스트 문제를 디버깅하는 데 10시간을 썼지만, 4개월 전에 똑같은 문제를 해결했다는 사실을 깨달았습니다. 이는 Claude와 같은 AI 코딩 어시스턴트가 과거 디버깅 경험에 대한 일화적 기억(episodic memory)을 가지고 있지 않다는 점을 드러냅니다.

Claude Code v2.1.193: 새로운 셸 분류, 텔레메트리 및 수정 사항
Claude Code v2.1.193이 자동 모드에서 모든 셸 명령을 분류하는 autoMode.classifyAllShell, 새로운 OpenTelemetry 로그 이벤트, bash 모드의 실시간 파일 경로 자동 완성, 백그라운드 에이전트 및 MCP 인증 관련 수정 사항을 추가했습니다.

Anthropic, 클로드 코드 기능을 프로 구독에서 신규 사용자 대상으로 테스트 중에 제거
Anthropic은 신규 사용자를 대상으로 한 월 20달러 'Pro' 구독 플랜에서 Claude Code 접근을 일시적으로 제거했습니다. 웹사이트 가격 페이지와 지원 문서를 변경한 후 다시 원상복구했습니다. 회사는 이를 '신규 프로슈머 가입자의 2%를 대상으로 한 소규모 테스트'라고 설명했습니다.

클로드 프로젝트에서 지속적인 데이터 손실: 복구되지 않고 사라지는 대화 내용
장편 작가가 클로드 프로젝트에서 작성한 대화가 프로젝트 채팅 목록에서 사라지고 검색도 불가능하며 복구도 불가능해 며칠치 작업을 통째로 잃었다고 보고했다. 세 차례 사고 발생 후 Anthropic 지원팀으로부터 아무런 응답도 받지 못했다.