ThermoQA: 열역학 공학 문제 293개 계산 문제로 LLM 성능을 평가하는 공개 벤치마크

✍️ OpenClawRadar📅 게시일: March 21, 2026🔗 Source
ThermoQA: 열역학 공학 문제 293개 계산 문제로 LLM 성능을 평가하는 공개 벤치마크
Ad

ThermoQA 벤치마크 개요

ThermoQA는 3단계에 걸친 293개의 자유형 계산 문제로 구성된 공학 열역학용 오픈 벤치마크입니다:

  • 1단계: 물성치 조회 (110개 질문) — 예: "5 MPa, 400°C에서 물의 엔탈피는 얼마인가?"
  • 2단계: 구성요소 분석 (101개 질문) — 터빈, 압축기, 열교환기에 대한 에너지/엔트로피/엑서지 계산
  • 3단계: 전체 사이클 분석 (82개 질문) — 랭킨, 브레이튼, 복합 사이클 가스 터빈

정답은 CoolProp(IAPWS-IF97)에서 제공됩니다. 객관식이 아닌 — 모델은 정확한 수치를 생성해야 합니다.

리더보드 결과 (3회 실행 평균)

  • 1. Claude Opus 4.6: 1단계: 96.4%, 2단계: 92.1%, 3단계: 93.6%, 종합: 94.1%
  • 2. GPT-5.4: 1단계: 97.8%, 2단계: 90.8%, 3단계: 89.7%, 종합: 93.1%
  • 3. Gemini 3.1 Pro: 1단계: 97.9%, 2단계: 90.8%, 3단계: 87.5%, 종합: 92.5%
  • 4. DeepSeek-R1: 1단계: 90.5%, 2단계: 89.2%, 3단계: 81.0%, 종합: 87.4%
  • 5. Grok 4: 1단계: 91.8%, 2단계: 87.9%, 3단계: 80.4%, 종합: 87.3%
  • 6. MiniMax M2.5: 1단계: 85.2%, 2단계: 76.2%, 3단계: 52.7%, 종합: 73.0%
Ad

주요 발견 사항

  • 단계별 순위 변동: Gemini는 1단계(97.9%)에서 선두지만 3단계(87.5%)에서는 3위로 하락합니다. Opus는 조회에서 3위지만 사이클 분석에서는 1위로, 증기표 암기 ≠ 추론 능력을 보여줍니다.
  • 초임계 물이 모든 것을 깨뜨림: 44.5% 포인트 차이. 모델들은 교과서 표를 암기하지만 임계점 근처의 비선형 영역을 처리하지 못합니다. 한 모델은 정답이 2,586 kJ/kg인데 h = 1,887 kJ/kg을 제시했으며 — 27% 오류입니다.
  • R-134a는 맹점: 모든 모델이 냉매 문제에서 44–63%로 떨어지는 반면 물 문제에서는 75–98%를 기록하며, 훈련 데이터 편향을 보여줍니다.
  • 실행 간 일관성 10배 차이: GPT-5.4 σ = ±0.1%(3단계) 대 DeepSeek-R1 σ = ±2.5%(2단계).

오픈소스 리소스

📖 Read the full source: r/LocalLLaMA

Ad

👀 See Also

클로드는 엔지니어링 기억이 부족하다: 온콜 장애로 드러난 디버깅 여정의 일화적 회상缺失
News

클로드는 엔지니어링 기억이 부족하다: 온콜 장애로 드러난 디버깅 여정의 일화적 회상缺失

개발자가 1500개 파일의 모노레포에서 Kafka 버스트 문제를 디버깅하는 데 10시간을 썼지만, 4개월 전에 똑같은 문제를 해결했다는 사실을 깨달았습니다. 이는 Claude와 같은 AI 코딩 어시스턴트가 과거 디버깅 경험에 대한 일화적 기억(episodic memory)을 가지고 있지 않다는 점을 드러냅니다.

OpenClawRadar
Claude Code v2.1.193: 새로운 셸 분류, 텔레메트리 및 수정 사항
News

Claude Code v2.1.193: 새로운 셸 분류, 텔레메트리 및 수정 사항

Claude Code v2.1.193이 자동 모드에서 모든 셸 명령을 분류하는 autoMode.classifyAllShell, 새로운 OpenTelemetry 로그 이벤트, bash 모드의 실시간 파일 경로 자동 완성, 백그라운드 에이전트 및 MCP 인증 관련 수정 사항을 추가했습니다.

OpenClawRadar
Anthropic, 클로드 코드 기능을 프로 구독에서 신규 사용자 대상으로 테스트 중에 제거
News

Anthropic, 클로드 코드 기능을 프로 구독에서 신규 사용자 대상으로 테스트 중에 제거

Anthropic은 신규 사용자를 대상으로 한 월 20달러 'Pro' 구독 플랜에서 Claude Code 접근을 일시적으로 제거했습니다. 웹사이트 가격 페이지와 지원 문서를 변경한 후 다시 원상복구했습니다. 회사는 이를 '신규 프로슈머 가입자의 2%를 대상으로 한 소규모 테스트'라고 설명했습니다.

OpenClawRadar
클로드 프로젝트에서 지속적인 데이터 손실: 복구되지 않고 사라지는 대화 내용
News

클로드 프로젝트에서 지속적인 데이터 손실: 복구되지 않고 사라지는 대화 내용

장편 작가가 클로드 프로젝트에서 작성한 대화가 프로젝트 채팅 목록에서 사라지고 검색도 불가능하며 복구도 불가능해 며칠치 작업을 통째로 잃었다고 보고했다. 세 차례 사고 발생 후 Anthropic 지원팀으로부터 아무런 응답도 받지 못했다.

OpenClawRadar