EsoLang-Bench: LLM 추론 능력을 테스트하기 위한 난해한 프로그래밍 언어를 활용한 코딩 벤치마크

EsoLang-Bench는 대규모 언어 모델이 문제를 진정으로 추론해 해결하는지, 아니면 단순히 학습 데이터에 대한 패턴 매칭을 하는지 테스트하기 위해 설계된 새로운 코딩 벤치마크입니다. 이 벤치마크는 학습 데이터에 거의 포함되지 않은 난해한 프로그래밍 언어를 사용합니다.
벤치마크 설계
벤치마크는 다섯 가지 난해한 프로그래밍 언어를 사용합니다: 브레인퍽(Brainfuck), 베펑-98(Befunge-98), 화이트스페이스(Whitespace), 언람다(Unlambda), 셰익스피어(Shakespeare). 이 언어들은 일반적인 사전 학습 파이프라인에서 학습 데이터가 거의 존재하지 않기 때문에 선택되었습니다. 벤치마크는 HumanEval과 동일한 알고리즘 문제를 동일한 난이도 범위로 포함하고 있으며, 단지 이 난해한 언어들로 번역되었을 뿐입니다.
테스트 방법론
연구진은 다섯 가지 모델을 테스트했습니다: GPT-5.2, O4-mini, Gemini 3 Pro, Qwen3-235B, Kimi K2. 그들은 다음과 같은 다섯 가지 프롬프팅 전략을 사용했습니다:
- 자기 주도적 스캐폴딩
- 코더-비평가 쌍
- ReAct 파이프라인
결과
가장 좋은 단일 결과는 베펑-98에서 자기 주도적 스캐폴딩을 사용했을 때 11.2%였습니다. 중간, 어려움, 매우 어려움 난이도의 문제는 모든 모델, 언어, 전략에서 0%를 유지했습니다. 퓨샷 프롬프팅은 평균 +0.8% 포인트만 향상시켰으며, 연구진은 이를 통계적으로 노이즈와 구별되지 않는다고 설명합니다.
클로드 코드(Claude Code)와 코드엑스(Codex) 같은 에이전트 시스템은 비에이전트 접근법보다 2-3배 더 나은 성능을 보였지만, 이 개선은 실제 추론 전이의 증거보다는 더 날카로운 피드백 루프와 컨텍스트 관리에서 비롯된 것입니다.
오류 분석
오류 분석은 흥미로운 패턴을 보여줍니다:
- 브레인퍽(온라인에 일부 존재함)에서는 모델이 유효한 구문을 생성할 수 있었지만 논리에서 실패했습니다.
- 화이트스페이스(학습 데이터가 거의 없음)에서는 모델이 유효한 프로그램조차 전혀 생성하지 못했습니다.
이는 사전 학습 데이터가 어느 정도 있는 언어와 거의 없는 언어에 대한 모델의 성능 사이에 명확한 격차가 있음을 보여줍니다.
목적과 이용 가능성
이 벤치마크는 높은 점수를 실제로 속이기 어려운 평가를 만들어내는 것을 목표로 하며, 파이썬 같은 주류 언어에서 단순히 더 어려운 문제를 넘어서고자 합니다. 연구진은 이 접근법이 벤치마크를 조작하려는 경제적 유인이 존재하지 않고, 좋은 성능을 달성하는 유일한 길이 진정한 일반화 학습인 평가를 만든다고 제안합니다.
EsoLang-Bench는 다른 사람들이 새로운 언어, 새로운 문제 유형, 또는 완전히 다른 분포 외 도메인을 통해 발전시킬 수 있는 템플릿으로 이용 가능합니다.
📖 전체 원문 읽기: r/LocalLLaMA
👀 See Also

LLMSpend: Anthropic 및 OpenAI SDK용 오픈소스 비용 추적기
LLMSpend는 두 줄의 코드로 Anthropic 및 OpenAI SDK 호출에 비용 추적 기능을 추가하는 Python 라이브러리입니다. 외부로 데이터를 전송하지 않고 로컬 SQLite 저장소, CLI 보고서, 웹 대시보드를 제공합니다.

MCP 서버 구현, 지속적인 코딩 에이전트 메모리를 위한 리플렉션 페이퍼 반영
한 개발자가 Reflexion 논문(Shinn 외, NeurIPS 2023)을 MCP 서버로 구현하여 로컬 코딩 에이전트의 세션 간 지속적 메모리 부족 문제를 해결했습니다. 이 시스템은 오류 메시지에 대한 정규식 기반 패턴 매칭을 사용하고 SQLite에 FTS5로 교훈을 저장합니다.

클로드 VS 코드 확장 프로그램 추론 노력 슬라이더가 일관되지 않은 값을 전송합니다
Claude VS Code 확장 프로그램의 추론 노력 슬라이더가 모델에 일관되지 않은 숫자 값을 전송하는 버그가 있습니다. 슬라이더 레이블이 안정적인 숫자 값에 대응되지 않으며, 매핑이 비단조적이어서 슬라이더를 '올리는' 것이 실제로는 더 낮은 숫자를 모델에 전송할 수 있습니다.

ClawControl v1.7.1은 OpenClaw 클라이언트의 일상적인 사용 문제를 해결합니다.
ClawControl v1.7.1은 Windows, Mac, Linux, iOS, Android에서 사용 가능한 OpenClaw용 오픈 소스 클라이언트입니다. 이번 릴리스는 일상적인 OpenClaw 사용 중 발생하는 '왜 이런 현상이 발생할까?' 문제들을 해결하는 데 중점을 두었습니다.