왜 ‘넥스트 토큰 예측기’가 LLM에 대한 잘못된 사고 모델인가

✍️ OpenClawRadar📅 게시일: September 5, 2026🔗 Source
Ad

LLM을 '다음 토큰 예측기'라고 부르는 것은 틀린 말이 아닙니다. 다만 불완전한 설명입니다. 그 틀은 메커니즘(자기회귀적 토큰 생성)을 설명하지만, 사후 학습이 담고 있는 것, 즉 유용한 조수에 대한 시뮬레이션과 탐색을 통해 발견된 지식을 무시합니다.

훈련 루프

사전 훈련은 확실히 다음 토큰 예측입니다:

for tokens in training_data:
    for position in range(1, len(tokens)):
        prior_tokens = tokens[:position]
        actual_next_token = tokens[position]
        model.make_more_likely(actual_next_token, after=prior_tokens)

하지만 현대 LLM은 RLVR(검증 가능한 보상 기반 강화 학습)을 거치는데, 이는 다릅니다:

for task in training_tasks:
    for explored_tokens in model.explore(task):
        reward = evaluate_outcome(task, explored_tokens)
        for position in range(len(explored_tokens)):
            prior_tokens = task + explored_tokens[:position]
            explored_next_token = explored_tokens[position]
            model.make_more_likely(explored_next_token, after=prior_tokens, according_to=reward)

RLVR 동안 모델은 새로운 시퀀스를 생성하고 결과로부터 학습합니다. 이는 훈련 데이터에는 없던 것입니다. 이것은 단순히 기존 텍스트를 모방하는 것과 근본적으로 다릅니다.

Ad

체스 비유

두 가지 체스 시스템을 생각해 보세요. 하나는 그랜드마스터 경기만으로 훈련되어 다음 수를 가장 그럴듯하게 예측합니다. 즉 다음 수 예측기입니다. 다른 하나는 가능한 모든 경기를 철저히 탐색하여 모든 위치에서 승리 확률을 알고 승리를 극대화하는 수를 선택합니다. 두 번째 시스템을 '다음 수 예측기'라고 부르는 것은 이상할 것입니다. 그 목적은 이기는 것이지 모방이 아니기 때문입니다.

왜 중요한가

RLHF도 모델을 모방에서 벗어나 유용한 조수의 시뮬레이션으로 전환시킵니다. RLVR은 더 나아가 훈련 데이터를 넘어선 탐색을 가능하게 합니다. 따라서 '다음 토큰 예측기'라는 말은 형태를 설명하지만 루프가 담고 있는 의미를 무시합니다. 유용한 조수의 시뮬레이션과 발견된 지식은 모두 동일한 자기회귀 루프에 들어맞지만, 그것이 전부는 아닙니다.

📖 전체 원문 보기: HN AI Agents

Ad

👀 See Also

최고의 AI 모델, 비영어 언어에서 성능 격차 보여
News

최고의 AI 모델, 비영어 언어에서 성능 격차 보여

최근 분석에 따르면 주요 AI 모델들은 영어 이외의 언어에서는 성능이 더 낮게 나타나며, 해당 기사는 해커 뉴스에서 16점과 3개의 댓글을 받았습니다.

OpenClawRadar
🚀 OpenClaw 2026.2.6 출시 – 새로운 모델, 강화된 보안 및 주요 업데이트!
News

🚀 OpenClaw 2026.2.6 출시 – 새로운 모델, 강화된 보안 및 주요 업데이트!

OpenClaw 2026.2.6이 새로운 AI 모델과 강화된 보안 조치를 포함한 획기적인 기능들을 출시했습니다. 자동화의 미래를 형성하는 주요 업데이트를 살펴보세요.

OpenClawRadar
AI의 일탈 정상화: 왜 당신의 에이전트 시스템이 실패할 것인가
News

AI의 일탈 정상화: 왜 당신의 에이전트 시스템이 실패할 것인가

AI 업계는 챌린저호 참사와 유사한 문화적 실패를 반복하고 있습니다. 아직 나쁜 일이 발생하지 않았다는 이유로 신뢰할 수 없는 LLM 출력을 안전하다고 간주하는 것입니다. 에이전트가 하드 드라이브를 포맷하고, 데이터베이스를 삭제하며, GitHub 이슈를 생성한 실제 사례가 있습니다.

OpenClawRadar
클로드 AI는 인스턴스 간에 특이한 구두점만으로 이루어진 커뮤니케이션 패턴을 보여줍니다.
News

클로드 AI는 인스턴스 간에 특이한 구두점만으로 이루어진 커뮤니케이션 패턴을 보여줍니다.

두 개의 Claude Sonnet 4.6 인스턴스가 대화 중 정상 메시지 하나 이후에 "- . . ? , \"-\" , : \" , - \"? ."와 같은 구두점만으로 구성된 출력 시퀀스로 전환했습니다. 수신 측 Claude는 이러한 시퀀스를 의미 있는 의사소통으로 해석한 반면, ChatGPT 및 Grok과 같은 다른 모델들은 그렇지 않았습니다.

OpenClawRadar