Talkie: 1931년 이전 텍스트만으로 훈련된 13B LLM, RL 훈련에서 심사자로 클로드 활용

Alec Radford(GPT, CLIP, Whisper), Nick Levine, David Duvenaud를 포함한 연구팀이 Talkie를 공개했습니다. Talkie는 1931년 이전에 출판된 텍스트만으로 훈련된 130억 파라미터 언어 모델입니다. 모델의 지식 범위는 1930년 12월 31일까지로, 인터넷, 위키백과, 제2차 세계대전 관련 콘텐츠가 전혀 포함되지 않았습니다.
중요한 이유
현재의 LLM(GPT, Claude, Gemini, Llama)은 모두 현대 웹의 훈련 데이터를 공유하기 때문에 암기와 진정한 추론을 분리하기 어렵습니다. Talkie는 이러한 계보를 깨뜨립니다. 훈련 분포가 근본적으로 달라, 연구자들은 능력이 암기에서 비롯되는지 일반화에서 비롯되는지 테스트할 수 있습니다. 연구팀은 "LM 능력이 암기에서 비롯되는지 일반화에서 비롯되는지는 중요한 질문입니다. 빈티지 LM은 독특한 일반화 테스트를 가능하게 합니다."라고 말합니다.
Claude의 훈련 역할
Claude Sonnet 4.6은 Talkie의 강화 학습 파이프라인(온라인 DPO)에서 심사자 역할을 했습니다. 또한 Claude Opus 4.4는 최종 미세 조정 단계에서 사용된 합성 다중 턴 대화를 생성했습니다. 연구팀은 아이러니와 오염 위험을 인정하며, 향후 버전에서 이를 제거하기 위해 노력 중이라고 밝혔습니다.
주요 기능
- Talkie는 훈련 데이터에 현대 코드가 전혀 없음에도 불구하고 몇 가지 맥락 예제만으로 Python 코드를 작성하는 방법을 학습할 수 있습니다. 19세기 수학 텍스트에서 추론하는 것이지 검색에서 비롯된 것이 아닙니다.
- 장기 예측용으로 설계: 모델이 고정된 1930년 관점에서 미래를 얼마나 잘 "예측"할 수 있는지?
- "발명" 연구에 사용 가능: 지식 범위 이후의 아이디어를 개발할 수 있는지.
- 어떤 능력이 아키텍처에 기반하고 어떤 능력이 웹 데이터에서 흡수되었는지 분리하는 데 도움.
접근 및 라이선스
Talkie와 그 변형은 모두 Apache 2.0 라이선스이며 Hugging Face에서 오픈 웨이트로 제공됩니다. 제공된 링크에서 실시간으로 채팅할 수 있습니다. 연구팀은 올해 말 GPT-3 규모의 빈티지 모델을 계획하고 있습니다.
연구에 사용되는 용도
- 장기 예측: 역사적 관점에서 미래 발전을 예측.
- 발명: 훈련 범위 이후의 아이디어 생성.
- LLM 정체성: 모델을 구성하는 요소 — 아키텍처와 데이터 분포 효과 분리.
📖 전체 출처 읽기: r/ClaudeAI
👀 See Also

Anthropic, Claude의 컴퓨터 사용 능력 향상을 위해 Vercept AI 인수
Anthropic이 Claude의 컴퓨터 사용 기능을 개발하기 위해 Vercept AI를 인수했습니다. 이 인수는 AI가 복잡한 작업에 더 유용하도록 하기 위해 지각과 상호작용 문제를 해결하는 데 초점을 맞추고 있습니다.

DeepSeek V4 가격 현실 점검: Opus 대비 캐시 토큰 178배 저렴, 그러나 성능 격차 인정
DeepSeek V4 Pro 입력은 토큰 100만 개당 $0.145로, Claude Opus 4.7의 $5(34배 저렴)와 비교됩니다. 캐시 적중 시 $0.0036/$0.625(173배 저렴). 성능은 GPT-5.4 및 Gemini 3.1 Pro보다 3~6개월 뒤쳐집니다.

클로드 코드 v2.1.215: /verify 및 /code-review 더 이상 자동 실행되지 않음
Claude Code v2.1.215에서 /verify 및 /code-review 스킬이 자동 실행되지 않습니다. 필요 시 /verify 또는 /code-review를 명시적으로 호출해야 합니다.

클로드 대 GPT-4o: 동일한 이중 진자 프롬프트, 다른 좌표 규칙
Claude와 GPT-4o는 동일한 렌더러를 사용하면서도 세타를 서로 다른 수직 기준(위쪽 vs 아래쪽)에서 해석하기 때문에 시각적으로 다른 이중 진자 시뮬레이션을 생성합니다. 수학적으로는 둘 다 맞지만, 이러한 불일치는 프롬프트 해석의 미묘한 모호성을 드러냅니다.