RTX 2060 Super 8GB에서 GPT-1 학습하기 – 로컬 사전 학습 개념 증명

Reddit 사용자(u/tevlon)가 RTX 2060 Super(8GB VRAM)에서 원본 GPT-1 모델(1억 1700만 파라미터)을 약 1시간 만에 성공적으로 학습시켰습니다. 이 프로젝트는 저가형 게이밍 GPU로도 10억 미만의 모델을 사전 학습할 수 있음을 보여주며, 클라우드 크레딧 없이 취미 개발자들에게도 문을 엽니다.
저자는 GPT-2가 이러한 하드웨어에서 로컬 학습하기에는 너무 크지만, GPT-1은 10배 더 작아서 가능하다고 설명합니다. 핵심 요점: RTX 2060 또는 유사 GPU를 가진 모든 게이머는 이제 10억 규모 모델을 사전 학습할 수 있습니다—그리고 10억 미만 모델(예: Datalab.to의 Surya OCR)은 쓰레기가 아니며 유용한 특화 모델을 생성합니다.
코드는 modded-nanogpt 프로젝트의 알고리즘 개선 사항을 통합하면서도 OpenAI의 원래 finetune-transformer-lm 구현을 충실히 따랐습니다. 코드베이스는 주로 Claude 4.8과 Codex 5.5가 사용자의 지시에 따라 작성했습니다.
링크:
저자는 ML 연구자가 아니라 소프트웨어 엔지니어이자 게이머입니다. 모델이 충분히 학습되지 않았음(1시간만)을 인정하지만, 원칙은 분명합니다: 이제 적절한 GPU만 있으면 누구나 로컬 사전 학습이 가능합니다.
이것은 대규모 사전 학습에 클라우드 클러스터가 필요하다는 가정에 도전하는 개념 증명입니다. 8GB 이상 VRAM의 게이밍 GPU가 있다면 사전 학습을 실험해보세요—GPT-1부터 시작하여 규모를 늘리면 됩니다.
📖 전체 원문 보기: r/LocalLLaMA
👀 See Also

RTX 4090 vs H100: Llama-3-8B 파인튜닝 비용 대비 성능 비교
한 개발자가 RTX 4090과 임대한 H100 인스턴스 모두에서 Llama-3-8B 파인튜닝을 테스트했습니다. 4090 설정은 선불로 2,000달러가 들었고 24시간이 걸렸으며, H100 임대는 약 80달러가 들었고 4시간 만에 완료되었습니다.

Anthropic, 서드파티 도구를 통한 Claude 구독 차단
Anthropic은 제3자 OAuth 통합을 통해 사용되는 Claude Pro/Max 구독에 대해 서버 측 차단을 시행했습니다. 이는 대규모로 악용되고 있는 보조금 지원 접근 방식 때문이라고 밝혔습니다. 이 정책 변경에는 '추가 사용량' 청구가 포함되어 있어 이러한 통합을 경제적으로 비실용적으로 만듭니다.

메타의 AI 에이젼트 전환: 저커버그, "진전 속도가 충분히 빠르지 않다"며 1450억 달러 지출
메타 CEO 마크 저커버그는 직원들에게 AI 에이전트 개발이 예상만큼 가속화되지 않았다고 말했습니다. 올해 AI 인프라에 1450억 달러를 지출하고 8000명을 해고하는 등 AI 중심으로 재편했습니다.

클로드 오푸스 4.7은 고해상도 이미지 지원, 작업 예산 기능을 추가하고 확장 사고 기능을 제거했습니다.
Claude Opus 4.7은 2576px/3.75MP까지의 고해상도 이미지 지원, 에이전트 루프에서 토큰 사용량을 제어하는 새로운 작업 예산 기능을 도입하고, 확장 사고 예산을 제거하여 적응형 사고로 대체합니다.