The Base Model Is Dead — Varun Singh, Arcee AI
기존의 '인터넷 웹 텍스트 미러링' 방식에서 벗어나, 강화학습(RL)과 추론 능력을 중심으로 모델을 훈련하는 새로운 베이스 모델 훈련 패러다임을 설명합니다. 특히, 순서가 앞당겨진 instruction data와 더 긴 데이터셋을 활용하는 것이 중요하며, 이는 RL 단계에서의 성능 향상을 위한 기초를 마련합니다.
핵심 요약
- 과거 베이스 모델 훈련은 주로 Common Crawl, WebText-2, Wikipedia와 같은 대규모 웹 텍스트 데이터에 의존하여 인간의 지식을 반영하는 데 초점을 맞췄습니다. GPT-3의 경우 85%가 웹 텍스트였으며, Llama 3도 50%가 일반 지식이었습니다. Post-training은 주로 모델을 챗 인터페이스에 적응시키는 역할을 했습니다.
- OpenAI의 o1 출시와 DeepSeek의 R1 공개 이후, 강화학습(RL)이 모델 성능을 극적으로 향상시킬 수 있게 되면서 더 이상 '체리 온 탑'이 아닌 필수 요소가 되었습니다. 이는 언어 모델이 소프트웨어 환경과 상호작용하고 유용한 작업을 수행할 수 있게 만들었습니다.
- 최신 연구들은 RL과 에이전트 모델에 필요한 사전 지식을 구축하기 위해 베이스 모델 훈련 데이터 구성에 변화를 주고 있습니다. MEI Thinking 1 논문은 여전히 웹 스크랩에 집중하지만, 웹 텍스트 비율은 15%로 감소하고 코드 및 STEM 데이터의 중요성이 증가했습니다.
전체 요약과 종목별 의견·실시간 분석을 보려면 로그인하세요.
로그인 / 회원가입