본문 바로가기
Taking Reinforcement Learning Cross Datacenter — Nan Jiang, Modal

Taking Reinforcement Learning Cross Datacenter — Nan Jiang, Modal

AIAI Engineer· 2026-08-10

본 영상은 대규모 언어 모델의 강화 학습(RL) 후 학습 과정에서 발생하는 GPU 용량 제약 문제를 해결하기 위한 새로운 동기화 방식을 제안합니다. 기존의 수백 GB 체크포인트 대신 수백 MB의 '델타'만을 전송하여 전역적으로 분산된 GPU 자원을 효율적으로 활용하는 'Stitch' 구현을 소개합니다.

핵심 요약

  • 기존 RL 후 학습 파이프라인은 트레이너와 롤아웃 워커가 동일한 클러스터 내에 묶여 있어 GPU 용량 제약이 발생합니다. (창작자 평가: 특히 '성당'처럼 단일 고성능 클러스터에 의존하는 방식의 한계를 지적)
  • 롤아웃 서빙 아일랜드(serving island)를 이동 가능한 단위로 정의하여, 트레이너는 고성능 클러스터에 유지하고 롤아웃은 전역적으로 분산된 GPU 자원을 활용하는 아키텍처를 제안합니다.
  • 수백 GB의 전체 체크포인트 대신, BF16과 같은 저정밀도 환경에서 작은 Adam 스텝이 반올림 경계를 넘지 못하는 'Adam 흡수(absorption)' 현상을 이용해 변경분을 '패치' 형태로 전송하는 방식을 설명합니다.

전체 요약과 종목별 의견·실시간 분석을 보려면 로그인하세요.

로그인 / 회원가입