본문 바로가기
Scaling up Continual Learning — Ronak Malde, Trajectory

Scaling up Continual Learning — Ronak Malde, Trajectory

AIAI Engineer· 2026-08-12

본 영상은 기존 강화학습(RL) 알고리즘의 한계를 극복하기 위한 새로운 지속 학습(Continual Learning) 알고리즘인 '온-폴리시 셀프-디스틸레이션'(On-Policy Self-Distillation, OPSD)을 소개하고, 이를 실제 대규모 모델에 적용할 때 발생하는 문제점과 해결 방안을 제시합니다. 특히, 장기적인 작업에서 발생하는 '버트-웨이트(but-wait)' 문제와 힌트 누수(hint leakage) 문제를 해결하기 위한 KL 발산 기반 가중치 조정 및 잔여…

핵심 요약

  • 기존 RL 알고리즘은 시간 소모적이고 비용이 많이 드는 벤치마크에 의존하며, 온라인 작업 분포, 온-폴리시 샘플링, 단일 병렬 롤아웃, 토큰별 보상 기준을 모두 충족시키지 못하는 문제가 있습니다. (창작자 평가: 여러 가지 문제점 언급)
  • 온-폴리시 셀프-디스틸레이션(OPSD)은 학생 모델에게 '힌트'라는 추가 정보를 제공하여 자체적으로 교사가 되게 하는 방식으로, 고정된 데이터셋 대신 학생 모델의 롤아웃을 사용하여 학습합니다. (창작자 평가: 강력한 알고리즘)
  • OPSD는 온라인 작업 분포, 온-폴리시 샘플링, 단일 병렬 롤아웃, 토큰별 풍부한 피드백이라는 네 가지 기준을 모두 충족하며, 기존 RL 알고리즘 대비 향상된 성능과 효율성을 보입니다. (창작자 평가: 매우 흥미로운 부분)

전체 요약과 종목별 의견·실시간 분석을 보려면 로그인하세요.

로그인 / 회원가입