Infra behind Krea 2: How to train and serve at scale — Gabriel Jorge Menezes, Krea.ai
Krea 2 모델의 대규모 사전 학습 및 서빙 인프라 구축 경험을 공유합니다. GPU 활용도를 높이고 런타임 안정성을 확보하기 위한 다양한 지표 추적, 고장 감내 설계, 그리고 학습 우선순위와 추론 서비스를 분리하는 인프라 아키텍처를 상세히 설명합니다.
핵심 요약
- Krea 2 모델은 외부 체크포인트 없이 수천 개의 GPU를 사용하여 처음부터 학습되었으며, 탐색적인 창작 도구를 제공하는 것을 목표로 합니다.
- 대규모 학습 시 발생하는 예상치 못한 오류에 대비하여, 런타임 오류 발생 시에도 재시도를 통해 학습을 지속하는 방식을 사용했습니다.
- GPU 온도 관리가 중요하며, 78도 이상으로 과열되는 GPU는 즉시 제거하여 클러스터 안정성을 유지합니다.
전체 요약과 종목별 의견·실시간 분석을 보려면 로그인하세요.
로그인 / 회원가입