Video Has No Memory. Here's How We Built One. — James Le, TwelveLabs
본 영상은 'Twelve Labs'의 James Le이 영상 데이터의 '기억' 부족 문제를 해결하기 위한 '메모리 레이어' 구축 방안을 제시합니다. 영상은 단순한 프레임의 나열이 아닌 시공간적 볼륨으로 간주하고, 이를 위한 컨텍스트 그래프와 5가지 설계 원칙, 그리고 'Jockey'라는 비디오 에이전트 시연을 통해 스포츠 분석, 보안 감시, 광고 배치 등 다양한 응용 사례를 보여줍니다.
핵심 요약
- 영상은 단순한 프레임의 집합이 아닌, 연속성을 포함하는 '시공간적 볼륨'으로 이해해야 함을 강조하며, 기존 비디오 AI의 '잘못된 컨텍스트', '부족한 메모리', '약한 추론' 문제를 지적합니다.
- 비디오 메모리 구축의 어려움으로 시간적 맥락, 멀티모달 정보, 데이터 밀도, 모호성, 그리고 원본 소스 링크의 필요성을 5가지 속성으로 설명합니다.
- Twelve Labs의 기술 스택은 의미론적 청크, 멀티모달 임베딩 인코더 'Marengo', 시공간 컨텍스트 스토어, 그리고 비디오 언어 모델 'Pegasus'로 구성되며, 이를 API로 제공합니다.
전체 요약과 종목별 의견·실시간 분석을 보려면 로그인하세요.
로그인 / 회원가입