본문 바로가기
DeepSeek Just Killed Visual Reasoning (And It's 10× Cheaper)

DeepSeek Just Killed Visual Reasoning (And It's 10× Cheaper)

AIPrompt Engineering· 2026-05-02

DeepSeek가 'Thinking with Visual Primitives'라는 논문을 통해 시각적 추론에서 혁신적인 효율성을 달성했음을 소개합니다. 이 모델은 시각적 정보를 텍스트보다 10배 이상 압축하여 KV 캐시 사용량을 획기적으로 줄이며, 특히 복잡한 시각적 장면에서의 추론 능력을 향상시킵니다.

핵심 요약

  • DeepSeek의 새로운 모델은 80x80 해상도 이미지에 대해 약 90개의 KV 캐시 항목을 사용하여 Sonnet 4.6 (870개) 및 Gemini 3 Flash (900개) 대비 10배 이상의 효율성을 보입니다.
  • 이전 모델들(DeepSeek VL, Janus, DeepSeek V2, Genus Pro 7B, DeepSeek OCR)을 거쳐 '가장 저렴하면서도 작동하는 표현'을 찾는 DeepSeek의 비전 연구 계보를 조명합니다.
  • 모델의 핵심 아이디어는 '참조 간극(reference gap)'을 해결하기 위해, 바운딩 박스 좌표와 같은 시각적 참조를 언어 모델의 체인 오브 쏘트(chain of thought)에 통합하는 것입니다.

전체 요약과 종목별 의견·실시간 분석을 보려면 로그인하세요.

로그인 / 회원가입