This 27B Model Shouldn't Run On Your Phone. It Does.
Prism ML이 개발한 1-bit "Bonsai" 양자화 기법을 통해 270억 파라미터 Qwen 기반 모델을 54GB에서 3.9GB로 압축하여 iPhone 17 Pro에서 초당 11토큰 속도로 실행 가능함을 설명합니다. 이 기법은 기존 양자화의 오류 누적 문제를 해결하고 모델의 품질을 90% 이상 보존하면서 휴대기기에서도 유용하게 사용할 수 있는 LLM을 구현하는 가능성을 보여줍니다.
핵심 요약
- Prism ML은 270억 파라미터 모델을 1-bit "Bonsai" 양자화 기술을 사용하여 54GB에서 3.9GB로 압축, iPhone 17 Pro에서 초당 11토큰 속도로 실행 가능하게 만들었습니다.
- 일반적인 양자화 방식은 오류 누적으로 인해 성능 저하를 일으키지만, Bonsai는 양자화 인식 학습(quantization-aware training)을 통해 모델이 저비트 환경에 적응하도록 훈련시켜 품질 저하를 최소화합니다.
- 1-bit Bonsai 모델은 원본 모델의 90% 품질을 유지하며, 4-bit 비전 타워를 통해 멀티모달 기능과 262,200 토큰의 긴 컨텍스트 창을 지원합니다.
전체 요약과 종목별 의견·실시간 분석을 보려면 로그인하세요.
로그인 / 회원가입