Your Voice Agent is Just a Walkie Talkie — Neil Zeghidour, Gradium
본 영상은 음성 에이전트의 역사와 발전 방향을 탐구하며, 텍스트 기반 에이전트의 한계점을 지적합니다. 특히, 실시간 대화에서 발생하는 지연 및 비자연스러움 문제를 해결하기 위한 풀-듀플렉스(Full-Duplex) 음성 모델의 필요성과 구현 방안을 제시합니다. 현재 음성 기술의 '자연스러움'과 '지능' 간의 상충 관계를 분석하고, 이를 극복하기 위한 두 가지 미래 전략을 제안합니다.
핵심 요약
- 2011년 Siri는 STT-NLU-Action-TTS의 복잡한 파이프라인으로 제한적인 사용 사례에만 적용 가능했으며, NLU 대신 LLM을 사용한 OpenAI의 음성 모드는 대화의 자연스러움을 높였지만 에이전트 기능은 없었습니다.
- 최신 음성 에이전트는 텍스트를 거치지 않고 직접 음성을 처리하는 STT-LLM-TTS의 단일화된 접근 방식으로, 자연스러움과 낮은 지연 시간을 제공하지만, 텍스트 기반 모델보다 지능이 떨어진다는 한계가 있습니다.
- 현재의 음성 모델은 대부분 '하프 듀플렉스' 방식으로, 말하거나 듣거나 둘 중 하나만 가능합니다. 실제 인간 대화에서는 20%까지 동시 발화가 일어나며, 이는 음성 에이전트의 자연스러움을 저해하는 요인입니다.
전체 요약과 종목별 의견·실시간 분석을 보려면 로그인하세요.
로그인 / 회원가입