Since 1959

2026.09.30 (수)
2026.09.30 (수)
[기고] 음성 AI의 재고: 텍스트에서 네이티브 음성 AI 모델로
2026-09-30  글: 실비 바라크(Sylvie Barak), 마우저 일렉트로닉스(Mouser Electronics)

ChatGPT와 같은 대규모 언어 모델(LLM)이 사람들의 삶에 점점 더 깊이 자리 잡으면서, 우리는 그것들이 모든 것을 단순화하고 효율성을 만들어낸다고 스스로 믿고 싶어 한다. 그러나 더 자세히 들여다보면, 특히 음성 질의와 관련해 보이지 않는 곳에서 흥미로운 일이 벌어지고 있음을 알 수 있다.


현재 음성을 사용해 인공지능(AI)에 질문하면, 아키텍처 수준에서 여러 단계가 진행된다. 먼저 음성 활동 감지가 이루어지고, 이어 자동 음성 인식(ASR)이 해당 음성을 텍스트로 변환한다. 다음으로 LLM이 텍스트 응답을 생성하고, 이후 텍스트 음성 변환(TTS)을 통해 그 응답을 다시 사용자에게 읽어준다.


현재로서는 이 방식이 작동하며, 심지어 인상적으로 느껴질 수도 있다. 그러나 텍스트를 중간 매개체로 사용하는 것은 번거롭고 느리며, 미묘한 뉘앙스를 제거한다. 이 글에서는 오늘날 음성 AI의 핵심 병목 현상, 즉 텍스트 기반 파이프라인이 초래하는 지연 시간과 뉘앙스 손실을 살펴보고, 네이티브 음성 AI 아키텍처로의 전환 과정을 추적해 본다.




텍스트 LLM에서 네이티브 음성 AI 모델로


엔지니어들은 실제로 중요한 것은 지연 시간뿐이라고 주장할 수도 있지만, 음성에서 뉘앙스를 제거하는 것은 상당한 한계를 만들어낸다. 우리가 말을 할 때는 단순히 단어만 전달하는 것이 아니다. 인간은 음높이, 타이밍, 비꼼과 같은 신호를 통해 감정을 전달한다. 텍스트는 모든 것을 전통적인 LLM이 쉽게 처리할 수 있는 일련의 토큰으로 평면화하지만, 눈을 흘기는 표정이나 이를 악무는 상태를 감지할 수는 없으며, 이는 의미를 완전히 바꿀 수 있다. 그 결과, 음성을 텍스트로 변환하는 시스템은 중요한 맥락 정보를 잃게 된다. 


의도, 감정, 맥락을 전달하는 음성 신호를 보존하려면 다른 접근 방식이 필요하다. 즉, 텍스트 전사본이 아니라 오디오 자체를 직접 처리하는 방식이다. 네이티브 음성 AI 모델은 텍스트를 중간 단계로 필요로 하지 않고 음성을 오디오 형태로 직접 처리하고 생성한다. 언어를 일련의 문자 토큰으로 취급하는 대신, 이러한 모델은 압축된 오디오 표현을 기반으로 작동하며, 이를 통해 무엇이 말해졌는지뿐만 아니라 어떻게 말해졌는지, 즉 억양, 타이밍, 감정, 미묘한 대화 신호까지 포착할 수 있다.


이 차이는 단순히 아키텍처상의 차이 그 이상이다. 기존 파이프라인은 음성에서 단어만을 “채굴하듯 추출”하고 나머지는 모두 버린다. 네이티브 음성 AI 모델은 전체 신호를 보존해 보다 자연스러운 상호작용을 가능하게 하는 동시에, 여러 처리 단계를 제거함으로써 지연 시간도 줄인다.


음성-텍스트 변환 제거의 한계


그렇다면 음성-텍스트 변환 부분을 완전히 없애면 되지 않을까? 여기에는 몇 가지 이유가 있다. 우선, 텍스트는 이미 이산적인 형태이기 때문에 LLM의 매체로 사용하기에 편리하다. 모든 단어는 유한한 어휘 집합에 속하는 토큰으로 표현할 수 있으며, 다음 토큰을 예측하는 것은 바로 LLM이 학습하도록 설계된 작업이다.


반면 오디오는 연속적이며 데이터 집약적이다. 콤팩트 디스크(CD) 품질의 음성은 1초에 44,100개의 샘플로 구성된다. 통신용 수준의 8kHz에서도 초당 8,000개의 샘플이 된다. LLM이 다음 오디오 샘플을 예측하도록 학습하는 것은 계산 비용이 매우 많이 들며, 모델은 이처럼 고해상도의 데이터 안에서 의미 있는 패턴을 학습하는 데 어려움을 겪을 수 있다.


신경망 오디오 코덱: 소리를 토큰으로 변환하기


유망한 접근 방식 중 하나는 신경망 오디오 코덱으로, 오디오를 훨씬 더 작은 규모의 이산 토큰 시퀀스로 압축한다. 구글의 SoundStream과 메타의 EnCodec은 인코더-디코더 신경망과 잔차 벡터 양자화(RVQ)를 결합해 이러한 접근 방식을 개척했다.


이 과정은 영리하다. 신경망 인코더는 오디오 파형을 잠재 표현으로 압축하고, 일련의 양자화기가 그 표현을 이산화한다. 쉽게 말해, 인코더는 대략적인 표현을 생성하고, 양자화기는 이를 학습된 유한한 패턴 집합에 매핑한다. 이를 통해 연속적인 오디오는 코드북 인덱스의 시퀀스로 표현될 수 있다.


초기 양자화 단계는 일반적으로 더 거친 정보를 포착하는 반면, 이후 단계는 잔차를 정교하게 다듬고 복원 충실도를 향상시킨다. 일부 최신 아키텍처에서는 토큰 계층 구조가 상위 수준의 의미 정보와 보다 세밀한 음향 세부 정보를 더 잘 분리하도록 설계된다. 디코더 측에서는 이러한 토큰이 다시 파형으로 복원된다.


신경망 코덱을 사용하면 1초 분량의 오디오를 훨씬 더 작은 이산 토큰 스트림으로 압축할 수 있지만, 정확한 토큰 생성률은 코덱 설계와 대역폭 설정에 따라 달라진다. 오디오는 여전히 텍스트보다 더 많은 토큰을 필요로 하며, 텍스트의 경우 동일한 내용을 단 몇 개의 토큰만으로 표현할 수도 있지만, 이렇게 생성된 토큰 스트림은 현대적인 아키텍처에서 충분히 처리 가능한 수준이다. 오디오 토큰은 LLM 아키텍처에 입력할 수 있으며, 시퀀스에서 다음 토큰을 예측하도록 모델을 학습하는 데 사용할 수 있다.


(출처: Kunwer Studio/stock.adobe.com; generated with AI)



실시간 혁신: GPT-4o와 Moshi 네이티브 음성 AI 모델


최근의 시스템들은 네이티브 오디오 모델링에서 대대적인 아키텍처적 도약을 보여준다. OpenAI의 GPT-4o는 텍스트, 비전, 오디오를 아우르는 엔드투엔드 멀티모달 모델로 설명되며, 낮은 지연 시간으로 오디오 응답을 생성할 수 있다. 이 실시간 시스템은 왕복 지연 시간을 수백 밀리초 수준으로 구현할 수 있다.


프랑스의 AI 연구소 Kyutai는 2024년 9월 Moshi[1]라는 모델을 오픈소스로 공개하며 이러한 개념을 한층 더 발전시켰다. Moshi는 대화의 두 스트림, 즉 사용자가 말하는 내용과 모델 자체가 생성하는 출력을 병렬로 처리하며, 이를 통해 대화 중 끼어들기를 보다 자연스럽게 처리할 수 있다.[2] 엄격한 턴테이킹 프로토콜도 존재하지 않는다. 응답을 생성하는 동시에 들어오는 오디오를 처리할 수 있다. 이들이 측정한 지연 시간은 약 200밀리초로, 자연스러운 대화 속도에 근접한다.


기반 아키텍처는 특히 중요하다. Kyutai는 자사의 신경망 코덱인 Mimi가 생성한 오디오 토큰을 예측하는 70억 개 파라미터 규모의 트랜스포머를 구축했으며, 각 오디오 토큰에 앞서 정렬된 텍스트 토큰을 접두 형태로 예측하는 “내적 독백” 메커니즘을 도입했다. 이러한 하이브리드 접근 방식은 순수한 오디오-투-오디오 생성 방식보다 일관성을 향상시킬 수 있으며, 텍스트가 입력이나 출력의 일부가 아니더라도 내부 표현으로서 여전히 유용한 역할을 할 수 있음을 시사한다.


구글의 AudioLM과 SoundStorm은 다른 접근 방식을 취한다. 이들은 콘텐츠를 나타내는 “의미적” 토큰과 그것이 어떻게 표현되는지를 나타내는 “음향적” 토큰을 분리하고, 이를 단계적으로 생성한다. 먼저 의미적 토큰을 생성해 구조를 확립한 뒤, 음향적 토큰을 생성해 음성, 타이밍, 녹음 특성을 정교하게 다듬는다.


이러한 진전에도 불구하고, 음성 LLM은 여전히 발전 중인 분야다. 현재의 모델들은 오디오 신호에 존재하는 모든 정보를 아직 완전히 활용하지 못하고 있다. 과제의 일부는 학습 데이터에 있다. 텍스트 모델은 방대한 양의 문서 콘텐츠를 활용할 수 있는 반면, 음성 모델은 대규모의 짝지어진 대화형 오디오 데이터를 필요로 하며, 이러한 데이터는 대규모로 확보하기가 더 어렵다. 예를 들어 Moshi는 처음에 전사문이 함께 제공된 700만 시간의 대규모 오디오 데이터로 사전 학습됐고, 이후 여러 오디오 스트림을 이용해 후속 학습을 거쳤으며, 여러 쌍의 참가자 간 자연스러운 대화와 대본 기반 대화 170시간, 그리고 다채널 전화 대화 2,000시간을 이용해 미세 조정됐다.[3] 연구 프로젝트로서는 인상적인 규모지만, 최첨단 텍스트 모델 학습에 사용되는 수조 개의 토큰과 비교하면 매우 작은 수준이다.


또 다른 과제는 지연 시간에 대한 민감성이다. 텍스트 챗봇은 사용성에 큰 영향을 주지 않으면서 몇 초 정도의 응답 지연을 허용할 수 있다. 그러나 음성 상호작용에서는 대략 500밀리초를 넘는 지연이 종종 대화를 방해하는 것으로 인식된다.[4]  이러한 제약은 실시간으로 동작할 수 있는 모델의 크기와 계산 복잡성을 제한한다.


오디오에 트랜스포머가 가장 적합한 아키텍처인지에 대해서도 논의가 계속되고 있다. 트랜스포머는 셀프 어텐션이 작동하는 방식 때문에 시퀀스 길이에 대해 계산량이 제곱으로 증가한다. 즉, 모든 토큰이 다른 모든 토큰에 주의를 기울여야 한다. 오디오 시퀀스는 길다. 공격적인 압축을 적용하더라도 30초 분량의 오디오 클립은 약 3,000개의 토큰이 될 수 있다.

Mamba와 같은 상태 공간 모델(SSM)은 시퀀스 길이에 따라 선형적으로 확장되고 고정 크기의 은닉 상태를 유지함으로써 대안을 제공하며, 긴 시퀀스를 처리할 때 효율성을 향상시킨다.


AI21의 Jamba처럼 트랜스포머 레이어와 SSM 레이어를 결합한 하이브리드 아키텍처는 실용적인 발전 방향을 제시할 수 있다. 이러한 접근 방식은 어텐션을 통해 전역적인 맥락을 처리하는 데 트랜스포머를 활용하는 한편, 긴 시간 범위에 걸친 보다 효율적인 순차 처리를 위해 SSM을 사용한다.


이러한 차이는 중요하다. 음성은 인간 의사소통의 주요 방식인 반면, 텍스트는 대체로 기계를 위한 구조화된 인터페이스이기 때문이다. AI 시스템이 음성의 뉘앙스를 보존하면서 진정으로 음성을 네이티브 방식으로 이해하고 생성할 수 있게 된다면, 이는 가능한 상호작용의 형태 자체를 변화시킨다.


예를 들어, 음성 비서는 좌절감과 같은 음성 신호를 바탕으로 응답을 조정할 수 있고, 고객 서비스 시스템은 망설임을 감지해 보다 적절하게 대응할 수 있으며, 번역 시스템은 의미뿐만 아니라 어조와 감정적 맥락까지 보존할 수 있다. 이러한 기능은 텍스트 기반 인터페이스에 대한 의존도를 줄임으로써 접근성을 향상시킨다.


파이프라인 방식(ASR → LLM → TTS)은 계속해서 개선될 것이며, 앞으로 수년 동안 많은 애플리케이션에서 실용적인 선택으로 남을 가능성이 높다. 이 방식은 디버깅이 가능하고, 개별 구성 요소를 독립적으로 최적화할 수 있으며, 중간 텍스트 표현을 통해 처리 과정을 점검할 수 있다는 장점이 있다.


중간 계층을 완전히 건너뛰는 모델들도 꾸준히 개선되고 있으며, “충분히 좋은” 수준의 대화 성능에 도달하는 시점은 예상보다 더 빨리 찾아올 수 있다. 이는 보다 자연스럽고 유연한 음성 상호작용을 가능하게 할 것이다.


결론


음성 AI의 지연 시간을 줄이는 것은 단순히 속도를 높이는 것뿐만 아니라, 텍스트 기반 파이프라인이 제거해 버리는 인간 의사소통의 풍부함을 복원하는 것과도 관련이 있다. 네이티브 오디오 모델이 성숙해감에 따라 핵심적인 이점은 더 빠른 응답에만 그치지 않고, 보다 자연스럽고 표현력 있는 상호작용을 가능하게 하는 데 있을 것이다.



참고 문헌

[1]https://labs.scaleway.com/en/moshi/

[2]https://arxiv.org/html/2410.00037v2#S3.SS2

[3]https://arxiv.org/html/2410.00037v2#S4.SS1

[4]https://inworld.ai/resources/how-to-evaluate-tts-models; https://tringtring.ai/blog/technical-deep-dive/understanding-latency-in-ai-voice-agents-why-sub-500ms-matters/




                                                              저자 소개

기술 콘퍼런스에서 정기적으로 연사로 활동하고 있는

FTI 컨설팅(FTI Consulting)의 시니어 디렉터 실비 바라크(Sylvie Barak)는

전자 산업 분야와 B2B 환경에서의 소셜 미디어,

디지털 콘텐츠 제작 및 배포 분야의 전문가다.

그녀는 각종 기기와 전자 기술, 공상과학에 큰 관심을 갖고 있다.












<저작권자(c)스마트앤컴퍼니. 무단전재-재배포금지>

100자평 쓰기