카메라 뺀 43g ‘레이밴 메타 오디오’ 써보니… 음성 AI 시장 열린다

reporter-profile
박원익 2026.09.24 18:31 PDT
카메라 뺀 43g ‘레이밴 메타 오디오’ 써보니… 음성 AI 시장 열린다
메타의 AI 안경 신제품 ‘레이밴 메타 오디오(Ray-Ban Meta Audio)’. 클럽마스터 스타일 (출처 : Meta)

[메타 첫 오디오 AI 안경 체험기] 가벼운 무게, 오픈 이어 스피커 성능 인상적
카메라 뺀 첫 오디오 AI 안경… 구조 재설계해 349달러에 내놔
‘퍼버트 글래스’ 논란 속 등장… 핵심은 AI 에이전트 ‘뮤즈’
음성 AI 시장 확대… STT·STS·TTS 잇따라 도약
더밀크의 시각: 왜 오디오인가… 한국의 기회는?

9월 24일(현지시각), 맨해튼 메타 AI 랩.

메타의 AI 안경 신제품 ‘레이밴 메타 오디오(Ray-Ban Meta Audio) 클럽마스터’를 쓰는 순간 가장 먼저 든 느낌은 ‘가볍다’였다. 이 제품의 공식 스펙상 무게는 43g. 사이즈에 따라 38~42g 정도인 레이밴 클럽마스터 일반 안경과 차이가 거의 없는 무게였다. 

전날 마크 저커버그 메타 CEO가 ‘메타 커넥트 2026’에서 공개한 레이밴 메타 오디오는 여러 신제품 중에서도 특별히 주목을 받았다. 기존 제품과 달리 카메라가 없는, 일반 안경·선글라스와 같은 모양과 크기로 제작된 첫 AI 안경이기 때문이다.

뉴욕 맨해튼에 위치한 메타 랩(Meta Lab) (출처 : 더밀크 박원익)

실제 착용해 보니 안경다리를 걸치는 귀 쪽에 전달되는 무게감이나 피로감이 전혀 없었다. 전면부에 카메라 렌즈가 없어 ‘카메라 달린 안경’을 마주할 때 느끼는 거부감도 줄여줬다. 

육안으로 확인되는 차이는 안경다리 양쪽에 탑재된 스피커 뿐이었다. 흘러나오는 음악을 다음 곡으로 넘기려면 안경다리 한쪽을 가볍게 두 번 탭 하면 되고, 볼륨을 조절하려면 손가락을 대고 스와이프하면 됐다. 별도의 설명이 필요 없을 만큼 조작방식도 직관적이었다.

‘오픈 이어 스피커(open-ear speakers)’의 성능도 인상적이었다. 안경을 착용한 상태에서 테스트해 본 결과 주변 소음이 있는 상태에서도 AI의 음성 답변과 음악이 또렷이 들렸다. 돌비 애트모스(Dolby Atmos) 기술이 적용돼 물리적으로 귀를 막지 않고도 주변 환경과 분리되지 않은 채 자연스럽게 AI와 대화를 나누거나 음악을 들을 수 있었다. 

무엇보다 메타의 AI 에이전트 ‘뮤즈(Muse)’를 사용할 수 있다는 점이 핵심 셀링 포인트다. 뮤즈가 음성으로 예정된 일정을 전달해 주는 리마인더, 손을 쓰지 않고 전화를 걸거나 메시지를 보내는 기능, 메타 앱과 연동한 실시간 번역(한국어 포함) 등 다양한 활용이 가능하다는 게 메타 측 설명이다. 

“이번 주말 친구들과 저녁 약속 잡을 수 있는 시간 알아봐 줘”라고 요청하면 지메일, 구글 캘린더 등 외부 앱과 연동해 비어 있는 일정을 음성으로 안내하는 식이다.

레이밴 메타 오디오 클럽마스터 실물 (출처 : 더밀크 박원익)

카메라 뺀 첫 오디오 AI 안경… 구조 재설계해 349달러에 내놔

메타의 첫 오디오 전용 AI 안경 레이밴 메타 오디오의 핵심은 편의성과 일상성에 있다. 

유명 아이웨어 브랜드 에실로룩소티카와 협업해 만든 제품으로서 부담스럽지 않은, 착용하고 싶은 디자인이 완성됐다. 레이밴 클래식인 클럽마스터와 버뱅크 두 가지 스타일에 23가지 색상·렌즈를 조합할 수 있으며 도수 렌즈도 지원한다. 일상적인 상황에서 편하게 착용할 수 있을 뿐 아니라 기존 스마트 안경처럼 다른 사람의 시선을 받을 일도 없는 것이다. 

배터리 용량 역시 이런 사용 패턴을 고려해 설계됐다. 한 번 충전으로 최대 12시간 사용이 가능하다. 출근할 때 착용해 퇴근할 때까지 하루 종일 사용할 수 있는 용량이다. 함께 제공되는 충전 케이스를 적용하면 최대 48시간을 더 쓸 수 있다. 가격은 349달러로 책정했다. 

알렉스 하이멜 메타 웨어러블 담당 부사장은 “카메라를 없애면서 안경 구조를 다시 설계할 수 있었다”며 “앞쪽 프레임의 전자부품을 덜어내 디자인 자유도가 커졌다”고 설명했다.

레이밴 메타 오디오 조작 방식 (출처 : 더밀크 박원익)

‘퍼버트 글래스’ 논란 속 등장… 핵심은 AI 에이전트 ‘뮤즈’

카메라를 뺀 제품은 AI 안경의 악의적 사용 논란에 대응하는 성격이라는 관측도 제기된다. 

AI 안경에 부착된 카메라로 다른 이를 무단 촬영하는 문제들이 발생했기 때문이다. ‘퍼버트 글래스(pervert glasses, 변태 안경)’라는 별칭이 붙은 이유다. 메타는 이런 문제를 줄이고자 LED 표시등을 조작하면 카메라가 꺼지도록 하는 업데이트를 내놨지만, 대중의 불쾌감은 쉽사리 사라지지 않았다. 

다만 메타는 공식적으로 사용자들의 반응과 레이밴 메타 오디오 출시 사이에 연관성은 없다고 주장하고 있다. 하이멜 부사장은 더버지와의 인터뷰에서 “출시 시점은 우연”이라며 “이미 2년 전 오디오가 AI의 가장 큰 잠재력을 지닌 최상위 사용 사례라는 점을 확인했다”고 설명했다. 하이멜 부사장에 따르면 레이밴 메타 오디오는 사용자의 음성도 녹음하지 않으며 호출어에 대기하다가 호출어가 들리면 청취를 시작한다.

더 결정적 이유는 AI 에이전트 성능 향상에 있다는 게 중론이다. 카메라 없이 음성만으로도 다양한 작업이 가능해지면서 제품 경쟁력이 올라간 것이다. 특히 메타가 지난 9월 초 선보인 개인용 AI 에이전트 뮤즈의 역할이 컸다. 

AI 안경에 뮤즈가 적용되면 운동 안내나 식사 기록, 예약, 제품 구매 등 다양한 작업을 뮤즈가 지원할 수 있게 된다. 사용자가 호출할 때만 활성화되며 나머지 작업은 백그라운드에서 처리한 뒤 결과를 알려주는 식이다. 메타 측은 향후 수개월 내 뮤즈가 AI 안경 제품에 적용될 것이라고 밝혔다. 

안경을 쓰는 전 세계 약 20억 명 중 다수가 일반 안경에서 AI 안경으로 넘어갈 것이라는 게 저커버그 CEO의 예측이다. 

여러 기능 중에서도 한국 사용자들에게는 실시간 번역이 관심사다. 메타는 AI 안경 실시간 번역 지원 언어에 한국어를 포함해 둔 상태다.

👉메타 '뮤즈', 앱 밖으로 나왔다… 돌풍에 그칠까 태풍으로 커질까

메타의 AI 에이전트 뮤즈 (출처 : 더밀크 )

음성 AI 시장 확대… STT·STS·TTS 잇따라 도약

메타의 오디오 전용 AI 안경 출시 시점은 AI 업계의 음성 AI 모델 발전 속도와 궤를 같이하고 있다. AI 스타트업 일레븐랩스(ElevenLabs)가 지난 5월 ‘더빙 v2(Dubbing v2)’ 모델을 출시해 업계를 놀라게 한 게 대표적이다.  

더빙 v2를 사용하면 AI가 내 목소리와 발화 시점의 감정, 어조, 말의 속도, 음색의 특징 등을 유지한 채 언어만 다른 것으로 바꿀 수 있다. 원본 화자가 말한 것처럼 AI 더빙으로 누구나 쉽게 언어 장벽을 허물 수 있는 시대가 이미 열렸다.

👉목소리는 어떻게 AI 에이전트가 되나?… 일레븐랩스가 여는 음성AI의 미래

구글의 질주도 무섭다. 8월 26일 이후 한 달도 안 되는 사이 강력한 성능의 STT(음성→텍스트), STS(음성→음성 대화), TTS(텍스트→음성) 모델을 잇달아 공개했다.

8월 26일 공개한 ‘제미나이 3.5 트랜스크라이브’는 STT 모델로 평균 단어 오류율(WER)이 2.6%(비스트리밍, 스트리밍은 4.0%)에 불과하다. 85개 이상 언어를 자동 감지하고 거의 완벽하게 받아 쓸 수 있다. 

9월 15일 공개한 ‘제미나이 3.8 라이브’와 ‘3.8 라이브 익스텐디드 씽킹’은 STS 모델이다. 97개 언어를 대화 도중 자동으로 전환하고, 대화를 이어가는 동안 도구·API 호출을 백그라운드에서 실행할 수 있다. 익스텐디드 씽킹은 추론과 발화를 동시에 수행한다. 이 모델은 아티피셜 애널리시스 음성-음성 품질 지수 1위(82.6점)에 올랐다. 

가장 최근인 23일에는 ‘제미나이 3.8 플래시 TTS’와 ‘플래시-라이트 TTS’가 출시됐다. 플래시 TTS는 자연어 프롬프트만으로 역할과 억양, 음성 특성을 지정해 새 음성을 설계한다. 대사 한 줄 한 줄의 연기 지시와 속도, 사투리 전환, 맞장구(백채널링)까지 제어할 수 있다. 

기존 30개 원본 음성은 2000개 이상의 음성 라이브러리로 늘었고, 100개 이상 언어를 지원한다. 30초 분량의 음성 샘플로 목소리를 복제할 수도 있다. 음성만 사용하더라도 AI 에이전트에 정확한 요청을 할 수 있고, 에이전트 역시 사람처럼 자연스러운 목소리로 응답하도록 기술이 발전한 것이다. 

관련 시장도 빠르게 커지는 추세다. 카운터포인트리서치에 따르면 올 상반기 전 세계 AI 안경 출하량은 전년 대비 263% 늘었다. 이 가운데 디스플레이가 없는 제품이 96%이며 메타가 94%를 점유했다. 삼성전자와 구글도 안드로이드 XR 기반 AI 안경을 공개, 연내 출시를 예고한 상태다. 애플도 시장 진입을 준비하고 있다는 관측이 제기된다.

더밀크의 시각: 왜 오디오인가… 한국의 기회는?

오디오 인터페이스는 손과 눈을 쓰지 않고도 소통할 수 있어 걷기·이동·요리 같은 다른 활동과 병행하기 쉽다는 장점이 있다. 또 소리는 인간이 서로 소통해 온 가장 기본적인 방식이라 학습 비용이 적다. 

사람과 AI 에이전트 간의 상호작용이 늘어나면서 특히 음성이 더 많은 역할을 하게 될 것이란 전망이 나오는 이유다. 애플 역시 지난 6월 8일 ‘WWDC 2026’에서 완전히 새로운 버전의 음성 비서 ‘시리 AI’를 발표하며 음성 기반 대화형 AI를 사용자 경험의 첫 관문으로 설정한 바 있다.

👉시리가 다시 태어났다… 제미나이 품은 애플 ‘시리 AI’ 7대 핵심 기능

한국은 이런 변화 속에서 어떤 기회를 찾을 수 있을까?

오디오 인터페이스에서는 음성 인식 오류와 어색한 합성음이 곧바로 사용성 결함이 된다. 이는 존댓말, 방언, 한영 혼용, 소음 환경에 강한 한국어 STT·TTS·STS가 글로벌 에이전트의 한국어 엔진 후보가 될 수 있다는 의미다.

네이버클라우드가 제공하는 클로바 음성인식(STT) API, 타입캐스트가 내세우는 감정 자동 적용 TTS 등을 주목해야 하는 이유다.

가벼운 AI 안경의 확산은 경량·저전력 부품과 디자인이라는 큰 흐름으로 이어진다. 온디바이스 AI를 구현하기 위한 소형 배터리, 저전력 칩, 스피커·마이크 부품의 품질이 중요해지고, 관련 수요가 늘어날 수 있다. 배경 소음을 90% 이상 줄이기 위해 레이밴 메타 3세대 제품에 6개의 마이크 어레이가 적용된 게 대표적이다. 삼성전자, 구글과 협업하는 젠틀몬스터 등 한국 아이웨어 브랜드의 디자인 역량도 무기가 될 것으로 보인다.

한국 통신사, 플랫폼과 국내 로컬 에이전트가 협업을 통해 기회를 모색하는 방법도 있다. 메신저·결제·지도 등 국내 서비스와 로컬 에이전트를 연계한다면 AI 웨어러블 시장 확대에 따른 경쟁력을 갖출 수 있을 것이다.

신뢰·안전 설계도 중요하다. AI 안경 등 새로운 폼팩터가 확대되려면 프라이버시 문제가 먼저 해결돼야 한다. 표준 설정, 보안 강화를 위한 업계 차원의 대화와 노력이 필요한 때다.

구글 선호 (출처 : The Miilk)

AI 기술, AI 디바이스의 미래... 더밀크에서 찾으세요

더밀크 회원에 가입하시면 최첨단 AI의 흐름과 방향성, AI 디바이스의 미래를 확인하실 수 있습니다.

구글 검색과 뉴스에서 더밀크(The Miilk)를 ‘선호하는 출처’로 추가하시면 AI·테크·비즈니스의 중요한 변화를 찾을 때 더밀크의 기사와 인사이트를 더 쉽게 만날 수 있습니다.

아래 링크를 누르시고, 목록에서 더밀크 옆 체크박스를 눌러주세요. (구글 로그인 상태여야 합니다)

[구글에서 더밀크를 선호 소스로 지정하기]

회원가입 후 뷰스레터를
주 3회 무료로 받아보세요!

단순 뉴스 서비스가 아닌 세상과 산업의 종합적인 관점(Viewpoints)을 전달드립니다. 뷰스레터는 주 3회(월, 수, 금) 보내드립니다.