출근길 지하철에서 스마트폰에 대고 “어제 온 Slack 메시지 요약해 주고, 팀장님께 보낼 주간 보고 이메일 초안 써 줘”라고 말하면 AI가 알아서 처리해 주는 풍경이 현실이 됐습니다. OpenAI가 9월 23일(현지시간) ChatGPT 모바일 앱에 음성 기반 에이전트(agentic) 기능을 도입한다고 발표했습니다. 그동안 데스크톱 중심이던 ChatGPT의 업무 자동화 기능이 음성 인터페이스와 결합해 스마트폰으로 들어온 것입니다.
이번 업데이트는 AI 비서가 ‘질문에 답하는 존재’에서 ‘일을 대신 처리하는 존재’로 진화하는 흐름이 모바일 환경까지 본격적으로 확장됐다는 점에서 의미가 큽니다.
무엇이 달라졌나: 스마트폰 속 ‘Work 탭’
이번 업데이트의 핵심은 Work 탭의 모바일 지원입니다. ChatGPT Plus와 Pro 구독자는 스마트폰에서 Work 탭을 열고 음성으로 문서 작성, 이메일 초안 작성, Slack 메시지 요약 같은 워크플로를 실행할 수 있습니다.
기능 범위도 상당히 넓습니다. 유료 구독자는 웹사이트 제작, 프레젠테이션 생성, 클라우드 브라우저 활용은 물론 ChatGPT 내 금융(finance) 관련 영역에도 접근할 수 있습니다. 무료(Free) 및 Go 요금제 사용자도 플러그인과 연결된 앱(connected apps)을 활용한 작업은 가능합니다.
ChatGPT Work는 클라우드에 연결된 OpenAI의 에이전트 시스템으로, 데스크톱의 Codex와 비슷한 역할을 하되 더 많은 환경에서 작동하는 것이 특징입니다. 이번 발표로 ChatGPT 음성 모드는 웹과 모바일 모두에서 ChatGPT Work와 연동됩니다.
음성 경험 자체도 업그레이드
에이전트 기능과 함께 음성 대화 경험 전반도 개선됐습니다.
첫째, 텍스트와 음성의 경계가 허물어졌습니다. 음성 대화 중에도 더 풍부한 텍스트 출력이 제공되며, 사용자는 한 대화 안에서 텍스트와 음성을 자유롭게 오갈 수 있습니다.
둘째, 기기 간 이어가기(handoff)가 가능해졌습니다. 이동 중 스마트폰으로 시작한 대화를 사무실에 도착해 데스크톱에서 그대로 이어서 작업할 수 있습니다. 음성으로 지시를 던져 놓고, 결과물은 큰 화면에서 다듬는 워크플로가 자연스러워지는 셈입니다.
셋째, 최신 모델과 플러그인이 음성 모드에 결합됐습니다. 이제 ChatGPT 음성 모드는 OpenAI의 GPT-6 모델 3종으로 구동됩니다. 최상위 모델인 Astra는 몇 주 전 공개됐고, 중형 모델 Sol과 소형 모델 Luna는 발표 하루 전 GPT-6로 업그레이드됐습니다. 이메일, 캘린더, Slack 같은 플러그인도 음성 모드에서 작동하게 됐는데, 이는 그동안 음성 사용자들이 겪던 큰 단절이 해소됐다는 의미입니다.
배경: 7월 GPT-Live가 깔아 놓은 기반
이번 모바일 확장은 갑작스러운 발표가 아닙니다. OpenAI는 지난 7월 8일 차세대 음성 모델 GPT-Live를 선보였습니다. GPT-Live는 듣기와 말하기를 동시에 처리하는 풀 듀플렉스(full-duplex) 구조를 채택해, 사용자가 말하는 도중 끼어들거나 잠시 생각을 정리하는 등 실제 사람과 대화하듯 자연스러운 상호작용을 구현했습니다.
기술적으로 주목할 부분은 ‘위임(delegation)’ 구조입니다. GPT-Live는 웹 검색이나 심층 추론, 복잡한 작업이 필요한 질문을 만나면 이를 백그라운드에서 최신 프런티어 모델에 넘기고, 그동안에도 사용자와의 대화 흐름을 끊지 않다가 결과가 준비되면 대화에 다시 가져옵니다. 이전 음성 모드가 음성을 텍스트로 변환(STT)하고, 언어 모델로 답변을 생성한 뒤, 다시 음성으로 합성(TTS)하는 3단계 파이프라인이었던 것과 비교하면 구조적으로 크게 달라진 것입니다.
OpenAI는 이후 GPT-Live를 데스크톱 앱에 통합해, 음성으로 Work 탭의 업무를 처리하거나 Codex 탭에서 앱을 만들 수 있도록 했습니다. 이번 발표는 바로 그 경험을 모바일로 옮겨온 것입니다. OpenAI가 GPT-Live 공개 당시 밝힌 것처럼, 이 연구는 궁극적으로 음성을 점점 더 복잡하고 장시간 이어지는 에이전트형 작업에 활용하는 방향을 향하고 있습니다.
왜 ‘음성 + 에이전트’인가
음성은 AI 에이전트와 가장 궁합이 좋은 인터페이스 중 하나입니다. 스마트폰의 작은 화면에서 긴 프롬프트를 입력하는 것은 번거롭지만, 말로 의도를 전달하는 것은 훨씬 빠르고 직관적입니다. 특히 에이전트는 사용자가 작업 과정을 일일이 지켜볼 필요 없이 결과만 받아보는 방식이기 때문에, 화면을 들여다보기 어려운 이동 중이나 운전 중 상황과도 잘 맞습니다.
시장의 수요도 뒷받침됩니다. 복잡한 작업을 AI 비서에게 음성으로 지시하는 사용자가 늘고 있으며, 매주 1억 5,000만 명 이상이 ChatGPT의 음성 및 받아쓰기 기능을 이용하는 것으로 알려져 있습니다. 이 거대한 음성 사용자 기반을 에이전트 기능으로 연결하는 것은 OpenAI 입장에서 자연스러운 수순입니다.
요금제 전략도 눈여겨볼 만합니다. 사이트 제작, 프레젠테이션 생성, 클라우드 브라우저 같은 고급 생산성 기능은 Plus와 Pro 구독자에게만 제공됩니다. 무료 사용자에게는 플러그인 연동이라는 ‘맛보기’를 제공하면서, 본격적인 업무 자동화는 유료 전환의 동기로 삼는 구조입니다.
경쟁 구도: 통합이냐, 분리냐
AI 어시스턴트 시장의 경쟁은 이제 ‘어떤 모델이 더 똑똑한가’를 넘어 ‘어떤 인터페이스로 일을 맡길 수 있는가’로 옮겨가고 있습니다. 흥미로운 대비는 Anthropic과의 설계 철학 차이입니다. Anthropic은 최근 모바일과 데스크톱 간 이어가기를 개선하고 Claude의 채팅(Chat)과 업무 공간(Cowork) 인터페이스를 하나로 통합했습니다. 반면 OpenAI는 여전히 채팅과 업무 공간을 별도의 탭으로 분리해 운영하고 있습니다.
두 접근법은 각기 장단점이 있습니다. 통합형은 사용자가 대화 도중 자연스럽게 작업으로 넘어갈 수 있어 흐름이 매끄럽지만, 기능이 한 화면에 몰리며 복잡해질 수 있습니다. 분리형은 ‘대화’와 ‘작업’의 맥락을 명확히 구분해 주지만, 사용자가 어떤 탭에서 무엇을 해야 할지 판단해야 하는 부담이 생깁니다. 음성 인터페이스가 본격화될수록, 사용자가 탭을 의식하지 않고 말만으로 원하는 결과를 얻을 수 있는 쪽이 유리해질 가능성이 큽니다.
결론: 스마트폰이 ‘말로 일하는 업무 단말’이 된다
이번 업데이트는 ChatGPT가 대화형 챗봇에서 실제로 일을 처리하는 에이전트 플랫폼으로 변모하는 과정의 중요한 이정표입니다. GPT-Live로 자연스러운 대화의 기반을 닦고, GPT-6로 두뇌를 업그레이드하고, 플러그인과 Work 탭으로 실행력을 더한 결과가 이제 사용자의 손안에 들어온 것입니다.
물론 과제도 남아 있습니다. 음성으로 이메일을 작성하고 금융 영역에 접근하는 에이전트가 늘어날수록, 잘못된 명령 해석이나 의도치 않은 실행을 어떻게 방지할지, 그리고 음성 데이터와 업무 정보를 어떻게 보호할지가 신뢰의 관건이 될 것입니다. 그럼에도 방향은 분명합니다. 키보드 없이 말 한마디로 업무를 맡기는 시대, 그 경쟁의 무대가 이제 스마트폰으로 옮겨왔습니다.

