특집

음성 에이전트, 말 대신 화면을 바꾼다 — OpenAI가 꼽은 세 모드

원본 · Voice Agents Can Just Do Things — Charlie Guo, OpenAI
AI Engineer · Charlie Guo · OpenAI · 2026-09-15 업로드 · 16분

한국어·English

음성 에이전트는 말로 답해야 한다는 게 거의 모든 개발자가 당연시하는 전제다. OpenAI의 Charlie Guo는 이 전제 자체를 뒤집으며, 모델이 버튼 색을 바꾸거나 필드를 하이라이트하는 식으로도 얼마든지 응답할 수 있다고 말한다. 그가 가장 저평가됐다고 지적한 영역은 말한 것을 모델이 도구로 실행하는 speech to action이다.

  • 세 가지 모드 — 음성 상호작용은 speech to speech, speech to action, event to speech 세 모드로 나뉘며 이들은 모두 수십 년 전부터 존재했다고 말했다.
  • 오래된 원형 — 영화 상영시간을 알려주던 무비폰 핫라인은 speech to speech, 자신이 어릴 때부터 있던 차량 GPS 내비게이션은 event to speech의 사례라고 지적했다.
  • speech to speech 사례 — 언어학습 코칭, '고객지원 플러스'라 부른 컨시어지 경험, 실시간 번역을 speech to speech의 대표 사례로 꼽았다.
  • 가장 저평가된 영역 — speech to action을 '음성은 다음 capability overhang'이라 부르려 했을 만큼 가장 저평가된 영역으로 꼽았다.
  • 폼 작성 — 정부 서류를 한 시간 타이핑하는 대신 5분 말하면 90%가 채워지는 경험을 예로 들었다.
  • 창작 도구 — Codex에는 원하는 것을 정확히 말할 수 있지만 Photoshop이나 Ableton은 다룰 줄 몰라 취향이 능력을 앞지르는 상태에 놓인다고 말했다.
  • 개발자 온램프 — 이미 앱이 노출한 API 엔드포인트나 React 훅 같은 '동사'들을 그대로 모델이 호출할 도구로 변환할 수 있다고 설명했다.
  • 말하지 않는 응답 — 팝업, 버튼 색 변화, 텍스트 하이라이트, Codex 앱의 고스트 커서 애니메이션처럼 수십 년간 개발해온 비언어적 응답 수단을 그대로 쓸 수 있다고 말했다.
  • 접근성 — 손과 손가락의 기동성을 잃어 프로그래밍 경력이 끝났다고 생각했던 개발자들이 코딩 에이전트와 음성 에이전트 덕분에 이전보다 훨씬 많은 코드를 생성하고 있다고 말했다.
  • 체인 방식의 한계 — 기존 체인 방식은 음성을 텍스트로 전사하는 과정에서 어조·간투사·배경음 같은 맥락을 잃고, 대면 소통 정보의 55%는 몸짓언어, 38%는 어조, 단 7%만 말 자체에 있다는 통설을 근거로 들었다.
  • GPT realtime 2 — 몇 달 전 공개한 GPT realtime 2는 오디오에도 추론을 도입해 말하기 전에 생각하고, 병렬 tool calling과 preamble로 도구 실행 중임을 사용자에게 미리 알릴 수 있다고 소개했다.
  • 질문의 순서 — 어떤 음성 에이전트를 만들지가 아니라 이 상호작용에서 음성의 역할이 무엇인지부터 물어야 한다고 마무리했다.

그가 한 말

음성 모델이 응답하는 방식이 말하기만 있는 것은 아니다speech is not the only way that a voice model has to respond0분 48초
Charlie Guo 발표 화면 · Voice Agents Can Just Do Things — Charlie Guo, OpenAI 0분 48초
Charlie Guo 발표 화면 · 0분 48초 · AI Engineer
이 세 가지 모드는 서로 배타적이지 않다they're not meant to be mutually exclusive2분 11초
Charlie Guo 발표 화면 · Voice Agents Can Just Do Things — Charlie Guo, OpenAI 2분 11초
Charlie Guo 발표 화면 · 2분 11초 · AI Engineer
이런 종류의 시스템을 음성 주변에 구축해 온 긴 역사가 있다there's a long history of building these types of systems in and around voice1분 26초
Charlie Guo 발표 화면 · Voice Agents Can Just Do Things — Charlie Guo, OpenAI 1분 26초
Charlie Guo 발표 화면 · 1분 26초 · AI Engineer
AGI는 타이핑이 아니라 말로 이루어질 것이다AGI will be spoken, not typed15분 8초
Charlie Guo 발표 화면 · Voice Agents Can Just Do Things — Charlie Guo, OpenAI 15분 8초
Charlie Guo 발표 화면 · 15분 8초 · AI Engineer

이해관계 · 발화자는 OpenAI 소속으로 자사의 GPT realtime 2 모델을 소개했다.

덧붙임 — 여기에 하나 덧붙이면, '음성 에이전트=말로 답하는 것'이라는 가정을 깨는 순간 설계 공간이 UI 전체로 넓어진다. 다만 speech to action이 확장될수록 가드레일과 안전 검증 부담도 같이 커진다는 점은 발화자도 짧게만 언급하고 넘어갔다.

오늘 밤 해볼 수 있는 한 가지
자신의 앱에서 이미 존재하는 API 엔드포인트나 훅 하나를 골라, 그것을 음성 모델이 호출할 수 있는 tool 스펙으로 정의해보는 것부터 시작해본다.