유튜브는 왜 아직도 영상만 보여줄까
AI 시대의 인터랙티브 비디오
우리는 하루에도 수많은 영상을 본다. 유튜브에서 강의를 듣고, 제품 리뷰를 보고, 여행지를 찾고, 요리를 배우고, 새로운 기술을 공부한다. 그런데 어느 날 문득 이상한 생각이 들었다.
왜 영상은 아직도 ‘보기만’ 해야 할까?
가령 패션 영상을 보고 있다고 생각해 보자. 화면 속 사람이 마음에 드는 재킷을 입고 있다. 자연스러운 행동은 그 재킷을 손가락으로 누르는 것이다. 그러면 브랜드와 모델명, 가격, 판매처가 나타나면 된다.
강의 영상도 마찬가지다. 교수가 화면에 논문을 띄워 설명하고 있다면 그 논문을 누르는 순간 원문이나 PDF가 열리면 된다. 그래프를 클릭하면 원본 데이터가 나오고, 소스코드를 클릭하면 GitHub나 실행 환경으로 이동할 수도 있다. 여행 영상에서 식당을 누르면 지도와 예약 정보가 나타나고, 요리 영상에서 재료를 누르면 레시피와 구매 정보가 나타날 수도 있다.
기술적으로 생각하면 그다지 이상한 상상도 아니다.
그런데 세계 최대의 동영상 플랫폼인 YouTube조차 여전히 대부분의 영상을 ‘재생되는 화면’으로 다룬다.
물론 유튜브에 인터랙션이 전혀 없는 것은 아니다.
댓글, 카드, 최종 화면, 링크가 있고, YouTube Shopping을 이용하면 영상이나 Shorts, 라이브 콘텐츠에 상품을 태그할 수도 있다. 유튜브는 상품이 등장하는 시점을 지정하는 기능을 제공하며, 최근에는 AI를 활용해 영상에 등장하는 제품을 자동으로 식별하고 적절한 시점에 상품을 표시하는 기능도 발전시키고 있다.
그러나 이것은 내가 생각하는 인터랙티브 비디오와는 조금 다르다.
현재의 접근이 대체로 ‘영상에 몇 가지 기능을 추가하는 것’이라면, 내가 상상하는 것은 ‘영상 자체가 하나의 인터페이스가 되는 것’에 가깝다.
영상은 왜 아직도 평면적인가
생각해 보면 조금 묘하다.
웹페이지에서 우리는 너무나 자연스럽게 글자를 누르고, 이미지를 누르고, 메뉴를 열고, 파일을 내려받는다. 스마트폰에서도 화면에 보이는 거의 모든 요소가 인터랙션의 대상이다.
그런데 영상이 재생되는 순간 화면은 갑자기 하나의 거대한 직사각형이 된다.
그 안에는 자동차도 있고, 옷도 있고, 사람도 있고, 건물도 있고, 책도 있지만 컴퓨터의 관점에서는 대부분 하나의 영상 프레임일 뿐이다.
그래서 우리가 할 수 있는 가장 기본적인 조작은 여전히 재생, 정지, 앞으로 가기, 뒤로 가기 정도다.
어쩌면 이것은 영상이라는 매체의 근본적인 특성 때문이 아니라 영상이 만들어지고 유통되어 온 기술적 역사 때문일지도 모른다.
영상은 오랫동안 일련의 프레임을 시간순으로 재생하는 데이터였다. 영상 속에 무엇이 존재하는지를 컴퓨터가 이해할 필요는 없었다.
사람은 화면을 보면서
“저건 자동차다.” “저 사람이 입은 옷이 마음에 든다.” “저기 보이는 곳은 어디일까?”
라고 생각하지만, 전통적인 동영상 플레이어는 그런 의미를 알지 못했다.
따라서 영상 속 사물에 기능을 연결하려면 사람이 직접 작업해야 했다.
영상의 1분 32초부터 1분 47초까지 화면 오른쪽에 나타나는 물체가 특정 상품이라는 것을 지정하고, 그 물체가 움직일 때마다 위치를 추적하고, 상품 데이터베이스와 연결해야 한다.
한두 개라면 가능하지만 수십억 개의 영상에 이런 작업을 적용하는 것은 현실적으로 어려웠다.
그래서 영상 플랫폼은 가장 단순한 방법을 선택했다.
영상은 재생하고, 정보는 영상 바깥에 둔다.
제목, 설명, 댓글, 링크, 상품 목록이 영상 주변에 배치된 이유다.
그런데 AI가 이 전제를 흔들기 시작했다
멀티모달 AI의 발전은 이 오래된 전제를 바꿀 가능성이 있다.
이제 AI는 영상을 단순히 픽셀의 연속으로만 처리하지 않는다.
화면 속에 사람이 있고, 사람이 어떤 옷을 입고 있으며, 테이블 위에 노트북이 있고, 뒤편에는 특정 건물이 있다는 것을 인식할 수 있다. 음성을 텍스트로 변환하고, 장면의 맥락을 이해하고, 시간에 따라 객체를 추적하는 것도 가능해지고 있다.
그렇다면 영상 제작자가 모든 인터랙션을 직접 만드는 대신 AI가 영상의 의미 구조를 자동으로 만들어 줄 수 있지 않을까?
예를 들어 30분짜리 여행 영상을 업로드한다.
AI는 영상을 분석해 자동으로 다음과 같은 정보를 만들어낸다.
03:21 ~ 05:14 → 경복궁 07:42 ~ 09:10 → 특정 카페 12:15 ~ 12:48 → 카메라 모델 A
그리고 각각에 지도, 장소 정보, 상품 정보 등을 연결한다.
조금 더 발전하면 시간뿐 아니라 화면의 위치까지 연결할 수 있다.
영상 속 사람이 들고 있는 카메라를 누르면 카메라 정보가 나타나고, 뒤에 보이는 건물을 누르면 장소 정보가 나타나는 것이다.
결국 영상은 두 개의 층으로 나뉜다.
Video Layer 그 위에 Interaction Layer 가 올라간다.
그리고 AI가 두 층을 연결한다.
핵심은 상품이 아니다
이 아이디어를 단순히 ‘동영상 쇼핑’으로 생각하면 가능성이 크게 축소된다.
물론 가장 먼저 돈이 되는 분야는 쇼핑일 가능성이 높다.
패션 영상에서 옷을 누르면 구매할 수 있고, 자동차 리뷰에서 차량을 누르면 가격과 제원을 확인할 수 있으며, 요리 영상에서 재료를 누르면 주문할 수 있다.
하지만 같은 구조를 교육에 적용하면 전혀 다른 서비스가 된다.
프로그래밍 강의를 보고 있다고 생각해 보자.
교수가 화면에 코드를 보여준다. 코드를 누르면 소스 파일이 열린다. 그래프를 누르면 원본 데이터가 나온다. 논문 제목을 누르면 논문으로 이동한다.
교수가 “여기까지 이해했는지 확인해 봅시다”라고 말하면 화면 위에 간단한 퀴즈가 나타난다.
학생은 영상을 나가지 않고 문제를 풀 수 있다.
영상에 사용된 PPT, PDF, CSV, 소스코드 같은 자료 역시 특정 시점과 연결할 수 있다.
이렇게 되면 동영상 강의는 더 이상 단순한 녹화물이 아니다.
영상 자체가 학습 환경이 된다.
Video → Object → Action
이 구조는 의외로 단순하게 정의할 수도 있다.
Video → Object → Action
영상 속 어떤 객체(Object)에 어떤 행동(Action)을 연결하는 것이다.
옷 → 상품 정보 책 → 도서 정보 논문 → 원문 그래프 → 데이터 장소 → 지도 코드 → 실행 환경 강의자료 → 파일 문제 → 퀴즈 제품 → 구매 사람 → 프로필
지금의 웹페이지를 생각해 보면 이것은 그다지 낯선 개념이 아니다.
웹페이지에서는 이미 수십 년 동안 이런 방식으로 정보를 연결해 왔다.
차이가 있다면 웹페이지에서는 제작자가 HTML을 통해 객체와 링크를 미리 정의한다는 것이다.
영상에서는 그것이 어려웠다.
그러나 AI가 영상 속 객체와 의미를 자동으로 찾아낼 수 있다면 이야기가 달라진다.
AI가 영상의 HTML을 만들어 주는 셈이다.
나는 이 지점이 중요하다고 생각한다.
왜 유튜브는 아직 여기까지 가지 않았을까
그렇다고 이것을 단순히 “유튜브가 생각하지 못했다”고 설명하는 것은 무리가 있다.
오히려 플랫폼 입장에서는 지금의 구조가 매우 효율적이었다.
사용자가 영상을 클릭하고, 보고, 다음 영상을 보고, 광고를 보는 구조는 단순하다.
반대로 영상 안에 수많은 인터랙션을 허용하면 문제가 복잡해진다.
누구나 파일을 첨부할 수 있다면 악성 파일을 어떻게 막을 것인가. 외부 사이트로 이동시키는 버튼은 어디까지 허용할 것인가. 영상 속 상품을 AI가 잘못 인식하면 누가 책임질 것인가. 다른 사람의 영상에 등장한 상품이나 사람을 마음대로 연결할 수 있는가. 광고와 일반 정보는 어떻게 구별할 것인가.
저작권, 보안, 광고, 개인정보, 플랫폼 정책이 한꺼번에 얽힌다.
따라서 기술적으로 가능하다는 것과 세계 최대 규모의 플랫폼에서 운영할 수 있다는 것은 전혀 다른 문제다.
유튜브가 Shopping처럼 통제하기 쉬운 영역에서부터 제한적으로 인터랙션을 확대하는 것도 이런 관점에서 이해할 수 있다.
그래도 영상은 결국 변하지 않을까
웹의 역사를 돌아보면 초창기의 웹페이지 역시 대부분 읽기 위한 문서였다.
그러다 링크가 연결되고, 입력창과 버튼이 생기고, 사용자가 글을 쓰고, 결제하고, 프로그램을 실행하면서 웹페이지는 하나의 애플리케이션으로 변했다.
영상에서도 비슷한 변화가 일어날 수 있다.
지금 우리는 영상을 ‘본다’고 표현한다.
하지만 앞으로는 영상을 보다가 필요한 것을 누르고, 질문하고, 파일을 열고, 데이터를 확인하고, 구매하고, 실행하고, 다시 영상으로 돌아오는 것이 자연스러워질지도 모른다.
특히 AI가 영상의 내용을 이해하기 시작하면서 그동안 영상 속에 갇혀 있던 정보가 처음으로 구조화될 가능성이 생겼다.
그렇다면 미래의 동영상 플랫폼에서 중요한 것은 영상 파일 자체가 아닐 수도 있다.
영상 위에 어떤 객체가 존재하고, 그 객체가 무엇을 의미하며, 그 객체를 눌렀을 때 무엇이 일어나는가.
즉 영상 위에 올라가는 의미와 행동의 레이어가 새로운 플랫폼이 될 수도 있다.
우리는 이미 웹페이지에서 모든 것을 클릭한다. 사진에서도 객체를 인식하고 검색한다. AI에게 이미지를 보여주며 질문하는 것도 자연스러워졌다.
그런데 이상하게도 영상이 시작되는 순간 우리는 다시 수십 년 전의 사용자 인터페이스로 돌아간다.
재생하고, 멈추고, 앞뒤로 이동한다.
어쩌면 다음 세대의 동영상 서비스가 바꾸어야 할 것은 화질이나 추천 알고리즘이 아닐지도 모른다.