개요
멀티 모달은 텍스트, 이미지, 음성, 영상, 센서 데이터처럼 서로 다른 정보 형식을 함께 다루는 방식을 말한다. 여기서 모달리티는 정보를 받아들이거나 표현하는 양식, 곧 감각·매체·데이터 유형을 뜻한다.
인공지능에서 멀티모달 AI는 여러 종류의 입력을 처리하고, 그 관계를 통합해 이해하거나 새로운 출력을 만드는 모델을 가리킨다. 예를 들어 사진을 보고 설명을 쓰거나, 영상 내용을 요약하거나, 음성 명령과 화면 이미지를 함께 해석하는 일이 여기에 들어간다.1
단일 모달과의 차이
단일 모달 시스템은 주로 하나의 데이터 유형에 맞춰 설계된다. 텍스트만 입력받아 텍스트로 답하는 챗봇, 음성만 인식하는 음성 인식기, 이미지만 분류하는 이미지 분류기가 그 예이다.
멀티모달 시스템은 서로 다른 데이터 유형을 함께 처리한다. 이미지와 질문을 함께 받아 답하거나, 문서 이미지에서 표와 글자를 읽고 요약하거나, 영상·음성·자막을 함께 보며 장면을 설명할 수 있다. 여러 신호를 함께 쓰기 때문에 맥락을 더 넓게 잡을 수 있지만, 각 모달리티의 오류가 합쳐질 위험도 있다.
접근성에서의 가능성
멀티모달 AI는 접근성에서 중요한 가능성을 가진다.
- 이미지와 영상의 시각 정보를 텍스트나 음성으로 설명할 수 있다.
- 복잡한 문서, 표, 화면 구성을 요약해 이해를 도울 수 있다.
- 음성, 텍스트, 점자, 화면 입력을 함께 연결해 사용자 선택지를 넓힐 수 있다.
- 인지적 부담이 큰 정보를 더 쉬운 언어와 단계로 바꾸는 데 도움을 줄 수 있다.
- 보조공학 기기와 결합해 현장 상황 설명, 문서 읽기, 학습 지원에 쓰일 수 있다.
예를 들어 Gemini 같은 모델은 이미지, 텍스트, 코드, 동영상 입력을 함께 다루는 멀티모달 모델로 소개된다. 한소네 7처럼 점자 정보 단말기에 AI가 들어가는 흐름도, 멀티모달 AI가 보조공학과 만나는 사례로 볼 수 있다.
주의할 점
멀티모달 AI가 시각 정보를 설명할 수 있다고 해서, 접근성 작업이 자동으로 끝나는 것은 아니다. 모델은 틀린 설명을 만들 수 있고, 중요한 세부 정보를 누락할 수 있으며, 문화적 맥락이나 위험 신호를 잘못 판단할 수 있다.
따라서 멀티모달 AI는 원본 콘텐츠의 접근성을 대체하기보다 보완해야 한다. 이미지에는 여전히 대체 텍스트가 필요하고, 영상에는 화면해설과 자막이 필요하며, 사용자는 AI 설명을 켜거나 끄고 검증할 수 있어야 한다.
함께 볼 개념
참고 자료
Footnotes
-
Google Cloud, 「멀티모달 AI」. Google Cloud는 멀티모달 모델을 텍스트, 이미지, 오디오 등 다양한 입력을 프롬프트로 처리하고 여러 출력 유형으로 변환할 수 있는 모델로 설명한다. https://cloud.google.com/use-cases/multimodal-ai?hl=ko ↩
