개요

Gemini는 Google과 Google DeepMind가 개발·제공하는 생성형 인공지능 모델 및 서비스 브랜드이다. 텍스트뿐 아니라 이미지, 오디오, 동영상, 코드 같은 여러 입력을 함께 다루는 멀티 모달 능력을 주요 특징으로 내세운다.1

Gemini라는 이름은 모델군, 소비자용 챗봇 서비스, 개발자용 Gemini API, Google Cloud의 기업용 AI 기능을 모두 가리킬 수 있다. 따라서 문맥에 따라 “Gemini 앱”, “Gemini API 모델”, “Vertex AI 또는 Google Cloud에서 쓰는 Gemini”를 구분해 읽어야 한다.

모델군과 서비스

Gemini는 하나의 고정된 모델이 아니라 여러 성능·비용·속도 목적에 맞춘 모델군으로 운영된다. Google AI for Developers 문서에는 안정 버전, 미리보기 버전, 실험 버전, 최신 별칭 모델 등이 함께 제시되며, 모델명과 제공 상태는 계속 바뀔 수 있다.2

일반 사용자는 Gemini 앱이나 Google 서비스 안의 기능으로 접하고, 개발자는 Gemini API 또는 Google Cloud의 AI 플랫폼을 통해 애플리케이션에 연결한다. 기업 환경에서는 보안, 데이터 위치, 관리 기능이 함께 중요한 조건이 된다.

멀티모달 특성

Gemini의 핵심 특징은 처음부터 멀티모달 모델로 설계되었다는 점이다. 텍스트 질문에 답하는 것뿐 아니라 이미지 설명, 문서 이해, 코드 생성, 음성·동영상 처리, 시각 정보 추론 같은 작업에 쓰인다.

접근성 맥락에서는 이 능력이 특히 중요하다. 이미지를 설명하고, 문서를 요약하고, 복잡한 화면 정보를 풀어 주며, 시각 정보와 텍스트 정보를 연결할 수 있기 때문이다. 다만 모델이 설명을 생성할 수 있다는 사실이 곧 정확한 접근성을 보장하지는 않는다. 실제 서비스에서는 오류 검증, 사용자 통제, 개인정보 보호, 보조기술 호환성이 함께 필요하다.

접근성 관점에서의 의미

Gemini 같은 멀티모달 AI는 시각장애인과 저시력 사용자에게 새로운 정보 접근 경로가 될 수 있다. 예를 들어 사진 속 사물 설명, 문서 요약, 화면 속 글자 추출, 복잡한 메뉴 이해, 이동 중 상황 설명 같은 작업에 활용될 수 있다.

그러나 접근성에서 AI는 “대체 수단”이지 권리의 축소 근거가 되어서는 안 된다. 웹사이트, 문서, 앱 자체가 접근 가능하게 만들어져야 하고, AI는 그 위에서 사용자의 선택지를 넓히는 보조 수단이어야 한다. AI 설명이 틀릴 수 있고, 중요한 세부 정보를 놓칠 수 있으며, 서비스 제공자의 정책 변화에 따라 기능이 바뀔 수 있다는 점도 함께 봐야 한다.

함께 볼 개념

참고 자료

Footnotes

  1. Google DeepMind, “Gemini.” Google DeepMind는 Gemini를 텍스트, 이미지, 비디오, 오디오 등을 다루는 고성능 모델군으로 소개하고, 고급 멀티모달 이해와 에이전트·코딩 능력을 주요 기능으로 설명한다. https://deepmind.google/technologies/gemini/

  2. Google AI for Developers, “Gemini API Models.” 해당 문서는 Gemini API에서 제공되는 모델군, 안정·미리보기·실험 버전, 모델명 패턴과 지원 상태를 정리한다. 마지막 확인 시점의 문서 갱신일은 2026년 6월 30일로 표시되어 있었다. https://ai.google.dev/gemini-api/docs/models