Google, 멀티모달 임베딩 모델 EmbeddingGemma 2 공개
원제: EmbeddingGemma 2: An open, lightweight multimodal embedding model
왜 중요한가
단일 오픈 모델로 4가지 모달리티를 통합 처리해 온디바이스 AI 애플리케이션 개발 비용과 복잡도를 낮출 수 있다.
Google DeepMind가 2026년 10월 6일 오픈 경량 멀티모달 임베딩 모델 'EmbeddingGemma 2'를 공개했다. 텍스트·이미지·오디오·비디오를 단일 임베딩 공간으로 통합 매핑하며, 온디바이스 멀티모달 임베딩 분야에서 최고 성능을 표방한다.
Google DeepMind 연구 엔지니어 Sahil Dua와 Henrique Schechter Vera가 공동 발표한 EmbeddingGemma 2는 텍스트, 이미지, 오디오, 비디오 등 다양한 모달리티 조합을 하나의 통합 임베딩 공간으로 네이티브 매핑하는 오픈 경량 모델이다.
Google은 이 모델을 온디바이스 멀티모달 임베딩 분야에서 현재 가장 뛰어난 성능을 보이는 모델이라고 밝혔다. 전작 EmbeddingGemma를 기반으로 하며, 오픈 모델로 제공돼 개발자들이 자유롭게 활용할 수 있다는 점이 특징이다.
멀티모달 임베딩은 서로 다른 형식의 데이터를 동일한 벡터 공간에 표현해 검색, 추천, 분류 등 다양한 다운스트림 태스크에 활용된다. EmbeddingGemma 2는 이를 단일 모델에서 네이티브로 처리함으로써 기존에 모달리티별로 별도 모델을 사용하던 파이프라인을 단순화할 수 있다.
현재 공식 블로그 게시물에는 벤치마크 수치나 모델 파라미터 규모 등 세부 사양이 충분히 공개되지 않았으며, 추가 기술 문서 및 모델 배포 경로는 Google DeepMind 블로그를 통해 확인할 수 있다.