본문으로 건너뛰기
ittechwire

출처가 분명한 기술 뉴스

  1. 홈
  2. AI

AI

Google, 텍스트·이미지·오디오·동영상용 오픈 임베딩 모델 EmbeddingGemma 2 출시

Google에 따르면 740M 파라미터 규모의 이 모델은 여러 종류의 미디어를 하나의 공유 벡터 공간에 배치하며, 휴대폰에서 실행되도록 설계됐고 Apache 2.0 라이선스로 공개된다.

ittechwire 편집부4분 분량출처: 2AI 번역 · 원문: English

핵심 내용

  1. 1EmbeddingGemma 2는 텍스트, 코드, 이미지, 오디오, 동영상을 하나의 공유 임베딩 공간에 매핑한다.
  2. 2740M 파라미터를 갖추고 Gemma 4를 기반으로 구축됐으며 Apache 2.0 라이선스로 공개된다.
  3. 3텍스트 전용으로 쓸 때는 약 270M 파라미터가 필요하며, 비전 및 오디오 인코더는 선택 사항이다.
  4. 4Google은 양자화 후 Pixel 11 Pro에서 텍스트 전용 사용 시 약 191MB의 활성 RAM이 필요하다고 보고했다.
  5. 5컨텍스트 윈도우는 이전보다 4배 커졌으며, Google은 MTEB Code 점수가 68.76에서 78.68로 올랐다고 밝혔다.

기사 전문

Google이 지난해 선보인 텍스트 전용 임베딩 모델의 후속작인 EmbeddingGemma 2를 출시했다. 임베딩 모델은 콘텐츠를 벡터라고 불리는 숫자 목록으로 변환해, 소프트웨어가 키워드 일치가 아니라 의미를 기준으로 관련 항목을 찾을 수 있게 한다. 새 버전은 텍스트뿐 아니라 코드, 이미지, 동영상, 오디오도 처리하며 이를 모두 하나의 공유 공간에 매핑한다. 이에 따라 예를 들어 텍스트 쿼리로 일치하는 오디오 클립이나 동영상 속 특정 장면을 찾아낼 수 있다. 이번 발표문은 Google DeepMind의 리서치 엔지니어 2명이 작성했다.

Google에 따르면 이 모델은 740M 파라미터를 갖추고 Gemma 4 아키텍처를 기반으로 구축됐으며, 회사의 Gemini Embedding 모델과 같은 기술을 활용한다. 모듈식 구조로, 텍스트 전용으로 쓸 때는 약 270M 파라미터만 필요하고, 완전한 멀티모달 지원을 위해 비전 인코더(170M)와 오디오 인코더(300M)를 추가할 수 있다. 모델이 한 번에 받을 수 있는 입력의 양인 컨텍스트 윈도우는 첫 번째 버전보다 4배 커졌으며, Google은 이것이 한 번의 입력으로 최대 5.5분 분량의 오디오, 29개의 이미지 또는 58개의 동영상 프레임을 처리하기에 충분하다고 밝혔다.

Google은 양자화를 적용하면 텍스트 전용 가중치가 Pixel 11 Pro에서 약 191MB의 활성 메모리를 필요로 하고, 전체 멀티모달 모델은 약 567MB가 필요하다고 밝혔다. 출력에는 Matryoshka Representation Learning이 사용되므로 개발자는 벡터를 768차원에서 512, 256 또는 128차원으로 줄일 수 있으며, 회사 측은 이를 통해 저장 공간을 최대 6분의 1로 줄일 수 있다고 설명했다. 벤치마크에서 Google은 MTEB Code와 오디오 벤치마크인 MAEB에서 10억 파라미터 미만 멀티모달 임베딩 모델 가운데 최고 점수를 기록했다고 보고했다. MTEB Code 점수는 68.76에서 78.68로 올랐으며, 텍스트 성능은 첫 번째 버전 수준을 유지하는 것으로 알려졌다. 이는 Google 자체 수치이며, 전체 결과는 모델 카드에 실려 있다.

가중치는 Hugging Face와 Kaggle에서 제공되며, 온디바이스용으로 조정된 버전은 Hugging Face의 LiteRT Community에서 받을 수 있다. Gemini Enterprise Agent Platform Model Garden에서는 곧 제공될 예정으로 안내돼 있다. Google은 transformers, sentence-transformers, MLX, vLLM, llama.cpp, Ollama, LMStudio 같은 도구에서의 지원과 함께, 파인튜닝을 위한 Unsloth 가이드와 벡터 저장을 위한 Qdrant를 언급했다. 또한 미디어 라이브러리 검색과 동영상 속 장면 찾기를 위한 Google AI Edge Gallery의 데모 앱도 소개했다.

이 모델은 Gemma 4와 같은 텍스트 분할 구성 요소와 오디오 인코더를 사용하기 때문에, Google은 두 모델을 하나의 파이프라인에서 나란히 실행하면서 합산 메모리 사용량을 줄일 수 있다고 밝혔다. 예를 들어 기기에서 오프라인으로 작동하는 검색 증강 생성(RAG) 시스템을 구축하는 데 활용할 수 있다. 회사에 따르면 첫 번째 EmbeddingGemma는 다운로드 수 20M 회를 넘어섰으며, 개발자들은 이를 온디바이스 검색 도구와 프라이버시 중심의 RAG 파이프라인에 사용했다.

왜 중요한가

임베딩 모델은 시맨틱 검색과 검색 증강 생성(RAG)의 기반이 되는 검색 계층이다. 여러 미디어 유형을 다루면서 휴대폰 메모리에 들어가는 소형 오픈 모델이 있으면, 개발자는 개인 사진이나 녹음, 파일을 서버로 보내지 않고도 그러한 검색 기능을 구축할 수 있으며, Apache 2.0 라이선스는 상업적 이용을 허용한다. 품질 수치는 아직 Google이 제시한 것뿐이다.

타임라인

  1. · 게시

주제#Google#Gemma#임베딩#온디바이스 AI#오픈 모델

출처

이 기사는 다음 출처를 바탕으로 합니다. 전체 맥락은 출처에서 확인하세요.

  1. 1Google · 1차 출처EmbeddingGemma 2: an open, lightweight multimodal embedding modelblog.google
  2. 2Google DeepMind · 1차 출처EmbeddingGemma 2: an open, lightweight multimodal embedding modeldeepmind.google