Google phát hành EmbeddingGemma 2, mô hình nhúng mở cho văn bản, hình ảnh, âm thanh và video
Theo Google, mô hình 740 triệu tham số này đặt nhiều loại phương tiện vào một không gian vectơ chung, được thiết kế để chạy trên điện thoại và được phát hành theo giấy phép Apache 2.0.
Điểm chính
- 1EmbeddingGemma 2 ánh xạ văn bản, mã, hình ảnh, âm thanh và video vào một không gian nhúng chung.
- 2Mô hình có 740 triệu tham số, được xây dựng trên Gemma 4 và phát hành theo giấy phép Apache 2.0.
- 3Chỉ dùng văn bản cần khoảng 270 triệu tham số; bộ mã hóa thị giác và âm thanh là tùy chọn.
- 4Google báo cáo cần khoảng 191MB RAM hoạt động khi chỉ dùng văn bản trên Pixel 11 Pro sau khi lượng tử hóa.
- 5Cửa sổ ngữ cảnh lớn gấp bốn lần so với trước, và Google cho biết điểm MTEB Code tăng từ 68.76 lên 78.68.
Toàn bộ bài viết
Google đã phát hành EmbeddingGemma 2, phiên bản kế nhiệm của mô hình nhúng chỉ dành cho văn bản mà công ty giới thiệu vào năm ngoái. Các mô hình nhúng biến nội dung thành danh sách các con số, gọi là vectơ, để phần mềm có thể tìm các mục liên quan theo ý nghĩa thay vì theo việc khớp từ khóa. Phiên bản mới xử lý mã, hình ảnh, video và âm thanh cũng như văn bản, đồng thời ánh xạ tất cả vào một không gian chung duy nhất, để chẳng hạn một truy vấn văn bản có thể tìm ra một đoạn âm thanh phù hợp hoặc một khoảnh khắc trong video. Thông báo này do hai kỹ sư nghiên cứu tại Google DeepMind viết.
Theo Google, mô hình có 740 triệu tham số, được xây dựng trên kiến trúc Gemma 4 và dựa trên cùng công nghệ với các mô hình Gemini Embedding của công ty. Mô hình có tính mô-đun: chỉ dùng văn bản cần khoảng 270 triệu tham số, trong khi có thể thêm bộ mã hóa thị giác (170 triệu) và bộ mã hóa âm thanh (300 triệu) để hỗ trợ đa phương thức đầy đủ. Cửa sổ ngữ cảnh, tức lượng dữ liệu đầu vào mà mô hình có thể tiếp nhận cùng lúc, lớn gấp bốn lần so với phiên bản đầu tiên; Google cho biết như vậy đủ cho tối đa 5.5 phút âm thanh, 29 hình ảnh hoặc 58 khung hình video trong một đầu vào.
Google cho biết khi lượng tử hóa, trọng số chỉ dành cho văn bản cần khoảng 191MB bộ nhớ hoạt động trên Pixel 11 Pro, còn mô hình đa phương thức đầy đủ cần khoảng 567MB. Đầu ra sử dụng Matryoshka Representation Learning, nên nhà phát triển có thể rút ngắn vectơ từ 768 chiều xuống 512, 256 hoặc 128; công ty cho biết điều này giảm dung lượng lưu trữ tới sáu lần. Về điểm chuẩn, Google báo cáo điểm số dẫn đầu trong số các mô hình nhúng đa phương thức dưới một tỷ tham số trên MTEB Code và trên MAEB, một bài đánh giá về âm thanh. Điểm MTEB Code của mô hình tăng từ 68.76 lên 78.68, trong khi hiệu năng văn bản được cho là vẫn ở mức của phiên bản đầu tiên. Đây là số liệu của chính Google; kết quả đầy đủ có trong thẻ mô hình.
Trọng số có sẵn trên Hugging Face và Kaggle, với các phiên bản được tinh chỉnh để dùng trên thiết bị trong LiteRT Community trên Hugging Face; việc có mặt trong Gemini Enterprise Agent Platform Model Garden được liệt kê là sắp ra mắt. Google nêu tên hỗ trợ trong các công cụ như transformers, sentence-transformers, MLX, vLLM, llama.cpp, Ollama và LMStudio, cùng hướng dẫn của Unsloth để tinh chỉnh và Qdrant để lưu trữ vectơ. Công ty cũng giới thiệu các ứng dụng demo trong Google AI Edge Gallery để tìm kiếm trong thư viện phương tiện và tìm các khoảnh khắc trong video.
Vì mô hình sử dụng cùng thành phần tách văn bản và bộ mã hóa âm thanh như Gemma 4, Google cho biết hai mô hình có thể chạy song song trong một quy trình với tổng mức chiếm dụng bộ nhớ nhỏ hơn, chẳng hạn để xây dựng các hệ thống tạo sinh tăng cường truy xuất (RAG) hoạt động ngoại tuyến trên thiết bị. Theo công ty, EmbeddingGemma đầu tiên đã vượt 20 triệu lượt tải xuống, và các nhà phát triển đã dùng nó cho các công cụ tìm kiếm trên thiết bị và các quy trình RAG chú trọng quyền riêng tư.
Vì sao quan trọng
Mô hình nhúng là lớp tìm kiếm đằng sau tìm kiếm ngữ nghĩa và tạo sinh tăng cường truy xuất. Một mô hình mở nhỏ bao quát nhiều loại phương tiện và vừa với bộ nhớ điện thoại cho phép nhà phát triển xây dựng kiểu tìm kiếm đó mà không phải gửi ảnh, bản ghi âm hay tệp cá nhân lên máy chủ, và giấy phép Apache 2.0 cho phép sử dụng thương mại. Các số liệu về chất lượng cho đến nay chỉ đến từ Google.
Dòng thời gian
· Đăng lúc
Chủ đề#Google#Gemma#Mô hình nhúng#AI trên thiết bị#Mô hình mở
Nguồn
Bài này dựa trên các nguồn sau. Hãy đọc chúng để nắm đầy đủ bối cảnh.


