Μετάβαση στο περιεχόμενο
ittechwire

Ειδήσεις τεχνολογίας με σαφείς πηγές

  1. Αρχική
  2. ΤΝ

ΤΝ

Η Google κυκλοφορεί το EmbeddingGemma 2, ένα ανοιχτό μοντέλο ενσωματώσεων για κείμενο, εικόνες, ήχο και βίντεο

Το μοντέλο των 740 εκατομμυρίων παραμέτρων τοποθετεί διάφορα είδη μέσων σε έναν κοινό διανυσματικό χώρο, έχει σχεδιαστεί για να λειτουργεί σε κινητά τηλέφωνα και διατίθεται με την άδεια Apache 2.0, σύμφωνα με την Google.

Σύνταξη ittechwire4 λεπτά ανάγνωσηςΠηγές: 2Μετάφραση με AI · πρωτότυπο: English

Βασικά σημεία

  1. 1Το EmbeddingGemma 2 αντιστοιχίζει κείμενο, κώδικα, εικόνες, ήχο και βίντεο σε έναν κοινό χώρο ενσωματώσεων.
  2. 2Έχει 740 εκατομμύρια παραμέτρους, βασίζεται στο Gemma 4 και κυκλοφορεί με την άδεια Apache 2.0.
  3. 3Η χρήση μόνο για κείμενο απαιτεί περίπου 270 εκατομμύρια παραμέτρους· οι κωδικοποιητές όρασης και ήχου είναι προαιρετικοί.
  4. 4Η Google αναφέρει περίπου 191MB ενεργής RAM για χρήση μόνο για κείμενο σε Pixel 11 Pro μετά την κβαντοποίηση.
  5. 5Το παράθυρο συμφραζομένων είναι τέσσερις φορές μεγαλύτερο από πριν, και η Google αναφέρει ότι η βαθμολογία στο MTEB Code αυξήθηκε από 68.76 σε 78.68.

Ολόκληρη η είδηση

Η Google κυκλοφόρησε το EmbeddingGemma 2, τον διάδοχο του μοντέλου ενσωματώσεων μόνο για κείμενο που είχε παρουσιάσει πέρυσι. Τα μοντέλα ενσωματώσεων μετατρέπουν το περιεχόμενο σε λίστες αριθμών, τα λεγόμενα διανύσματα, ώστε το λογισμικό να μπορεί να βρίσκει σχετικά στοιχεία με βάση το νόημα και όχι με αντιστοίχιση λέξεων-κλειδιών. Η νέα έκδοση χειρίζεται κώδικα, εικόνες, βίντεο και ήχο εκτός από κείμενο και τα αντιστοιχίζει όλα σε έναν ενιαίο κοινό χώρο, ώστε ένα ερώτημα κειμένου να μπορεί, για παράδειγμα, να εντοπίσει ένα αντίστοιχο ηχητικό απόσπασμα ή μια στιγμή σε ένα βίντεο. Την ανακοίνωση υπογράφουν δύο ερευνητές μηχανικοί της Google DeepMind.

Σύμφωνα με την Google, το μοντέλο έχει 740 εκατομμύρια παραμέτρους, βασίζεται στην αρχιτεκτονική Gemma 4 και αξιοποιεί την ίδια τεχνολογία με τα μοντέλα Gemini Embedding της εταιρείας. Είναι αρθρωτό: η χρήση μόνο για κείμενο απαιτεί περίπου 270 εκατομμύρια παραμέτρους, ενώ για πλήρη πολυτροπική υποστήριξη μπορούν να προστεθούν ένας κωδικοποιητής όρασης (170 εκατομμύρια) και ένας κωδικοποιητής ήχου (300 εκατομμύρια). Το παράθυρο συμφραζομένων, δηλαδή ο όγκος εισόδου που μπορεί να δεχτεί το μοντέλο ταυτόχρονα, είναι τέσσερις φορές μεγαλύτερο από ό,τι στην πρώτη έκδοση· η Google αναφέρει ότι επαρκεί για έως 5.5 λεπτά ήχου, 29 εικόνες ή 58 καρέ βίντεο σε μία είσοδο.

Η Google αναφέρει ότι με κβαντοποίηση τα βάρη μόνο για κείμενο χρειάζονται περίπου 191MB ενεργής μνήμης σε ένα Pixel 11 Pro και το πλήρες πολυτροπικό μοντέλο περίπου 567MB. Η έξοδος χρησιμοποιεί Matryoshka Representation Learning, ώστε οι προγραμματιστές να μπορούν να συντομεύουν τα διανύσματα από 768 διαστάσεις σε 512, 256 ή 128· σύμφωνα με την εταιρεία, αυτό μειώνει τον αποθηκευτικό χώρο έως και έξι φορές. Στις μετρήσεις επιδόσεων, η Google αναφέρει κορυφαίες βαθμολογίες μεταξύ των πολυτροπικών μοντέλων ενσωματώσεων κάτω του ενός δισεκατομμυρίου παραμέτρων στο MTEB Code και στο MAEB, ένα benchmark ήχου. Η βαθμολογία του στο MTEB Code αυξήθηκε από 68.76 σε 78.68, ενώ η απόδοση στο κείμενο λέγεται ότι παραμένει στο επίπεδο της πρώτης έκδοσης. Πρόκειται για στοιχεία της ίδιας της Google· τα πλήρη αποτελέσματα βρίσκονται στην κάρτα του μοντέλου.

Τα βάρη είναι διαθέσιμα στο Hugging Face και στο Kaggle, με εκδόσεις προσαρμοσμένες για χρήση στη συσκευή στο LiteRT Community του Hugging Face· η διάθεση στο Gemini Enterprise Agent Platform Model Garden αναφέρεται ως προσεχής. Η Google κατονομάζει υποστήριξη σε εργαλεία όπως τα transformers, sentence-transformers, MLX, vLLM, llama.cpp, Ollama και LMStudio, καθώς και οδηγίες του Unsloth για fine-tuning και το Qdrant για αποθήκευση διανυσμάτων. Παραπέμπει επίσης σε εφαρμογές επίδειξης στο Google AI Edge Gallery για αναζήτηση σε βιβλιοθήκη πολυμέσων και εντοπισμό στιγμών σε βίντεο.

Επειδή το μοντέλο χρησιμοποιεί το ίδιο στοιχείο διαχωρισμού κειμένου και τον ίδιο κωδικοποιητή ήχου με το Gemma 4, η Google αναφέρει ότι τα δύο μπορούν να λειτουργούν παράλληλα σε μία ροή επεξεργασίας με μικρότερο συνολικό αποτύπωμα μνήμης, για παράδειγμα για την κατασκευή συστημάτων παραγωγής επαυξημένης με ανάκτηση (RAG) που λειτουργούν εκτός σύνδεσης σε μια συσκευή. Το πρώτο EmbeddingGemma ξεπέρασε τα 20 εκατομμύρια λήψεις, σύμφωνα με την εταιρεία, και οι προγραμματιστές το χρησιμοποίησαν για εργαλεία αναζήτησης στη συσκευή και για ροές RAG με έμφαση στην ιδιωτικότητα.

Γιατί έχει σημασία

Τα μοντέλα ενσωματώσεων αποτελούν το επίπεδο αναζήτησης πίσω από τη σημασιολογική αναζήτηση και την παραγωγή επαυξημένη με ανάκτηση. Ένα μικρό ανοιχτό μοντέλο που καλύπτει διάφορους τύπους μέσων και χωράει στη μνήμη ενός κινητού επιτρέπει στους προγραμματιστές να δημιουργούν τέτοιου είδους αναζήτηση χωρίς να στέλνουν προσωπικές φωτογραφίες, ηχογραφήσεις ή αρχεία σε διακομιστή, ενώ η άδεια Apache 2.0 επιτρέπει την εμπορική χρήση. Τα στοιχεία για την ποιότητα προέρχονται προς το παρόν μόνο από την Google.

Χρονολόγιο

  1. · Δημοσιεύθηκε

Θέματα#Google#Gemma#Ενσωματώσεις#AI στη συσκευή#Ανοιχτά μοντέλα

Πηγές

Αυτή η είδηση βασίζεται στις παρακάτω πηγές. Διαβάστε τις για το πλήρες πλαίσιο.

  1. 1Google · Πρωτογενής πηγήEmbeddingGemma 2: an open, lightweight multimodal embedding modelblog.google
  2. 2Google DeepMind · Πρωτογενής πηγήEmbeddingGemma 2: an open, lightweight multimodal embedding modeldeepmind.google