Home Google Η Google παρουσιάζει το ανοιχτό μοντέλο τεχνητής νοημοσύνης DiffusionGemma με έως και...

Η Google παρουσιάζει το ανοιχτό μοντέλο τεχνητής νοημοσύνης DiffusionGemma με έως και 4 φορές ταχύτερη δημιουργία κειμένου

55
Google unveils DiffusionGemma

Η Google παρουσίασε το DiffusionGemma, ένα πειραματικό μοντέλο τεχνητής νοημοσύνης ανοιχτού βάρους που διερευνά τη δημιουργία κειμένου με βάση τη διάχυση. Κυκλοφορώντας με την άδεια Apache 2.0, το μοντέλο Mixture-of-Experts (MoE) των 26 δισεκατομμυρίων παραμέτρων ξεπερνά τη διαδοχική δημιουργία διακριτικού προς διακριτικό που χρησιμοποιείται από τα παραδοσιακά αυτοπαλίνδρομα μοντέλα μεγάλων γλωσσών, δημιουργώντας και βελτιώνοντας ολόκληρα μπλοκ κειμένου ταυτόχρονα.

Βασισμένο στην αποδοτικότητα νοημοσύνης ανά παράμετρο της οικογένειας Gemma 4 και στην έρευνα Gemini Diffusion της Google DeepMind, το DiffusionGemma ενσωματώνει μια ειδική κεφαλή διάχυσης σχεδιασμένη για να μεγιστοποιεί την ταχύτητα δημιουργίας.

Η Google αναφέρει ότι το μοντέλο μπορεί να προσφέρει έως και 4 φορές ταχύτερη δημιουργία κειμένου σε GPU, καθιστώντας το κατάλληλο για ερευνητές και προγραμματιστές που εξερευνούν τοπικές ροές εργασίας τεχνητής νοημοσύνης κρίσιμες για την ταχύτητα, όπως η ενσωματωμένη επεξεργασία, η γρήγορη επανάληψη και η δημιουργία μη γραμμικών δομών κειμένου.

Το DiffusionGemma εστιάζει στην παράλληλη δημιουργία κειμένου

Σε αντίθεση με τα παραδοσιακά αυτοπαλίνδρομα LLM που δημιουργούν κείμενο ένα token κάθε φορά, το DiffusionGemma χρησιμοποιεί μια προσέγγιση βασισμένη στη διάχυση που δημιουργεί και βελτιώνει έως και 256 tokens ταυτόχρονα.

Το μοντέλο ξεκινά με τυχαία tokens placeholder και τα βελτιώνει προοδευτικά μέσω πολλαπλών περασμάτων αποθορυβοποίησης μέχρι το κείμενο να συγκλίνει σε ένα τελικό αποτέλεσμα, παρόμοια με τον τρόπο που οι γεννήτριες εικόνας που βασίζονται στη διάχυση μετατρέπουν τον οπτικό θόρυβο σε ολοκληρωμένες εικόνες.

Επειδή όλα τα tokens μπορούν να ανταποκρίνονται το ένα στο άλλο μέσω αμφίδρομης προσοχής, το DiffusionGemma είναι ιδιαίτερα κατάλληλο για εργασίες όπως η ενσωματωμένη επεξεργασία, η συμπλήρωση κώδικα, τα μαθηματικά γραφήματα, οι αλληλουχίες αμινοξέων και άλλα μη γραμμικά φόρτα εργασίας δημιουργίας κειμένου.

Η επαναληπτική διαδικασία βελτίωσης επιτρέπει επίσης στο μοντέλο να αξιολογεί ένα ολόκληρο μπλοκ κειμένου ταυτόχρονα, βοηθώντας το να διορθώνει λάθη κατά τη δημιουργία και επιτρέποντας συμπεριφορές όπως το σωστό κλείσιμο σύνθετων δομών markdown και η δημιουργία κώδικα σε σχεδόν πραγματικό χρόνο.

Απαιτήσεις απόδοσης και υλικού

Το DiffusionGemma είναι κατασκευασμένο ως μοντέλο 26B Mixture-of-Experts που ενεργοποιεί μόνο 3,8 δισεκατομμύρια παραμέτρους κατά τη διάρκεια της εξαγωγής συμπερασμάτων. Όταν κβαντίζεται, το μοντέλο μπορεί να χωρέσει σε περίπου 18GB VRAM, επιτρέποντάς του να λειτουργεί σε GPU υψηλής τεχνολογίας.

Η Google και η NVIDIA αναφέρουν ότι το μοντέλο μετατοπίζει την παραγωγή κειμένου από ένα σημείο συμφόρησης εύρους ζώνης μνήμης σε ένα φόρτο εργασίας που απαιτεί μεγάλη υπολογιστική ισχύ, επιτρέποντας την καλύτερη αξιοποίηση των σύγχρονων GPU, των Tensor Cores και των βελτιστοποιήσεων CUDA. Οι εταιρείες περιγράφουν αυτή τη μετάβαση ως μετάβαση από μια διαδοχική γραφομηχανή σε ένα τυπογραφικό πιεστήριο που παράγει ολόκληρα μπλοκ κειμένου ταυτόχρονα.

Τα στοιχεία απόδοσης που κοινοποιήθηκαν από την Google και την NVIDIA περιλαμβάνουν:

  • Περισσότερα από 1.000 tokens ανά δευτερόλεπτο σε μία μόνο GPU NVIDIA H100
  • Περισσότερα από 700 tokens ανά δευτερόλεπτο σε μια κάρτα γραφικών NVIDIA GeForce RTX 5090
  • Περίπου 150 tokens ανά δευτερόλεπτο σε NVIDIA DGX Spark
  • Έως 2.000 tokens ανά δευτερόλεπτο σε NVIDIA DGX Station
  • Έως 4 φορές ταχύτερη δημιουργία κειμένου από συγκρίσιμα αυτοπαλίνδρομα μοντέλα σε σενάρια τοπικής συμπερασματολογίας

Η Google σημειώνει ότι αυτά τα κέρδη έχουν σχεδιαστεί κυρίως για τοπική και χαμηλή ταυτόχρονη εξαγωγή συμπερασμάτων. Σε περιβάλλοντα cloud με υψηλό QPS, τα αυτοπαλίνδρομα μοντέλα μπορούν να αξιοποιήσουν αποτελεσματικά το υλικό μέσω της ομαδοποίησης, μειώνοντας τα πλεονεκτήματα της παράλληλης αποκωδικοποίησης που βασίζεται στη διάχυση και ενδεχομένως αυξάνοντας το κόστος εξυπηρέτησης. Το πλεονέκτημα της απόδοσης είναι ισχυρότερο σε μικρά έως μεσαία μεγέθη ομαδοποίησης σε έναν μόνο επιταχυντή.

Βελτιστοποίηση και περιπτώσεις χρήσης

Η Google αναφέρει ότι το DiffusionGemma μπορεί να βελτιστοποιηθεί για φόρτους εργασίας που αφορούν συγκεκριμένους τομείς. Για παράδειγμα, η Unsloth βελτίωσε το μοντέλο για την επίλυση παζλ Sudoku, μια εργασία που μπορεί να είναι δύσκολη για αυτοπαλίνδρομα μοντέλα, επειδή οι προβλέψεις συχνά εξαρτώνται από μελλοντικά tokens. Η αμφίδρομη προσοχή του DiffusionGemma καθιστά αυτούς τους τύπους φόρτων εργασίας ευκολότερους στη διαχείριση.

Η εταιρεία αναμένει ότι το μοντέλο θα είναι χρήσιμο για διαδραστική συνομιλία, τοπικούς βοηθούς τεχνητής νοημοσύνης, βρόχους πρακτόρων, βοηθούς σε συσκευές που μπορούν να σχεδιάζουν και να ενεργούν, γρήγορη επανάληψη περιεχομένου, ενσωματωμένη επεξεργασία και άλλες εφαρμογές τεχνητής νοημοσύνης που είναι ευαίσθητες στην καθυστέρηση.

Ενώ το DiffusionGemma δίνει προτεραιότητα στην ταχύτητα και την παράλληλη παραγωγή, η Google σημειώνει ότι η συνολική ποιότητα εξόδου παραμένει χαμηλότερη από τα τυπικά μοντέλα Gemma 4. Για εφαρμογές που απαιτούν εξόδους παραγωγής υψηλότερης ποιότητας, η εταιρεία συνιστά τη χρήση τυπικών μοντέλων Gemma 4.

Βελτιστοποίηση και υποστήριξη πλατφόρμας NVIDIA

Η NVIDIA έχει βελτιστοποιήσει το DiffusionGemma σε όλο το οικοσύστημα υλικού της, συμπεριλαμβανομένων των GPU GeForce RTX, των σταθμών εργασίας RTX PRO, των συστημάτων DGX Spark και των πλατφορμών DGX Station. Η εταιρεία αναφέρει ότι το μοντέλο μπορεί να λειτουργήσει εξ ολοκλήρου σε υποστηριζόμενα συστήματα RTX και DGX χωρίς να βασίζεται σε συμπεράσματα cloud ή κόστος API ανά διακριτικό.

Οι υποστηριζόμενες πλατφόρμες περιλαμβάνουν:

  • NVIDIA DGX Spark: Υποστηρίζεται από το NVIDIA GB10 Grace Blackwell Superchip με 128GB ενοποιημένης μνήμης για τοπική ανάπτυξη AI, πρωτοτυποποίηση, βελτιστοποίηση και ροές εργασίας πρακτόρων.
  • NVIDIA RTX PRO 6000: Σχεδιασμένο για προγραμματιστές, ερευνητές και επαγγελματίες AI που εκτελούν τοπικές εφαρμογές AI χαμηλής καθυστέρησης.
  • NVIDIA DGX Station: Παρέχει έως και 2.000 tokens ανά δευτερόλεπτο και διαθέτει 748GB συνεκτικής μνήμης για προηγμένα τοπικά workloads AI.
  • GPU GeForce RTX: Βελτιστοποιημένα για καταναλωτικό υλικό, με επίσημη υποστήριξη llama.cpp που αναμένεται σε μελλοντική ενημέρωση.

Η Google αναφέρει ότι συνεργάστηκε στενά με την NVIDIA για τη βελτιστοποίηση του μοντέλου σε καταναλωτικό και εταιρικό υλικό. Αυτό περιλαμβάνει υποστήριξη για κβαντισμένες αναπτύξεις σε GPU GeForce RTX 4090 και RTX 5090, καθώς και σε συστήματα Hopper και Blackwell που χρησιμοποιούν προηγμένους πυρήνες NVFP4 (4-bit floating-point). Η εγγενής υποστήριξη NVFP4 βελτιώνει την υπολογιστική απόδοση διατηρώντας παράλληλα σχεδόν χωρίς απώλειες ακρίβεια.

Οικοσύστημα και διαθεσιμότητα προγραμματιστών

Το DiffusionGemma είναι τώρα διαθέσιμο ως πειραματικά ανοιχτά βάρη με την άδεια Apache 2.0.

Το μοντέλο κυκλοφορεί με υποστήριξη day-zero σε πολλαπλά πλαίσια τεχνητής νοημοσύνης και εργαλεία προγραμματιστών.

Πλαίσια και εργαλεία εξυπηρέτησης

  • Μετασχηματιστές Hugging Face
  • vLLM
  • MLX
  • NVIDIA NIM
  • Ενσωματωμένες στην Red Hat αναπτυξιακές εφαρμογές vLLM

Εργαλεία βελτιστοποίησης

  • Unsloth
  • NVIDIA NeMo
  • Hackable Diffusion, μια αρθρωτή εργαλειοθήκη JAX σχεδιασμένη για πειραματισμό με σύνθεση

Τεκμηρίωση και πόροι

  • Οδηγός προγραμματιστή DiffusionGemma
  • Ένας οπτικός οδηγός για το DiffusionGemma
  • Εγχειρίδια ανάπτυξης για DGX Spark, RTX PRO και DGX Station
  • Τρόποι πρόσβασης στο DiffusionGemma

Τρόποι πρόσβασης στο DiffusionGemma

  • Λήψη ανοιχτών βαρών από το Hugging Face
  • Δοκιμή του μοντέλου μέσω API που φιλοξενούνται από την NVIDIA
  • Ανάπτυξη τοπικά σε υποστηριζόμενο υλικό RTX και DGX
  • Πρόσβαση μέσω NVIDIA NIM
  • Χρήση μέσω της πλατφόρμας Gemini Enterprise Agent Model Garden

Η Google σημειώνει επίσης ότι η επίσημη υποστήριξη του llama.cpp έχει προγραμματιστεί για μελλοντική έκδοση.