Gemma (Google) (RO)

From Systems analysis wiki
Jump to navigation Jump to search

Gemma — este o familie de modele lingvistice disponibile liber, dezvoltate și lansate de compania Google (divizia Google DeepMind). Modelele Gemma se bazează pe aceeași fundație de cercetare și tehnologie ca și familia de vârf Gemini și sunt poziționate ca versiuni ușoare și de înaltă performanță ale acestora[1]. Numele provine din latinescul gemma, care înseamnă „piatră prețioasă"[2].

Gemma aparține categoriei open models (modele deschise): Google publică ponderile modelelor, ceea ce le permite cercetătorilor și dezvoltatorilor să le utilizeze, să le reantreneze și să le distribuie în mod liber, inclusiv în proiecte comerciale, cu respectarea condițiilor de utilizare responsabilă[2]. Aceasta este diferența esențială față de modelele Gemini, care sunt accesibile doar prin intermediul API-urilor cloud. Modelele Gemma pot rula local pe echipamente de consum (laptopuri, computere desktop cu GPU), nu doar în centre de date[3].

Dezvoltare și lansări

Familia Gemma include mai multe generații de modele, fiecare aducând îmbunătățiri în arhitectură, performanță și capabilități.

Prima generație: Gemma 1

Prima versiune Gemma a fost lansată pe 21 februarie 2024[4]. Aceasta a inclus două modele de text bazate pe arhitectura transformer de tip decoder:

  • Gemma 2B (2 miliarde de parametri)
  • Gemma 7B (7 miliarde de parametri)

La momentul lansării, Google declara că aceste modele depășesc modele semnificativ mai mari la benchmark-uri cheie[2]. Modelele inițiale erau preponderent în limba engleză, dar au fost antrenate pe date diverse, inclusiv documente web, cod sursă și probleme matematice[1]. Ambele modele au fost lansate în două variante: de bază (pre-trained) și ajustat instrucțional (instruction-tuned) pentru o mai bună urmărire a comenzilor utilizatorului[2].

A doua generație: Gemma 2

Gemma 2 a fost anunțată pe 27 iunie 2024 și a adus îmbunătățiri semnificative[1].

  • Dimensiunile modelelor: Au fost lansate modele cu 9 și 27 de miliarde de parametri. Variantele mai mici au fost antrenate folosind tehnica de distilare a cunoștințelor dintr-un model mai mare, pentru îmbunătățirea calității[5].
  • Fereastra de context: A fost extinsă semnificativ la 80.000 de token-uri (față de 8.192 în prima versiune)[6][7].
  • Îmbunătățiri arhitecturale: Au fost introduse mecanisme de grouped-query attention și o schemă alternantă de atenție locală și globală pentru procesarea eficientă a contextelor lungi[1].

A treia generație: Gemma 3

Gemma 3 a fost prezentată în martie 2025 ca următorul pas în dezvoltarea familiei, cu accent pe multimodalitate și acoperire extinsă a sarcinilor[6].

  • Multimodalitate: Modelele au primit suport pentru imagini și video ca date de intrare, alături de text.
  • Dimensiuni și limbi: Gama de modele acoperă patru dimensiuni (1B, 4B, 12B, 27B) și suportă până la 140 de limbi[6].
  • Fereastra de context: Mărită la 128.000 de token-uri[6].

Potrivit Google, Gemma 3 27B a obținut rezultate la nivelul celor mai bune modele deschise din acea perioadă, cedând în clasamente doar modelelor specializate, precum DeepSeek-R1[6].

Arhitectură și caracteristici tehnice

Modelele Gemma se bazează pe arhitectura transformer în configurație „numai decoder\" (decoder-only), similară modelelor GPT[7]. Aceasta înseamnă că modelul generează text în mod autoregresiv, prezicând următorul token pe baza tuturor celor anterioare. Soluțiile tehnice cheie includ:

  • Embedding-uri poziționale rotaționale (RoPE): În loc de embedding-uri poziționale absolute, se utilizează RoPE, ceea ce permite codificarea eficientă a informației poziționale.
  • Multi-query și Grouped-query attention: Pentru accelerarea și economia de memorie în modelele mai mici (de exemplu, Gemma 2B) se utilizează multi-query attention (o singură cheie/valoare pentru toate capetele de atenție). În Gemma 2 a fost introdus mecanismul de grouped-query attention, unde interogările sunt împărțite în grupuri, reprezentând un compromis între viteză și calitate[1][7].
  • Schema alternantă de atenție: În Gemma 2 este implementată o schemă în care straturile cu auto-atenție globală alternează cu straturi cu „fereastră glisantă" limitată, permițând procesarea eficientă a contextelor lungi[1].

Familia de modele și variante

Pe lângă modelele de bază universale, Google a lansat mai multe versiuni derivate ale Gemma, optimizate pentru sarcini specifice.

  • CodeGemma: Model pentru generarea și completarea codului sursă, cu suport pentru C++, C#, Go, Java, JavaScript, Python, Rust și alte limbaje[1].
  • DataGemma: Familie de modele ajustate pentru integrarea cu date externe folosind tehnici RAG. Modelul poate executa interogări de căutare în baze de date (de exemplu, Google Data Commons) pentru creșterea acurateței factuale a răspunsurilor[1].
  • PaliGemma: Model multimodal capabil să accepte ca intrare imagini și text. Este destinat sarcinilor de tip întrebare-răspuns vizual, cum ar fi descrierea imaginilor și recunoașterea obiectelor[1].
  • RecurrentGemma: Variantă experimentală cu arhitectura hibridă Griffin, care combină atenția locală cu conexiuni recurente liniare. Aceasta permite accelerarea semnificativă a generării secvențelor lungi[7].
  • MedGemma: Versiune specializată a Gemma 3 pentru domeniul medical. Include modele multimodale (4B) și text (27B) pentru analiza imaginilor medicale (radiografii, secțiuni) și a documentelor clinice. Modelele sunt distribuite ca open source, dar nu sunt destinate utilizării clinice directe fără validare suplimentară[8].
  • DolphinGemma: Proiect de cercetare privind aplicarea tehnologiilor Gemma pentru decodificarea comunicărilor delfinilor. Modelul a fost antrenat pe înregistrări audio de mai mulți ani și este utilizat pentru identificarea tiparelor în limbajul animalelor[9].

Disponibilitate și aplicare

Modelele Gemma sunt disponibile pe platformele Kaggle și Hugging Face, și sunt integrate în serviciile Google Colab și Vertex AI Model Garden[2]. Pentru accelerarea inferenței, Google a efectuat, în colaborare cu NVIDIA, adaptarea modelelor pentru TensorRT. Condițiile de licențiere Gemma permit utilizarea comercială și modificarea modelelor, ceea ce le diferențiază de alte proiecte deschise. Distribuirea este reglementată de licența Responsible AI License, care impune restricții privind utilizarea în anumite domenii (de exemplu, dezvoltarea de armament) și solicită produselor derivate să respecte principiile de utilizare sigură și etică a IA[3].

Securitate și responsabilitate

Dezvoltatorii au acordat o atenție deosebită aspectelor de securitate, având în vedere caracterul deschis al modelelor.

  • Filtrarea datelor: La pregătirea dataset-urilor de antrenament, datele personale și alte informații sensibile au fost filtrate automat pentru reducerea riscului de scurgeri[2].
  • Aliniere (Alignment): Versiunile instrucționale ale modelelor au trecut printr-un proces de aliniere în mai multe etape, utilizând tehnicile Supervised Fine-Tuning (SFT) și RLHF (Reinforcement Learning from Human Feedback) pentru consolidarea stilurilor de răspuns preferate[1].
  • Red Teaming: Înainte de lansare, modelele au fost supuse unor verificări aprofundate privind rezistența la solicitări malițioase. Experții au încercat să provoace generarea de conținut periculos sau nedorit pentru identificarea vulnerabilităților[3].
  • Instrumentarul Responsible AI Toolkit: Împreună cu modelele, Google a lansat un set de instrumente pentru facilitarea implementării sigure, inclusiv utilitarul Gemma Debugger pentru analiza stărilor interne ale modelului și clasificatori de conținut nedorit[2].
  • ShieldGemma: Model-filtru specializat, destinat prevenirii generării de conținut nesigur în versiunile multimodale ale Gemma[6].

Referințe

  • Pagina oficială Gemma pe site-ul Google AI
  • Modelele Gemma pe Hugging Face

Bibliografie

  • Mesnard, T. et al. (2024). Gemma: Open Models Based on Gemini Research and Technology. arXiv:2403.08295.
  • Rivière, M. et al. (2024). Gemma 2: Improving Open Language Models at a Practical Size. arXiv:2408.00118.
  • Kamath, A. et al. (2025). Gemma 3 Technical Report. arXiv:2503.19786.
  • Zhao, H. et al. (2024). CodeGemma: Open Code Models Based on Gemma. arXiv:2406.11409.
  • Beyer, L. et al. (2024). PaliGemma: A Versatile 3B VLM for Transfer. arXiv:2407.07726.
  • Steiner, A. et al. (2024). PaliGemma 2: A Family of Versatile VLMs for Transfer. arXiv:2412.03555.
  • Botev, A. et al. (2024). RecurrentGemma: Moving Past Transformers for Efficient Open Language Models. arXiv:2404.07839.
  • Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
  • Chinnakonduru, S. S. & Mohapatra, A. (2024). Weighted Grouped Query Attention in Transformers. arXiv:2407.10855.
  • Su, J. et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
  • Radhakrishnan, P. et al. (2024). Knowing When to Ask — Bridging Large Language Models and Data. arXiv:2409.13741.

Note

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 «What Is Google Gemma?». IBM. [1]
  2. 2.0 2.1 2.2 2.3 2.4 2.5 2.6 «Gemma: Google introduces new state-of-the-art open models». Google Developers Blog. [2]
  3. 3.0 3.1 3.2 «Google's open-source Gemma AI models draw from the research behind Gemini». The Verge. [3]
  4. «Google launches two new open LLMs». TechCrunch. [4]
  5. «Gemma 2: Improving Open Language Models at a Practical Size». Google.
  6. 6.0 6.1 6.2 6.3 6.4 6.5 «Google unveils open source Gemma 3 model with 128k context window». VentureBeat. [5]
  7. 7.0 7.1 7.2 7.3 «Gemma explained: An overview of Gemma model family architectures». Google Developers Blog. [6]
  8. «Google Releases MedGemma: Open AI Models for Medical Text and Image Analysis». InfoQ. [7]
  9. «Google Is Training a New A.I. Model to Decode Dolphin Chatter—and Potentially Talk Back». Smithsonian Magazine. [8]