Gemma (Google) (TL)

From Systems analysis wiki
Jump to navigation Jump to search

Gemma — ito ay isang pamilya ng malaya at bukas na mga language model, na binuo at inilabas ng kumpanyang Google (dibisyon ng Google DeepMind). Ang mga modelo ng Gemma ay nakabatay sa parehong pananaliksik at teknolohikal na pundasyon tulad ng pangunahing pamilyang Gemini, at inilalarawan bilang mas magaan at mataas na pagganap na mga bersyon ng mga ito[1]. Ang pangalan ay nagmula sa Latin na salitang gemma, na nangangahulugang «mahalagang bato»[2].

Ang Gemma ay kabilang sa kategorya ng open models (bukas na mga modelo): inilalathala ng Google ang mga weight ng modelo, na nagbibigay-daan sa mga mananaliksik at developer na malayang gamitin, i-fine-tune, at ipamahagi ang mga ito, kabilang sa mga komersyal na proyekto, sa ilalim ng mga kondisyon ng responsableng paggamit[2]. Ito ang pangunahing pagkakaiba mula sa mga modelo ng Gemini, na maa-access lamang sa pamamagitan ng mga cloud API. Ang mga modelo ng Gemma ay kayang tumakbo nang lokal sa consumer hardware (mga laptop, desktop na may GPU), at hindi lamang sa mga data center[3].

Pagbuo at mga Paglabas

Ang pamilyang Gemma ay binubuo ng ilang henerasyon ng mga modelo, na bawat isa ay nagdala ng mga pagpapabuti sa arkitektura, pagganap, at kakayahan.

Unang Henerasyon: Gemma 1

Ang unang bersyon ng Gemma ay inilabas noong 21 Pebrero 2024[4]. Kasama dito ang dalawang text model na nakabatay sa decoder transformer na arkitektura:

  • Gemma 2B (2 bilyong parameter)
  • Gemma 7B (7 bilyong parameter)

Sa oras ng paglabas, ipinahayag ng Google na ang mga modelong ito ay nalampasan ang mas malalaking katulad sa mga pangunahing benchmark[2]. Ang mga orihinal na modelo ay pangunahing Ingles, ngunit sinanay sa iba't ibang data, kabilang ang mga web na dokumento, source code, at mga problema sa matematika[1]. Ang parehong modelo ay inilabas sa dalawang variant: base (pre-trained) at instruction-tuned (instruction-tuned) para sa mas mahusay na pagsunod sa mga utos ng gumagamit[2].

Ikalawang Henerasyon: Gemma 2

Ang Gemma 2 ay inanunsyo noong 27 Hunyo 2024 at nagdala ng mahahalagang pagpapabuti[1].

  • Laki ng mga Modelo: Inilabas ang mga modelo na may 9 at 27 bilyong parameter. Ang mas maliliit na variant ay sinanay gamit ang knowledge distillation mula sa mas malaking modelo upang mapabuti ang kalidad[5].
  • Context Window: Pinalawak nang malaki hanggang 80,000 token (kumpara sa 8192 sa unang bersyon)[6][7].
  • Mga Pagpapabuti sa Arkitektura: Ipinakilala ang mga mekanismo ng grouped-query attention at isang umalit-alit na pamamaraan ng lokal at global na attention para sa mahusay na paggawa sa mahabang konteksto[1].

Ikatlong Henerasyon: Gemma 3

Ang Gemma 3 ay ipinakita noong Marso 2025 bilang susunod na hakbang sa pag-unlad ng pamilya na may diin sa multimodality at mas malawak na saklaw ng mga gawain[6].

  • Multimodality: Ang mga modelo ay nakatanggap ng suporta para sa mga larawan at video bilang input kasabay ng teksto.
  • Laki at mga Wika: Ang linya ng modelo ay sumasaklaw sa apat na laki (1B, 4B, 12B, 27B) at sumusuporta sa hanggang 140 wika[6].
  • Context Window: Pinahabang hanggang 128,000 token[6].

Ayon sa Google, ang Gemma 3 27B ay nagpakita ng mga resulta sa antas ng pinakamahusay na bukas na mga modelo sa panahon nito, na natalo lamang sa mga ranggo ng mga espesyal na modelo tulad ng DeepSeek-R1[6].

Arkitektura at mga Teknikal na Katangian

Ang mga modelo ng Gemma ay nakabatay sa transformer na arkitektura sa konfigurasyon ng «decoder lamang» (decoder-only), na katulad ng mga modelo ng GPT[7]. Nangangahulugan ito na ang modelo ay awtoregressibong gumagawa ng teksto, hinuhulaan ang susunod na token batay sa lahat ng nauna. Kasama sa mga pangunahing teknikal na solusyon:

  • Rotary Positional Embeddings (RoPE): Sa halip na absolute na positional embedding, ginagamit ang RoPE, na nagbibigay-daan sa mahusay na pag-encode ng positional na impormasyon.
  • Multi-query at Grouped-query attention: Para sa pagbilis at pagtitipid ng memorya sa mas maliliit na modelo (hal., Gemma 2B), ginagamit ang multi-query attention (isang key/value para sa lahat ng attention head). Sa Gemma 2, ipinakilala ang mekanismo ng grouped-query attention, kung saan ang mga query ay hinihiwalay sa mga grupo, na nagsisilbing kompromiso sa pagitan ng bilis at kalidad[1][7].
  • Umalit-alit na Pamamaraan ng Attention: Sa Gemma 2, isinagawa ang isang pamamaraan kung saan ang mga layer ng global self-attention ay umalit-alit sa mga layer na may limitadong «sliding window», na nagbibigay-daan sa mahusay na pagproseso ng mahabang konteksto[1].

Pamilya ng mga Modelo at mga Variant

Bukod sa mga unibersal na base model, naglabas ang Google ng ilang derivative na bersyon ng Gemma, na na-optimize para sa mga tiyak na gawain.

  • CodeGemma: Modelo para sa pagbuo at pagkumpleto ng source code, na sumusuporta sa C++, C#, Go, Java, JavaScript, Python, Rust, at iba pang mga wika[1].
  • DataGemma: Isang pamilya ng mga modelong fine-tuned para sa integrasyon sa mga panlabas na datos gamit ang mga teknik ng RAG. Ang modelo ay kayang magsagawa ng mga query sa mga database (hal., Google Data Commons) upang mapabuti ang katumpakan ng mga sagot[1].
  • PaliGemma: Isang multimodal na modelo na kayang tumanggap ng mga larawan at teksto bilang input. Ito ay idinisenyo para sa mga gawain ng visual na tanong at sagot, tulad ng paglalarawan ng mga larawan at pagkilala ng mga bagay[1].
  • RecurrentGemma: Isang eksperimental na variant na may hybrid na arkitekturang Griffin, na pinagsasama ang lokal na attention at linear na recurrent na koneksyon. Nagbibigay-daan ito na malaki ang pagpapabilis ng pagbuo ng mahabang mga sequence[7].
  • MedGemma: Espesyalisadong bersyon ng Gemma 3 para sa larangan ng medisina. Kasama ang multimodal (4B) at text (27B) na mga modelo para sa pagsusuri ng mga medikal na larawan (X-ray, slice) at mga klinikal na dokumento. Ang mga modelo ay ipinamamahagi bilang bukas, ngunit hindi inilaan para sa direktang klinikal na paggamit nang walang karagdagang pagpapatunay[8].
  • DolphinGemma: Isang pananaliksik na proyekto para sa paglalapat ng mga teknolohiya ng Gemma sa pag-decode ng komunikasyon ng mga dolphin. Ang modelo ay sinanay sa mga audio recording na maraming taon ang haba at ginagamit upang matukoy ang mga pattern sa wika ng mga hayop[9].

Availability at Paggamit

Ang mga modelo ng Gemma ay available sa mga platform ng Kaggle at Hugging Face, at naka-integrate rin sa mga serbisyo ng Google Colab at Vertex AI Model Garden[2]. Para mapabilis ang inference, nakipagtulungan ang Google sa NVIDIA upang i-adapt ang mga modelo para sa TensorRT. Ang mga kondisyon ng lisensya ng Gemma ay nagbibigay-pahintulot ng komersyal na paggamit at pagbabago ng mga modelo, na nagtatangi sa kanila mula sa ilang ibang bukas na proyekto. Ang pamamahagi ay pinamamahalaan ng lisensiyang Responsible AI License, na naglalagay ng mga limitasyon sa paggamit sa ilang mga lugar (hal., pagbuo ng sandata) at nag-aatas sa mga derivative na produkto na sumunod sa mga prinsipyo ng ligtas at etikal na paggamit ng AI[3].

Kaligtasan at Pananagutan

Binigyang-diin ng mga developer ang mga isyu ng kaligtasan, isinasaalang-alang ang bukas na katangian ng mga modelo.

  • Pag-filter ng Data: Sa paghahanda ng mga training dataset, awtomatikong na-filter ang personal na data at iba pang sensitibong impormasyon upang mabawasan ang panganib ng mga paglabas[2].
  • Alignment: Ang mga instruction na bersyon ng mga modelo ay dumaan sa multi-stage na alignment gamit ang mga teknik ng Supervised Fine-Tuning (SFT) at RLHF (Reinforcement Learning mula sa Human Feedback) upang mapatatag ang mga kagustuhang estilo ng sagot[1].
  • Red Teaming: Bago ang paglabas, ang mga modelo ay sumailalim sa malalim na pagsusuri para sa katatagan laban sa mga masamang kahilingan. Sinubukan ng mga eksperto na ma-trigger ang pagbuo ng mapanganib o hindi kanais-nais na nilalaman upang matukoy ang mga kahinaan[3].
  • Responsible AI Toolkit: Kasabay ng mga modelo, naglabas ang Google ng isang hanay ng mga kasangkapan upang mapadali ang ligtas na pag-deploy, kabilang ang utility na Gemma Debugger para sa pagsusuri ng mga panloob na estado ng modelo at mga classifier ng hindi kanais-nais na nilalaman[2].
  • ShieldGemma: Espesyalisadong filter na modelo, na idinisenyo upang maiwasan ang pagbuo ng hindi ligtas na nilalaman sa mga multimodal na bersyon ng Gemma[6].

Mga Sanggunian

  • Opisyal na pahina ng Gemma sa Google AI website
  • Mga modelo ng Gemma sa Hugging Face

Talasanggunian

  • Mesnard, T. et al. (2024). Gemma: Open Models Based on Gemini Research and Technology. arXiv:2403.08295.
  • Rivière, M. et al. (2024). Gemma 2: Improving Open Language Models at a Practical Size. arXiv:2408.00118.
  • Kamath, A. et al. (2025). Gemma 3 Technical Report. arXiv:2503.19786.
  • Zhao, H. et al. (2024). CodeGemma: Open Code Models Based on Gemma. arXiv:2406.11409.
  • Beyer, L. et al. (2024). PaliGemma: A Versatile 3B VLM for Transfer. arXiv:2407.07726.
  • Steiner, A. et al. (2024). PaliGemma 2: A Family of Versatile VLMs for Transfer. arXiv:2412.03555.
  • Botev, A. et al. (2024). RecurrentGemma: Moving Past Transformers for Efficient Open Language Models. arXiv:2404.07839.
  • Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
  • Chinnakonduru, S. S. & Mohapatra, A. (2024). Weighted Grouped Query Attention in Transformers. arXiv:2407.10855.
  • Su, J. et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
  • Radhakrishnan, P. et al. (2024). Knowing When to Ask — Bridging Large Language Models and Data. arXiv:2409.13741.

Mga Tala

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 «What Is Google Gemma?». IBM. [1]
  2. 2.0 2.1 2.2 2.3 2.4 2.5 2.6 «Gemma: Google introduces new state-of-the-art open models». Google Developers Blog. [2]
  3. 3.0 3.1 3.2 «Google's open-source Gemma AI models draw from the research behind Gemini». The Verge. [3]
  4. «Google launches two new open LLMs». TechCrunch. [4]
  5. «Gemma 2: Improving Open Language Models at a Practical Size». Google.
  6. 6.0 6.1 6.2 6.3 6.4 6.5 «Google unveils open source Gemma 3 model with 128k context window». VentureBeat. [5]
  7. 7.0 7.1 7.2 7.3 «Gemma explained: An overview of Gemma model family architectures». Google Developers Blog. [6]
  8. «Google Releases MedGemma: Open AI Models for Medical Text and Image Analysis». InfoQ. [7]
  9. «Google Is Training a New A.I. Model to Decode Dolphin Chatter—and Potentially Talk Back». Smithsonian Magazine. [8]