T5 (Text-to-Text Transfer Transformer) (TR)
T5 (Text-to-Text Transfer Transformer) — Google AI araştırmacıları tarafından geliştirilen ve 2019 yılında tanıtılan büyük dil modelleri ailesidir[1]. T5'in temel yeniliği, herhangi bir doğal dil işleme (NLP) görevini bir metin dizisini diğerine dönüştürme problemi olarak ele alan birleşik «text-to-text» çerçevesidir. Bu yaklaşım, çeviri, özetleme, soru yanıtlama ve sınıflandırma gibi geniş bir görev yelpazesi için tek bir modelin, tek bir kayıp fonksiyonunun ve tek bir eğitim prosedürünün kullanılmasını mümkün kılmıştır[2].
Model, standart «encoder-decoder» transformer mimarisine dayanmakta olup bu özelliğiyle T5'i yalnızca encoder kullanan BERT ve yalnızca decoder kullanan GPT türü modellerden ayırmaktadır. T5 üzerindeki çalışmalar, temelden yeni bir yöntem geliştirmek amacıyla değil, NLP'de transfer learning yöntemlerini sistematik biçimde incelemek ve karşılaştırmak için kapsamlı bir ampirik araştırma olarak tasarlanmıştır[1].
Paradigma «Text-to-Text»
T5'in temel fikri, tüm görevlerin ortak bir formatta tanımlanmasıdır. Model girdi olarak metin alır ve çıktı olarak yine metin üretir. Modelin kendisine verilen görevleri birbirinden ayırt edebilmesi için girdi dizisine özel bir metinsel önek-talimat eklenir[2].
- Çeviri: `translate English to German: That is good.` → `Das ist gut.`
- Duygu sınıflandırması: `sst2 sentence: a very exciting film.` → `positive`
- Özetleme: `summarize: [uzun makale metni]` → `[özet]`
Bu yaklaşım, BERT gibi mimarilerde yaygın olan her görev için ayrı task-specific head geliştirme zorunluluğunu ortadan kaldırarak modelin kullanım sürecini köklü biçimde basitleştirmektedir[3].
Mimari ve Ölçeklendirme
Encoder-Decoder Mimarisi
T5, iki bölümden oluşan standart transformer mimarisini kullanmaktadır[1]:
- Encoder: Tüm girdi dizisini eş zamanlı olarak işleyerek zengin, bağlamsallaştırılmış bir temsil oluşturur. BERT'te olduğu gibi T5'in encoder'ı da çift yönlüdür.
- Decoder: Encoder'dan elde edilen temsili kullanarak çıktı metnini token token (otoregresif biçimde) üretir.
Bu hibrit yapı, T5'in hem dil anlama hem de metin üretme görevlerini etkili biçimde yerine getirmesini sağlamaktadır[4].
Temel İyileştirmeler
T5 mimarisi, orijinal transformer modeline kıyasla çeşitli değişiklikler içermektedir:
- Göreli konumsal embedding'ler: T5, mutlak sinüzoidal embedding'ler yerine, yalnızca token'lar arasındaki göreli mesafeye bağlı olan öğrenilebilir bir skaler kaydırmanın (bias) dikkat logit'lerine eklendiği basitleştirilmiş ancak etkili bir göreli konum kodlama biçimini kullanmaktadır[1].
- Değiştirilmiş katman normalizasyonu (Layer Norm): Normalizasyon, residual connection dışına alınmış ve eğitim kararlılığını artırmak amacıyla toplayıcı kaydırma (bias) bileşeni kaldırılmıştır.
Model Ölçekleri
Orijinal çalışmada model, parametre sayısı bakımından farklılaşan çeşitli yapılandırmalarda sunulmuş; bu sayede ölçeğin etkisi sistematik olarak incelenmiştir[5]:
- T5-Small: ~60 milyon parametre
- T5-Base: ~220 milyon parametre
- T5-Large: ~770 milyon parametre
- T5-3B: ~3 milyar parametre
- T5-11B: ~11 milyar parametre
Araştırma, model ölçeğinin büyütülmesinin performansı artırmanın en güvenilir yollarından biri olduğunu ortaya koymuştur[1].
Ön Eğitim: C4 Dataset'i ve Span Corruption Görevi
Span Corruption Görevi
T5'in ön eğitimi için bir gürültü giderme (denoising) görevi seçilmiş; bu görevin özel biçimi olan parça bozulması (span corruption) yöntemi kullanılmıştır[6]. Yöntem şu şekilde işlemektedir:
- Girdi metnindeki token'ların rastgele seçilen %15'i maskelenir.
- BERT'teki MLM yönteminden farklı olarak, T5'te tek tek token'lar değil, bütün sürekli parçalar (spans) maskelenir.
- Her bozulmuş parça, `<X>`, `<Y>` gibi benzersiz bir maske token'ıyla değiştirilir.
- Model, çıktı olarak karşılık gelen maskelerle ayrılmış silinen parça dizisini üretmek üzere eğitilir.
Bu yaklaşım, modeli metin dizilerinin tamamını tahmin etmeye zorlamakta ve bunun basit dil modellemesine kıyasla ön eğitim için daha etkili bir görev olduğu kanıtlanmıştır[1].
C4 Dataset'i (Colossal Clean Crawled Corpus)
Transfer learning potansiyelini gerçekleştirmek amacıyla araştırmacılar, yaklaşık 750 GB boyutunda büyük ve yüksek kalitede temizlenmiş bir metin veri kümesi olan C4 oluşturmuştur[2]. Bu veri kümesi, kamuya açık web korpusu olan Common Crawlın geniş ölçekli temizlenmesi ve filtrelenmesiyle elde edilmiştir[7]. Temizleme süreci; tekrar eden içeriklerin, şablon metinlerin ("Lorem ipsum"), eksik cümlelerin kaldırılmasını ve küfür filtresi uygulanmasını kapsamaktadır[8].
C4 Dataset'ine Yönelik Eleştiriler
«Temiz» bir korpus oluşturma hedefine karşın C4'ün filtreleme süreci, sistemik önyargılar nedeniyle eleştirilere maruz kalmıştır. Araştırmalar, küfür filtresinin LGBTİ+ topluluklarıyla ilgili metinleri ve Afrikalı Amerikalıların kullandığı İngilizceyle (AAE) yazılmış metinleri orantısız biçimde kaldırdığını ortaya koymuştur[8]. Bunun yanı sıra veri kümesinde önemli miktarda rahatsız edici ve telif hakkıyla korunan içerik de tespit edilmiştir. Bu sorunlar, nesnel olarak «kaliteli» veri kümeleri oluşturmanın güçlüğünü ve filtrelemeye ilişkin teknik kararların kasıtsız toplumsal önyargılara yol açabileceğini gözler önüne sermektedir.
Sonuçlar ve Performans
Yayınlandığı dönemde T5, GLUE, SuperGLUE, SQuAD ve özetleme görevleri dahil olmak üzere pek çok benchmark'ta yeni state-of-the-art rekorlar kırmıştır[2]. Özellikle T5-11B modeli, SuperGLUE benchmark'ında insan düzeyine yakın bir sonuç elde ederek karmaşık mantıksal çıkarım gerektiren görevlerin üstesinden gelebileceğini kanıtlamıştır[9]. Bu sonuçlar, araştırmanın temel hipotezini doğrulamıştır: birleşik çerçeve, büyük ölçek ve kaliteli veri kümesinin bir arada kullanılması, NLP'de öncü sonuçlara ulaşmak için son derece güçlü bir stratejidir.
T5'in Evrimi ve Varyantları
T5 yaklaşımı, sonraki pek çok modelin temelini oluşturmuştur:
- mT5: 101 dili kapsayan mC4 korpusu üzerinde eğitilmiş T5'in çok dilli versiyonudur[10].
- ByT5: Token'laştırmadan tamamen vazgeçen ve doğrudan ham UTF-8 baytları üzerinde çalışan deneysel bir versiyondur. Bu özellik, modeli yazım hatalarına karşı dayanıklı kılmakta ve herhangi bir dili «kutudan çıkar çıkmaz» işleyebilmesini sağlamaktadır[11].
- Switch Transformer: T5'in Mixture-of-Experts (MoE) mimarisini benimseyen ölçeklenebilir versiyonudur; bu mimari, makul hesaplama maliyetlerini korurken parametre sayısının trilyonlara çıkarılmasına olanak tanımıştır[12].
- FLAN-T5: Bu, yeni bir mimari değil; standart T5'in yüzlerce görev üzerinde talimat biçiminde formüle edilmiş ek bir fine-tuning aşamasından (instruction tuning) geçirilmiş halidir. Bu süreç, modelin yeni ve daha önce görülmemiş görevlere zero-shot (örnek olmaksızın) genelleme yeteneğini önemli ölçüde artırmıştır[13].
- UL2: T5'in fikirlerini geliştiren bu model, metin maskeleme şemalarını çeşitli biçimlerde birleştirerek evrenselliği artırmayı hedefleyen Mixture of Denoisers adlı yeni bir ön eğitim hedefi kullanmaktadır[14].
Dış bağlantılar
- GitHub'daki resmi T5 deposu
- Google Research blogunda T5 araştırması hakkında makale
Kaynakça
- Vaswani, A. et al. (2017). Attention Is All You Need. arXiv:1706.03762.
- Raffel, C. et al. (2020). Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer. arXiv:1910.10683.
- Xue, L. et al. (2021). mT5: A Massively Multilingual Pre-trained Text-to-Text Transformer. arXiv:2010.11934.
- Dodge, J. et al. (2021). Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus. arXiv:2104.08758.
- Fedus, W. et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Ni, J. et al. (2021). Sentence-T5: Scalable Sentence Encoders from Pre-trained Text-to-Text Models. arXiv:2108.08877.
- Guo, M. et al. (2021). LongT5: Efficient Text-To-Text Transformer for Long Sequences. arXiv:2112.07916.
- Xue, L. et al. (2022). ByT5: Towards a Token-Free Future with Pre-trained Byte-to-Byte Models. arXiv:2105.13626.
- Tay, Y. et al. (2022). UL2: Unifying Language Learning Paradigms. arXiv:2205.05131.
- Chung, H. W. et al. (2022). Scaling Instruction-Finetuned Language Models. arXiv:2210.11416.
- Longpre, S. et al. (2023). The Flan Collection: Designing Data and Methods for Effective Instruction Tuning. arXiv:2301.13688.
Notlar
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 Raffel, Colin; Shazeer, Noam; Roberts, Adam; et al. «Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer». Journal of Machine Learning Research. [1]
- ↑ 2.0 2.1 2.2 2.3 «Exploring Transfer Learning with T5: the Text-To-Text Transfer Transformer». Google Research Blog. [2]
- ↑ «A Detailed Look At Google's T5 Model in NLP». DhiWise Blog. [3]
- ↑ «T5 (Text-to-Text Transfer Transformer)». GeeksforGeeks. [4]
- ↑ «T5». Hugging Face Transformers Documentation. [5]
- ↑ «T5 (language model)». In Wikipedia. [6]
- ↑ «C4 Dataset». Papers With Code. [7]
- ↑ 8.0 8.1 Dodge, J.; Sap, M.; Marasović, A.; et al. «Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus». arXiv. [8]
- ↑ «Google T5 algorithm scores 88.9 on SuperGLUE languge benchmark, compared to 89.8 human baseline». Reddit, r/linguistics. [9]
- ↑ Xue, Linting; Constant, Noah; Roberts, Adam; et al. «mT5: A massively multilingual pre-trained text-to-text transformer». arXiv. [10]
- ↑ Xue, Linting; Barua, Aditya; Constant, Noah; et al. «ByT5: Towards a token-free future with pre-trained byte-to-byte models». arXiv. [11]
- ↑ Fedus, William; Zoph, Barret; Shazeer, Noam. «Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity». arXiv. [12]
- ↑ Chung, Hyung Won; et al. «Scaling Instruction-Finetuned Language Models». arXiv. [13]
- ↑ Tay, Yi; Dehghani, Mostafa; Tran, Vinh; et al. «UL2: Unifying Language Learning Paradigms». arXiv. [14]