T5 (Text-to-Text Transfer Transformer) (BN)
T5 (Text-to-Text Transfer Transformer) — এটি Google AI-এর গবেষকদের দ্বারা তৈরি এবং ২০১৯ সালে উপস্থাপিত বৃহৎ ভাষা মডেলের একটি পরিবার[1]। T5-এর মূল উদ্ভাবন হলো একটি একীভূত «text-to-text» ফ্রেমওয়ার্ক, যা প্রাকৃতিক ভাষা প্রক্রিয়াকরণের (NLP) যেকোনো কাজকে একটি টেক্সট ক্রম থেকে আরেকটি টেক্সট ক্রমে রূপান্তরের সমস্যা হিসেবে বিবেচনা করে। এটি অনুবাদ, সারসংক্ষেপ, প্রশ্নোত্তর এবং শ্রেণিবিভাগের মতো বিস্তৃত কাজের জন্য একটি একক মডেল, একটি লস ফাংশন এবং একটি প্রশিক্ষণ পদ্ধতি ব্যবহার করার সুযোগ দিয়েছে[2]।
মডেলটি স্ট্যান্ডার্ড transformer «এনকোডার-ডিকোডার» আর্কিটেকচারের উপর ভিত্তি করে তৈরি, যা এটিকে BERT (শুধুমাত্র এনকোডার) এবং GPT (শুধুমাত্র ডিকোডার) ধরনের মডেলগুলো থেকে আলাদা করে। T5-এর কাজটি মূলত NLP-তে transfer learning-এর বিভিন্ন পদ্ধতি পদ্ধতিগতভাবে অধ্যয়ন ও তুলনা করার জন্য একটি বৃহৎ মাপের অভিজ্ঞতামূলক গবেষণা হিসেবে পরিকল্পিত হয়েছিল, কোনো মৌলিকভাবে নতুন পদ্ধতি তৈরি করার জন্য নয়[1]।
«Text-to-Text» প্যারাডাইম
T5-এর কেন্দ্রীয় ধারণা হলো সমস্ত কাজ একটি একক ফরম্যাটে প্রণয়ন করা হয়। মডেলটি ইনপুট হিসেবে টেক্সট গ্রহণ করে এবং আউটপুট হিসেবেও টেক্সট তৈরি করে। মডেলটি যাতে তার সামনে রাখা কাজগুলো পার্থক্য করতে পারে, সেজন্য ইনপুট ক্রমে একটি বিশেষ টেক্সট প্রিফিক্স-নির্দেশনা যুক্ত করা হয়[2]।
- অনুবাদ: `translate English to German: That is good.` → `Das ist gut.`
- অনুভূতি শ্রেণিবিভাগ: `sst2 sentence: a very exciting film.` → `positive`
- সারসংক্ষেপ: `summarize: [দীর্ঘ নিবন্ধের টেক্সট]` → `[সংক্ষিপ্ত বিবরণ]`
এই পদ্ধতিটি মডেলের প্রয়োগ প্রক্রিয়াকে আমূলভাবে সহজ করে, প্রতিটি পৃথক কাজের জন্য নির্দিষ্ট «হেড» (task-specific heads) তৈরির প্রয়োজনীয়তা দূর করে, যা BERT-এর মতো আর্কিটেকচারের বৈশিষ্ট্য ছিল[3]।
আর্কিটেকচার এবং স্কেলিং
এনকোডার-ডিকোডার আর্কিটেকচার
T5 দুটি অংশ নিয়ে গঠিত স্ট্যান্ডার্ড transformer আর্কিটেকচার ব্যবহার করে[1]:
- এনকোডার: সম্পূর্ণ ইনপুট ক্রমটি একসাথে প্রক্রিয়া করে, একটি সমৃদ্ধ প্রাসঙ্গিক উপস্থাপনা তৈরি করে। BERT-এর মতোই, T5-এর এনকোডার দ্বিমুখী।
- ডিকোডার: এনকোডার থেকে প্রাপ্ত উপস্থাপনা ব্যবহার করে টোকেন দ্বারা টোকেন (অটোরিগ্রেসিভভাবে) আউটপুট টেক্সট তৈরি করে।
এই হাইব্রিড কাঠামো T5-কে ভাষা বোঝার কাজ এবং টেক্সট তৈরির কাজ উভয়ই কার্যকরভাবে সমাধান করতে সক্ষম করে[4]।
মূল উন্নতিসমূহ
T5-এর আর্কিটেকচারে মূল transformer মডেলের তুলনায় কিছু পরিবর্তন অন্তর্ভুক্ত রয়েছে:
- আপেক্ষিক পজিশনাল embedding: পরম সাইনুসয়েডাল embedding-এর পরিবর্তে T5 আপেক্ষিক পজিশন এনকোডিংয়ের একটি সরলীকৃত কিন্তু কার্যকর রূপ ব্যবহার করে, যেখানে attention লজিটে একটি প্রশিক্ষণযোগ্য স্কেলার বায়াস (bias) যোগ করা হয় যা কেবল টোকেনগুলোর মধ্যে আপেক্ষিক দূরত্বের উপর নির্ভর করে[1]।
- পরিবর্তিত Layer Norm: নর্মালাইজেশন residual connection-এর বাইরে নেওয়া হয়েছে এবং প্রশিক্ষণের স্থিতিশীলতা বাড়াতে এর থেকে অ্যাডিটিভ বায়াস (bias) সরানো হয়েছে।
মডেলের আকার
মূল গবেষণাপত্রে মডেলটি বেশ কয়েকটি কনফিগারেশনে উপস্থাপন করা হয়েছিল, যেগুলো প্যারামিটারের সংখ্যায় ভিন্ন, যা স্কেলের প্রভাব পদ্ধতিগতভাবে অধ্যয়ন করার সুযোগ দিয়েছে[5]:
- T5-Small: ~৬ কোটি প্যারামিটার
- T5-Base: ~২২ কোটি প্যারামিটার
- T5-Large: ~৭৭ কোটি প্যারামিটার
- T5-3B: ~৩০০ কোটি প্যারামিটার
- T5-11B: ~১১০০ কোটি প্যারামিটার
গবেষণায় দেখা গেছে যে মডেলের স্কেল বৃদ্ধি করা এর কার্যক্ষমতা উন্নত করার সবচেয়ে নির্ভরযোগ্য উপায়গুলোর মধ্যে একটি[1]।
প্রি-ট্রেনিং: C4 dataset এবং Span Corruption কাজ
Span Corruption কাজ
T5-এর প্রি-ট্রেনিংয়ের জন্য একটি denoising কাজ বেছে নেওয়া হয়েছিল, বিশেষভাবে এর ফ্র্যাগমেন্ট ক্ষতি (span corruption) নামক রূপ[6]। পদ্ধতিটি নিম্নরূপ কাজ করে:
- ইনপুট টেক্সটে এলোমেলোভাবে ১৫% টোকেন মাস্ক করা হয়।
- BERT-এর MLM পদ্ধতির বিপরীতে, যেখানে পৃথক টোকেন মাস্ক করা হয়, T5-এ সম্পূর্ণ ধারাবাহিক ফ্র্যাগমেন্ট (spans) মাস্ক করা হয়।
- প্রতিটি ক্ষতিগ্রস্ত ফ্র্যাগমেন্টকে একটি অনন্য মাস্ক-টোকেন দিয়ে প্রতিস্থাপিত করা হয় (যেমন `<X>`, `<Y>`)।
- মডেলটি আউটপুটে সংশ্লিষ্ট মাস্ক দ্বারা পৃথক করা মুছে ফেলা ফ্র্যাগমেন্টগুলোর ক্রম তৈরি করতে শিখে।
এই পদ্ধতিটি মডেলকে সম্পূর্ণ টেক্সট ক্রম পূর্বাভাস দিতে বাধ্য করে, যা সাধারণ ভাষা মডেলিংয়ের চেয়ে প্রি-ট্রেনিংয়ের জন্য আরও কার্যকর কাজ হিসেবে প্রমাণিত হয়েছে[1]।
C4 Dataset (Colossal Clean Crawled Corpus)
ট্রান্সফার লার্নিংয়ের সম্ভাবনা উপলব্ধি করতে গবেষকরা প্রায় ৭৫০ গিগাবাইট আয়তনের একটি বিশাল এবং মানসম্পন্নভাবে পরিষ্কার করা টেক্সট ডেটার সংগ্রহ C4 তৈরি করেছিলেন[2]। এটি সর্বজনীনভাবে উপলব্ধ ওয়েব কর্পাস Common Crawl-এর বৃহৎ মাপের পরিষ্কার এবং ফিল্টারিংয়ের মাধ্যমে প্রাপ্ত হয়েছিল[7]। পরিষ্কার করার প্রক্রিয়ায় ডুপ্লিকেট, ছাঁচের টেক্সট ("Lorem ipsum"), অসম্পূর্ণ বাক্য অপসারণ এবং অশ্লীল ভাষা ফিল্টার করা অন্তর্ভুক্ত ছিল[8]।
C4 Dataset-এর সমালোচনা
«পরিষ্কার» কর্পাস তৈরির ঘোষিত লক্ষ্য সত্ত্বেও, C4-এর ফিল্টারিং প্রক্রিয়া পদ্ধতিগত পক্ষপাতের জন্য সমালোচিত হয়েছে। গবেষণায় দেখা গেছে যে অশ্লীল ভাষার ফিল্টারটি LGBTQ+ সম্প্রদায়ের সাথে সম্পর্কিত টেক্সট এবং আফ্রিকান-আমেরিকান ইংরেজি (AAE)-তে লেখা টেক্সট অসামঞ্জস্যপূর্ণভাবে সরিয়ে দিয়েছিল[8]। এছাড়াও, dataset-এ উল্লেখযোগ্য পরিমাণ আপত্তিকর এবং কপিরাইটযুক্ত কন্টেন্ট পাওয়া গেছে। এই সমস্যাগুলো উদ্দেশ্যমূলকভাবে «মানসম্পন্ন» ডেটাসেট তৈরির জটিলতা এবং ফিল্টারিংয়ের প্রযুক্তিগত সিদ্ধান্তগুলো কীভাবে অনিচ্ছাকৃত সামাজিক পক্ষপাত তৈরি করতে পারে তা চিত্রিত করে।
ফলাফল এবং কার্যক্ষমতা
প্রকাশনার সময়ে T5 GLUE, SuperGLUE, SQuAD এবং সারসংক্ষেপ কাজ সহ অনেক benchmark-এ নতুন কার্যক্ষমতার রেকর্ড (state-of-the-art) স্থাপন করেছিল[2]। বিশেষভাবে, T5-11B মডেলটি SuperGLUE-এ মানব-স্তরের কাছাকাছি ফলাফল অর্জন করেছে, জটিল যৌক্তিক অনুমান প্রয়োজন এমন কাজ সমাধানের ক্ষমতা প্রদর্শন করেছে[9]। এই ফলাফলগুলো গবেষণার কেন্দ্রীয় অনুকল্পটি নিশ্চিত করেছে: একীভূত ফ্রেমওয়ার্ক, বৃহৎ স্কেল এবং মানসম্পন্ন ডেটাসেটের সমন্বয় NLP-তে অগ্রণী ফলাফল অর্জনের জন্য একটি অত্যন্ত শক্তিশালী কৌশল।
T5-এর বিবর্তন এবং রূপভেদ
T5-এর পদ্ধতি অসংখ্য পরবর্তী মডেলের ভিত্তি হিসেবে কাজ করেছে:
- mT5: T5-এর বহুভাষিক সংস্করণ, ১০১টি ভাষা জুড়ে বিস্তৃত mC4 কর্পাসে প্রশিক্ষিত[10]।
- ByT5: একটি পরীক্ষামূলক সংস্করণ যা সম্পূর্ণরূপে টোকেনাইজেশন বাদ দিয়ে সরাসরি কাঁচা UTF-8 বাইটের সাথে কাজ করে। এটি এটিকে টাইপোগ্রাফিক ত্রুটির প্রতি প্রতিরোধী করে তোলে এবং যেকোনো ভাষা «বাক্সের বাইরে» প্রক্রিয়া করার সুযোগ দেয়[11]।
- Switch Transformer: T5-এর একটি স্কেলযোগ্য সংস্করণ যা Mixture-of-Experts (MoE) আর্কিটেকচার চালু করেছে, যা যুক্তিসঙ্গত গণনামূলক খরচ বজায় রেখে প্যারামিটারের সংখ্যা ট্রিলিয়নে বাড়ানোর সুযোগ দিয়েছে[12]।
- FLAN-T5: এটি কোনো নতুন আর্কিটেকচার নয়, বরং এটি স্ট্যান্ডার্ড T5 যা নির্দেশনা আকারে প্রণীত (instruction tuning) শত শত কাজের উপর অতিরিক্ত fine-tuning পর্যায়ের মধ্য দিয়ে গেছে। এটি zero-shot মোডে (উদাহরণ ছাড়া) নতুন, অদেখা কাজে সাধারণীকরণের ক্ষমতা উল্লেখযোগ্যভাবে বৃদ্ধি করেছে[13]।
- UL2: T5-এর ধারণাগুলো বিকশিত করা একটি মডেল, যা Mixture of Denoisers নামক একটি নতুন প্রি-ট্রেনিং অবজেক্টিভ ব্যবহার করে, সার্বজনীনতা উন্নত করতে বিভিন্ন টেক্সট মাস্কিং স্কিম একত্রিত করে[14]।
তথ্যসূত্র
- GitHub-এ T5-এর অফিসিয়াল রিপোজিটরি
- T5 গবেষণা সম্পর্কে Google Research ব্লগের নিবন্ধ
সাহিত্য
- Vaswani, A. et al. (2017). Attention Is All You Need. arXiv:1706.03762.
- Raffel, C. et al. (2020). Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer. arXiv:1910.10683.
- Xue, L. et al. (2021). mT5: A Massively Multilingual Pre-trained Text-to-Text Transformer. arXiv:2010.11934.
- Dodge, J. et al. (2021). Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus. arXiv:2104.08758.
- Fedus, W. et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Ni, J. et al. (2021). Sentence-T5: Scalable Sentence Encoders from Pre-trained Text-to-Text Models. arXiv:2108.08877.
- Guo, M. et al. (2021). LongT5: Efficient Text-To-Text Transformer for Long Sequences. arXiv:2112.07916.
- Xue, L. et al. (2022). ByT5: Towards a Token-Free Future with Pre-trained Byte-to-Byte Models. arXiv:2105.13626.
- Tay, Y. et al. (2022). UL2: Unifying Language Learning Paradigms. arXiv:2205.05131.
- Chung, H. W. et al. (2022). Scaling Instruction-Finetuned Language Models. arXiv:2210.11416.
- Longpre, S. et al. (2023). The Flan Collection: Designing Data and Methods for Effective Instruction Tuning. arXiv:2301.13688.
টীকা
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 Raffel, Colin; Shazeer, Noam; Roberts, Adam; et al. «Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer». Journal of Machine Learning Research. [১]
- ↑ 2.0 2.1 2.2 2.3 «Exploring Transfer Learning with T5: the Text-To-Text Transfer Transformer». Google Research Blog. [২]
- ↑ «A Detailed Look At Google's T5 Model in NLP». DhiWise Blog. [৩]
- ↑ «T5 (Text-to-Text Transfer Transformer)». GeeksforGeeks. [৪]
- ↑ «T5». Hugging Face Transformers Documentation. [৫]
- ↑ «T5 (language model)». In Wikipedia. [৬]
- ↑ «C4 Dataset». Papers With Code. [৭]
- ↑ 8.0 8.1 Dodge, J.; Sap, M.; Marasović, A.; et al. «Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus». arXiv. [৮]
- ↑ «Google T5 algorithm scores 88.9 on SuperGLUE languge benchmark, compared to 89.8 human baseline». Reddit, r/linguistics. [৯]
- ↑ Xue, Linting; Constant, Noah; Roberts, Adam; et al. «mT5: A massively multilingual pre-trained text-to-text transformer». arXiv. [১০]
- ↑ Xue, Linting; Barua, Aditya; Constant, Noah; et al. «ByT5: Towards a token-free future with pre-trained byte-to-byte models». arXiv. [১১]
- ↑ Fedus, William; Zoph, Barret; Shazeer, Noam. «Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity». arXiv. [১২]
- ↑ Chung, Hyung Won; et al. «Scaling Instruction-Finetuned Language Models». arXiv. [১৩]
- ↑ Tay, Yi; Dehghani, Mostafa; Tran, Vinh; et al. «UL2: Unifying Language Learning Paradigms». arXiv. [১৪]