Reinforcement learning from human feedback (RLHF) (BN)

From Systems analysis wiki
Jump to navigation Jump to search

মানব প্রতিক্রিয়া থেকে শক্তিবর্ধন শিক্ষণ (Reinforcement Learning from Human Feedback, RLHF) — এটি একটি Machine Learning পদ্ধতি, যেখানে প্রথমে মানুষের প্রতিক্রিয়ার উপর ভিত্তি করে একটি বিশেষ «পুরস্কার মডেল» (reward model) প্রশিক্ষিত করা হয়, এরপর সেটি একটি বুদ্ধিমান এজেন্টের আচরণ অপ্টিমাইজ করতে Reinforcement Learning (RL) প্রক্রিয়ায় ব্যবহার করা হয়[1]

RLHF জটিল বা সংজ্ঞায়িত করা কঠিন লক্ষ্যগুলিকে (যেমন «উপকারী», «নিরাপদ» বা «মজাদার» উত্তর) মানুষের মূল্যায়নের মাধ্যমে আনুষ্ঠানিকভাবে প্রকাশ করতে দেয়। জটিল পুরস্কার ফাংশন হাতে নির্ধারণ করার পরিবর্তে, RLHF সরাসরি মানব পছন্দের উপর ভিত্তি করে reward model প্রশিক্ষণ করার সুযোগ দেয়। এই পদ্ধতিটি বড় ভাষা মডেলের (LLM) «alignment» অর্থাৎ মানবিক মূল্যবোধ ও অভিপ্রায়ের সাথে তাদের আচরণ সামঞ্জস্য করার ক্ষেত্রে মূল ভূমিকা পালন করেছে[2]

পদ্ধতির বিকাশ ও প্রথম অর্জন

মানব প্রতিক্রিয়া ব্যবহার করে এজেন্ট প্রশিক্ষণের ধারণাটি ২০১০-এর দশকে উদ্ভব হয়। প্রথম উল্লেখযোগ্য ফলাফলগুলির মধ্যে একটি হলো ২০১৭ সালে OpenAI ও DeepMind-এর Paul Christiano ও সহকর্মীদের গবেষণা। তারা দেখিয়েছিলেন যে জটিল RL কাজে মানব পছন্দ হাতে নির্ধারিত পুরস্কার ফাংশন প্রতিস্থাপন করতে পারে। তাদের পরীক্ষায় একজন মানুষ এজেন্টের আচরণের অংশবিশেষ (যেমন Atari গেমে) দেখতেন এবং আরও পছন্দনীয় বিকল্পটি বেছে নিতেন। এই জোড়া তুলনার উপর ভিত্তি করে একটি reward model প্রশিক্ষিত হয়েছিল, যা এজেন্টের মাত্র ১%-এরও কম ক্রিয়ার উপর প্রতিক্রিয়া পেয়ে বেশ কিছু জটিল সমস্যা সফলভাবে সমাধান করতে সক্ষম হয়েছিল[3]

পরবর্তী বছরগুলিতে পদ্ধতিটি ভাষা মডেল প্রশিক্ষণে প্রয়োগ শুরু হয়। ২০২০ সালে OpenAI-এর গবেষকরা প্রথমবার RLHF পাঠ্য সারসংক্ষেপ কাজে প্রয়োগ করেন। তারা এমন একটি reward model প্রশিক্ষিত করেন যা পূর্বাভাস দিতে পারে কোন সারসংক্ষেপটি মানুষ পছন্দ করবে, এবং RL ব্যবহার করে এই মূল্যায়ন অপ্টিমাইজ করতে মডেলটিকে fine-tuning করেন। ফলাফলে সারসংক্ষেপের মান উল্লেখযোগ্যভাবে উন্নত হয়েছিল, এমনকি মানব রেফারেন্স উদাহরণে প্রশিক্ষিত মডেলগুলিকেও ছাড়িয়ে গিয়েছিল[4]

বড় ভাষা মডেলে RLHF

বড় ভাষা মডেলগুলি RLHF প্রয়োগের মাধ্যমে উপযোগিতা, নির্ভুলতা এবং নির্দেশনা মেনে চলার দিক থেকে উল্লেখযোগ্য উপকার পেয়েছে।

InstructGPT এবং ChatGPT

একটি মূল পদক্ষেপ ছিল OpenAI-এর গবেষণা, যা InstructGPT (২০২২) মডেল উপস্থাপন করেছিল — GPT-3-এর এমন সংস্করণ যা মানব অংশগ্রহণে fine-tuning করা হয়েছিল[5]। পদ্ধতিটি তিনটি ধাপে বিভক্ত ছিল:

  1. Supervised Fine-Tuning (SFT): মডেলটি উচ্চমানের ডেমোনস্ট্রেশনের একটি ছোট সেটে fine-tuning করা হয়, যেখানে মানব মূল্যায়নকারীরা বিভিন্ন অনুরোধের জন্য কাঙ্ক্ষিত উত্তরের উদাহরণ নিজেরা লেখেন।
  2. Reward Model প্রশিক্ষণ: অনেকগুলো অনুরোধের জন্য মডেলের একাধিক উত্তর তৈরি করা হয়। মানব মূল্যায়নকারীরা এই উত্তরগুলিকে সেরা থেকে সবচেয়ে খারাপ ক্রমে সাজান। এই পছন্দের ডেটার উপর ভিত্তি করে একটি reward model প্রশিক্ষিত হয়, যা মানুষের পছন্দের উত্তরগুলিকে উচ্চতর স্কোর দিতে শেখে।
  3. RL দিয়ে অপ্টিমাইজেশন: মূল ভাষা মডেলটিকে Proximal Policy Optimization (PPO) অ্যালগরিদম ব্যবহার করে fine-tuning করা হয় যাতে reward model-এর দেওয়া স্কোর সর্বাধিক হয়। অপ্টিমাইজেশন প্রক্রিয়ায় মূল SFT মডেল থেকে বেশি বিচ্যুতির জন্য জরিমানাও আরোপ করা হয়, যাতে ভাষাগত সক্ষমতার অবনতি রোধ করা যায়।

পরীক্ষায় দেখা গেছে যে অপেক্ষাকৃত ছোট InstructGPT মডেলটিও (১.৩ বিলিয়ন প্যারামিটার) উপযোগিতার দিক থেকে বিশাল GPT-3 মডেলকে (১৭৫ বিলিয়ন প্যারামিটার) ছাড়িয়ে গেছে। InstructGPT মডেলগুলি বিষাক্ত, পক্ষপাতদুষ্ট বা অবিশ্বাসযোগ্য বিষয়বস্তু উৎপাদন অনেক কমিয়ে এনেছে[5]

এই ধারার বিকাশের ফলে কথোপকথন মডেল তৈরি হয়, যার মধ্যে সবচেয়ে পরিচিত হলো ChatGPT (OpenAI, ২০২২ সালের শেষে)। ChatGPT হলো GPT-3.5 সিরিজের একটি মডেল, যা একই পদ্ধতিতে RLHF ব্যবহার করে কথোপকথনের জন্য বিশেষভাবে fine-tuning করা হয়েছে[6]

শিল্পে গ্রহণযোগ্যতা

RLHF পদ্ধতি অন্যান্য শীর্ষস্থানীয় প্রতিষ্ঠানেও গৃহীত হয়েছে। DeepMind Sparrow (২০২২) নামক একটি কথোপকথন এজেন্ট তৈরি করেছিল, যা প্রাকৃতিক ভাষায় নিয়মের একটি সেট (যেমন «বিপজ্জনক পরামর্শ দেবেন না») যুক্ত করে RLHF দিয়ে প্রশিক্ষিত হয়েছিল[7]। Anthropic কোম্পানিও তার মডেলগুলি প্রশিক্ষণে একই নীতি ব্যবহার করেছে। ২০২৩ সালের মধ্যে RLHF সবচেয়ে অত্যাধুনিক ভাষা মডেল তৈরিতে প্রায় একটি আদর্শ উপাদান হয়ে উঠেছে[1]

RLHF প্রয়োগের সুবিধা

  • ব্যবহারকারীর অভিপ্রায়ের সাথে সামঞ্জস্য: RLHF-tuned মডেলগুলি নির্দেশনা অনেক ভালোভাবে অনুসরণ করে এবং আরও প্রাসঙ্গিক ও উপকারী উত্তর দেয়[5]
  • বিষাক্ততা ও ক্ষতিকর বিষয়বস্তু হ্রাস: প্রশিক্ষণ চক্রে মানুষকে অন্তর্ভুক্ত করা অবাঞ্ছিত উত্তরের ধরনগুলিকে স্পষ্টভাবে শাস্তি দেওয়া সম্ভব করে। ফলে RLHF মডেলগুলি অনেক কম বিষাক্ত ও পক্ষপাতদুষ্ট বিষয়বস্তু তৈরি করে[5]
  • সত্যতার উন্নতি ও «hallucination» হ্রাস: মূল্যায়নকারীরা কাল্পনিক তথ্যসহ উত্তরের রেটিং কমাতে পারেন, মডেলকে আরও নির্ভুল হতে উৎসাহিত করে। InstructGPT ও ChatGPT মডেলগুলি তাদের পূর্বসূরিদের তুলনায় কম তথ্য «উদ্ভাবন» করে[5]
  • প্রশিক্ষণের দক্ষতা: RLHF প্রশিক্ষণ ডেটাসেটের আনুপাতিক বৃদ্ধি ছাড়াই মডেলের মান উন্নত করতে দেয়। বিশাল ডেটার পরিমাণের প্রয়োজন নেই, বরং মানসম্পন্ন পছন্দের মূল্যায়নই যথেষ্ট।

সীমাবদ্ধতা ও সমস্যা

সাফল্য সত্ত্বেও RLHF পদ্ধতির বেশ কিছু সীমাবদ্ধতা ও অমীমাংসিত সমস্যা রয়েছে।

  • মানব ডেটা সংগ্রহের মান ও ব্যয়: RLHF-এর কার্যকারিতা সরাসরি প্রতিক্রিয়ার মানের উপর নির্ভরশীল। এই ধরনের dataset সংগ্রহ একটি শ্রমসাধ্য ও ব্যয়বহুল প্রক্রিয়া। তদুপরি, মূল্যায়নকারীদের নির্বাচন বা তাদের মানদণ্ড পক্ষপাতদুষ্ট হলে মডেলটি সেই পক্ষপাত উত্তরাধিকার সূত্রে পেতে পারে[2]
  • «Reward Hacking»-এর ঝুঁকি: একটি নির্দিষ্ট পুরস্কার ফাংশনের জন্য অপ্টিমাইজ করা মডেল প্রকৃত লক্ষ্যের পরিবর্তে সেই ফাংশনের সাথে খাপ খাইয়ে নিতে শুরু করতে পারে। উদাহরণস্বরূপ, মূল্যায়নকারীরা দৈর্ঘ্যকে মূল্য দিলে এটি সর্বাধিক দীর্ঘ উত্তর দিতে শিখতে পারে, অথবা অনির্ভুলতার জন্য শাস্তি পেলে দাবি এড়িয়ে চলতে পারে।
  • সত্যতার কোনো গ্যারান্টি নেই: RLHF মডেলে নতুন বাস্তব জ্ঞান প্রবেশ করায় না, বরং কেবল মানুষের পছন্দনীয় উত্তরের রূপ শেখায়। তাই hallucination সমস্যা সম্পূর্ণরূপে সমাধান হয় না। মডেলটি অনিশ্চয়তা লুকাতে ভালো শিখতে পারে, কিন্তু সবসময় তথ্য যাচাই করতে পারবে না[6]
  • পছন্দের মাপযোগ্যতা: reward model-কে অন্যান্য কাজে স্থানান্তরের বিষয়টিও প্রশ্ন তোলে। একটি নির্দিষ্ট অনুরোধ সেটের পছন্দের উপর প্রশিক্ষিত মডেল নতুন শৈলী বা বিষয়ের কাজের মুখোমুখি হলে অপ্রত্যাশিতভাবে কাজ করতে পারে।

উপসংহার

RLHF বড় ভাষা মডেলকে ভালো উত্তর সম্পর্কে মানবিক ধারণার সাথে «alignment» করার একটি গুরুত্বপূর্ণ পদ্ধতি হিসেবে প্রতিষ্ঠিত হয়েছে। এটি AI সহকারীদের সাথে মিথস্ক্রিয়ার মান উল্লেখযোগ্যভাবে উন্নত করতে সক্ষম হয়েছে, তাদের উত্তরগুলিকে আরও উপকারী ও নিরাপদ করে তুলেছে। RLHF-কে এমন মডেল তৈরির পথে একটি মূল হাতিয়ার হিসেবে দেখা হচ্ছে যা কেবল বিশ্বাসযোগ্য পাঠ্য তৈরি করতে পারে না, বরং যোগাযোগের সময় মানবিক মূল্যবোধ, পছন্দ ও অভিপ্রায়কেও বিবেচনায় নিতে পারে[8]

তথ্যসূত্র

  • নির্দেশনা অনুসরণের জন্য মডেল fine-tuning বিষয়ে OpenAI-এর নিবন্ধ
  • IBM-এর RLHF পর্যালোচনা

সাহিত্য

  • Christiano, P. et al. (2017). Deep Reinforcement Learning from Human Preferences. arXiv:1706.03741.
  • Stiennon, N. et al. (2020). Learning to Summarize from Human Feedback. arXiv:2009.01325.
  • Nakano, R. et al. (2021). WebGPT: Browser-Assisted Question-Answering with Human Feedback. arXiv:2112.09332.
  • Ouyang, L. et al. (2022). Training Language Models to Follow Instructions with Human Feedback. arXiv:2203.02155.
  • Glaese, A. et al. (2022). Improving Alignment of Dialogue Agents via Targeted Human Judgements. arXiv:2209.14375.
  • Bai, Y. et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
  • Lee, H. et al. (2023). RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback. arXiv:2309.00267.
  • Liu, T. et al. (2023). A Survey of Reinforcement Learning from Human Feedback. arXiv:2312.14925.
  • Zhang, Y. et al. (2024). A Survey on Human Preference Learning for Large Language Models. arXiv:2406.11191.
  • Li, P. et al. (2024). Advancing Translation Preference Modeling with RLHF. arXiv:2402.11525.
  • McAleese, N. et al. (2024). LLM Critics Help Catch LLM Bugs. arXiv:2407.00215.

টীকা

  1. 1.0 1.1 «What Is Reinforcement Learning From Human Feedback (RLHF)?». IBM. [১]
  2. 2.0 2.1 «Reinforcement learning from human feedback». In Wikipedia. [২]
  3. Christiano, P. et al. «Deep reinforcement learning from human preferences». arXiv:1706.03741, 2017. [৩]
  4. Stiennon, N. et al. «Learning to summarize from human feedback». arXiv:2009.01325, 2020. [৪]
  5. 5.0 5.1 5.2 5.3 5.4 Ouyang, L. et al. «Training language models to follow instructions with human feedback». arXiv:2203.02155, 2022. [৫]
  6. 6.0 6.1 «Introducing ChatGPT». OpenAI, 2022. [৬]
  7. Glaese, A. et al. «Improving alignment of dialogue agents via targeted human judgements». arXiv:2209.14375, 2022. [৭]
  8. «Aligning language models to follow instructions». OpenAI. [৮]