Gemini (Google) (BN)

From Systems analysis wiki
Jump to navigation Jump to search

Google Gemini — এটি Google DeepMind গবেষণা বিভাগ কর্তৃক উন্নয়নাধীন মাল্টিমোডাল বৃহৎ ভাষা মডেলের (LLM) একটি পরিবার। ২০২৩ সালের ডিসেম্বরে প্রথম উপস্থাপিত Gemini মডেলগুলি নিউরাল নেটওয়ার্ক Transformer আর্কিটেকচারের উপর নির্মিত, যা টেক্সট, ছবি, অডিও, ভিডিও এবং প্রোগ্রাম কোডসহ বিভিন্ন মোডালিটির ডেটা প্রক্রিয়াকরণ ও জেনারেশনের জন্য নেটিভ সাপোর্ট সহ তৈরি।

২০২৬ সালের ফেব্রুয়ারি পর্যন্ত বর্তমান প্রজন্ম হলো Gemini 3.x লাইনআপ। আর্কিটেকচারের বিকাশ inference-time scaling প্রক্রিয়ার মাধ্যমে মাপযোগ্য যৌক্তিক অনুমানের প্রক্রিয়া একীভূত করা এবং স্বায়ত্তশাসিত এজেন্টিক সিস্টেমে (Agentic AI) ব্যবহারের জন্য মডেল অপ্টিমাইজেশনের দিকে পরিচালিত। Gemini অ্যাপ্লিকেশনটিতে মাসিক ৭৫ কোটিরও বেশি সক্রিয় ব্যবহারকারী রয়েছেন।

নামকরণ ও দর্শন

"Gemini" নামটি (লাতিন থেকে — যমজ) Google-এর দুটি শীর্ষস্থানীয় গবেষণা দল — Google Brain এবং DeepMind — এর মিলনকে প্রতীকী করে, যারা এই প্রকল্পটি তৈরি করেছে। Google DeepMind-এর সহ-প্রযুক্তি প্রধান জেফ ডিন একটি সরকারি ব্লগে (মে ২০২৪) এটি নিশ্চিত করেছেন: «The twins here are the folks in the legacy Brain team and the legacy DeepMind team»। প্রকল্পটির মূল কোডনেম ছিল «Titan»; «Gemini» নামটি ডিন ২০২৩ সালের এপ্রিলে প্রস্তাব করেছিলেন — ঠিক সেই মাসে যখন Google Brain এবং DeepMind আনুষ্ঠানিকভাবে একীভূত হয়। নামটি NASA-র «জেমিনি» মহাকাশ কর্মসূচির (১৯৬৫–১৯৬৮) প্রতিও ইঙ্গিত করে, যার «অ্যাপোলো» কর্মসূচির প্রস্তুতিতে ভূমিকা ডেভেলপমেন্ট দলের কাছে অনুরণন খুঁজে পেয়েছিল।

Gemini-এর মূল বৈশিষ্ট্য এবং দার্শনিক ভিত্তি হলো নেটিভ মাল্টিমোডালিটি। অনেক পূর্ববর্তী মডেলের বিপরীতে যেখানে মাল্টিমোডাল সক্ষমতা বিদ্যমান টেক্সট ভিত্তির উপর যুক্ত করা হয়েছিল, Gemini একই সাথে বিভিন্ন ধরনের তথ্য বোঝা, পরিচালনা এবং একত্রিত করার জন্য শূন্য থেকে ডিজাইন করা হয়েছিল। Gemini 1.0 প্রযুক্তি প্রতিবেদন (arXiv:2312.11805) নিশ্চিত করে যে মডেলটি «trained jointly across image, audio, video, and text data»। এটি মডেলটিকে কেবল মোডালিটিগুলির মধ্যে ডেটা রূপান্তর করতে নয়, বরং সেগুলির আরও গভীর, সামগ্রিক বোঝাপড়া গঠন করতে সক্ষম করে।

আর্কিটেকচার ও মূল প্রযুক্তি

Gemini মডেলের সাফল্য এবং সক্ষমতা বেশ কিছু মৌলিক আর্কিটেকচারাল সিদ্ধান্ত দ্বারা নির্ধারিত। Google Gemini-এর সমস্ত অভ্যন্তরীণ উপাদানের সম্পূর্ণ নিম্ন-স্তরের নকশা প্রকাশ করে না, তবে উন্মুক্ত উৎসগুলি আর্কিটেকচারের শ্রেণী নির্ধারণ করতে সক্ষম করে: ১.৫ এবং তার উপরের সমস্ত পরিবারের মডেল নেটিভ মাল্টিমোডাল সাপোর্ট সহ sparse mixture-of-experts transformer-based models (Gemini 2.5 Flash-এর model card দ্বারা নিশ্চিত)।

নেটিভ মাল্টিমোডাল আর্কিটেকচার

Gemini-এর আর্কিটেকচার early fusion ধারণার উপর ভিত্তি করে তৈরি। ছবির পিক্সেল প্যাচ, ভিডিওর সাময়িক ফ্রেম, অডিওগ্রাম এবং টেক্সট token একটি একীভূত latent স্থানে প্রজেক্ট করা হয়। Gemini 2.5 প্রযুক্তি প্রতিবেদন এই পদ্ধতিকে «Unified Multimodal Token Interleaving» হিসেবে বর্ণনা করে। যেহেতু বিভিন্ন মোডালিটির সমস্ত token একটি সাধারণ ক্রমে প্রক্রিয়া করা হয়, স্ট্যান্ডার্ড self-attention প্রক্রিয়াগুলি স্বাভাবিকভাবেই প্রতিটি স্তরে বিভিন্ন মোডালিটি থেকে ক্রস ডেটা ইন্টিগ্রেশন নিশ্চিত করে। শব্দ সংকেত সরাসরি অডিও waveform থেকে বিশেষায়িত এনকোডার দ্বারা প্রক্রিয়া করা হয়, যা শব্দগত বৈশিষ্ট্যগুলি (স্বর, কাঠ, পটভূমির শব্দ) সংরক্ষণ করে যা Speech-to-Text ট্রান্সক্রাইব সিস্টেম ব্যবহার করলে হারিয়ে যায়।

ট্রান্সফর্মার শ্রেণীর জন্য মৌলিক অপারেশন হলো attention প্রক্রিয়া:

Attention(Q,K,V)=softmax(QKdk)V

যেখানে Q — query ম্যাট্রিক্স, K — key, V — value, এবং dk — key-এর মাত্রা।

Sparse Mixture of Experts (Sparse MoE)

সংস্করণ ১.৫ থেকে Gemini মডেলগুলি Sparse Mixture-of-Experts (MoE) আর্কিটেকচার ব্যবহার করে। Gemini 1.0 একটি ঘন (dense) ট্রান্সফর্মার ব্যবহার করেছিল; MoE-তে রূপান্তর সরাসরি ১.৫ প্রযুক্তি প্রতিবেদনে বর্ণিত: «This is our first release from Gemini 1.5, a new family… which incorporates a novel mixture-of-experts architecture»।

MoE আর্কিটেকচারে স্ট্যান্ডার্ড সম্পূর্ণ-সংযুক্ত স্তরগুলি (Feed-Forward Networks) বিশেষায়িত সাবনেটওয়ার্কের একটি সেট — «বিশেষজ্ঞ» দ্বারা প্রতিস্থাপিত হয়। ইনপুট token xd-এর জন্য আউটপুট y সক্রিয় বিশেষজ্ঞদের (kE, যেখানে E — মোট বিশেষজ্ঞ সংখ্যা) আউটপুটের ওজনযুক্ত সমষ্টি k হিসেবে গঠিত হয়:

y=i𝒯k(x)gi(x)Ei(x)

যেখানে Ei(x)i-তম বিশেষজ্ঞের অরৈখিক ফাংশন, 𝒯k(x) — নির্বাচিত সাবনেটওয়ার্কের k সূচকের সেট, এবং রাউটিং ওজন gi(x) শীর্ষ k মানের উপর Softmax ফাংশন প্রয়োগ করে প্রশিক্ষিত রাউটিং ফাংশন (learned routing function) দ্বারা গণনা করা হয়।

এই পদ্ধতি গণনামূলক ব্যয় (FLOPs) কম রাখার পাশাপাশি মডেলের মোট প্যারামেট্রিক ক্ষমতা উল্লেখযোগ্যভাবে বৃদ্ধি করতে দেয়, কারণ প্রতিটি token-এর জন্য কেবল প্যারামেটারের একটি উপসেট সক্রিয় হয়। Google Gemini মডেলের প্রকৃত প্যারামিটার সংখ্যা প্রকাশ করেনি।

দীর্ঘ প্রসঙ্গ এবং «প্রসঙ্গে শিক্ষণ»

Gemini 1.5 production মোডে ১ মিলিয়ন token পর্যন্ত কনটেক্সট উইন্ডো বৃদ্ধি করে (১০ মিলিয়ন token পর্যন্ত পরীক্ষামূলক পরীক্ষণ সহ) একটি সাফল্য অর্জন করেছিল। এটি পূর্ববর্তী মডেলের তুলনায় এক মাত্রা বেশি (যেমন, GPT-4 Turbo ১২৮ হাজার token সহ)। Google ১ মিলিয়ন token কনটেক্সট দৈর্ঘ্যে Needle In A Haystack পরীক্ষায় ৯৯% ফলাফলের দাবি করেছে। পরবর্তী প্রজন্মের জন্য long context লাইনআপের অন্যতম মূল বৈশিষ্ট্য হিসেবে প্রতিষ্ঠিত হয়েছে। এত বড় কনটেক্সট মডেলটিকে সক্ষম করে:

  • একটি একক অনুরোধের মধ্যে সম্পূর্ণ বই, কয়েক ঘণ্টার ভিডিও (৩ ঘণ্টা পর্যন্ত) বা বড় কোডবেস বিশ্লেষণ করা।
  • prompt-এ প্রদত্ত বিশাল পরিমাণ ডেটায় in-context learning সম্পাদন করা, যা fine-tuning প্রয়োজন ছাড়াই অত্যন্ত কাস্টমাইজড উত্তর পেতে দেয়।

«চিন্তাশীল মডেল» এবং inference-time computation scaling

Gemini 2.5 থেকে শুরু করে Google thinking-কে মডেলের কার্যক্রমের একটি পৃথক মোড হিসেবে চিহ্নিত করে। অফিসিয়াল ডকুমেন্টেশন এটিকে একটি অভ্যন্তরীণ কম্পিউটেশনাল প্রক্রিয়া হিসেবে সংজ্ঞায়িত করে যা বহু-ধাপ পরিকল্পনা এবং যুক্তি উন্নত করে। ২.৫ সংস্করণের মডেলগুলি ("thinking models" হিসেবে বর্ণিত) চূড়ান্ত উত্তর দেওয়ার আগে অভ্যন্তরীণভাবে মধ্যবর্তী যুক্তির ধাপ তৈরি ও মূল্যায়ন করতে সক্ষম। এটি জটিল যৌক্তিক এবং গাণিতিক সমস্যায় উল্লেখযোগ্যভাবে নির্ভুলতা বাড়ায়।

দুটি প্রক্রিয়া আলাদা করা গুরুত্বপূর্ণ:

  • বিল্ট-ইন thinking: ২.৫ এবং ৩-সিরিজের মডেলের জন্য বেস মোড, একটি লুকানো Chain-of-Thought তৈরি করে। API thought summaries ফেরত দিতে পারে — অভ্যন্তরীণ যুক্তির সংক্ষিপ্ত সারসংক্ষেপ, «কাঁচা চিন্তার» সম্পূর্ণ প্রবাহ নয়। মডেল 3.1 Pro থেকে শুরু করে, thinking বাজেট Low থেকে Max পর্যন্ত মানসহ thinking_level প্যারামিটার দ্বারা নিয়ন্ত্রিত হয়।
  • Deep Think: একটি পৃথক পরীক্ষামূলক বিস্তারিত যুক্তি মোড, সমান্তরাল হাইপোথিসিস জেনারেশন ব্যবহার করে এবং উল্লেখযোগ্যভাবে বেশি গণনামূলক সম্পদ প্রয়োজন। ২০২৫ সালের ২০ মে Google I/O-তে ঘোষণা করা হয়েছিল এবং ২০২৫ সালের ১ আগস্ট AI Ultra সদস্যদের জন্য উন্মুক্ত করা হয়েছিল। Deep Think-কে মৌলিক thinking প্রক্রিয়ার সাথে একীভূত করা উচিত নয়।

Agentic Capabilities

সংস্করণ ২.০ থেকে Gemini বাইরের বিশ্বের সাথে যোগাযোগ করতে পারে: সরঞ্জাম কল করা, Google-এ অনুসন্ধান করা, কোড চালানো এবং UI উপাদান পরিচালনা করা। Google সরাসরি Gemini 2.0-কে নেটিভ tool use সাপোর্ট সহ «নতুন agentic era»-র মডেল হিসেবে অবস্থান দিয়েছে।

২০২৬ সালের ফেব্রুয়ারি নাগাদ Gemini API-তে সরঞ্জাম সাপোর্ট সহ আনুষ্ঠানিকভাবে নির্ধারিত এজেন্টিক সক্ষমতার একটি স্তর রয়েছে: Google Search, Google Maps, Code Execution, URL Context, Computer Use, File Search, এবং রিয়েল-টাইম দ্বিমুখী মিথস্ক্রিয়ার জন্য Live API

Gemini মডেলের বিবর্তন

Gemini পরিবার অত্যন্ত দ্রুত গতিতে বিকশিত হচ্ছে: ২০২৩ সালের ডিসেম্বর থেকে ২০২৬ সালের ফেব্রুয়ারি পর্যন্ত চারটি প্রধান প্রজন্মের মডেল প্রকাশিত হয়েছে।

Gemini 1.0 (ডিসেম্বর ২০২৩)

প্রথম প্রজন্ম, যা নেটিভ মাল্টিমোডালিটির ভিত্তি স্থাপন করেছে। ২০২৩ সালের ৬ ডিসেম্বর সর্বসাধারণের সামনে উপস্থাপন করা হয়েছিল।

  • সংস্করণ: Ultra (সবচেয়ে জটিল কাজের জন্য ফ্ল্যাগশিপ), Pro (সর্বজনীন মডেল) এবং Nano (মোবাইল ডিভাইসের জন্য কম্প্যাক্ট; Nano-1 ১.৮ বিলিয়ন প্যারামিটার এবং Nano-2 ৩.২৫ বিলিয়ন প্যারামিটারে বিভক্ত)।
  • কনটেক্সট উইন্ডো: সমস্ত সংস্করণের জন্য ৩২ ৭৬৮ token
  • অর্জন: Gemini 1.0 Ultra CoT@32 কৌশল (৩২টি নমুনা এবং সংখ্যাগরিষ্ঠ ভোটিং সহ Chain-of-Thought) ব্যবহার করে MMLU benchmark-এ ৯০.০৪% ফলাফল সহ বিশেষজ্ঞ মানব স্তর অর্জন ও অতিক্রম করা প্রথম মডেল হয়েছে (স্ট্যান্ডার্ড 5-shot prompting-এ ফলাফল প্রায় ৮৩.৭%)। ৩২টি একাডেমিক benchmark-এর মধ্যে ৩০টিতে SOTA ফলাফল দেখিয়েছে।
  • সাপোর্ট বন্ধ: Gemini 1.0 Pro ২০২৫ সালের ১৮ ফেব্রুয়ারি পুরনো হিসেবে ঘোষণা করা হয়েছিল।

Gemini 1.5 (ফেব্রুয়ারি — মে ২০২৪)

কনটেক্সট দৈর্ঘ্য এবং দক্ষতায় অগ্রগতি।

  • আর্কিটেকচার: ঘন ট্রান্সফর্মার থেকে Mixture-of-Experts (MoE)-তে রূপান্তর।
  • কনটেক্সট উইন্ডো: production-এ ১ মিলিয়ন token পর্যন্ত (১.৫ Pro-এর জন্য ২ মিলিয়ন — waitlist-এ, ২০২৪ সালের মে মাসে Google I/O-তে ঘোষণা করা হয়েছিল)।
  • সংস্করণ: 1.5 Pro (২০২৪ সালের ফেব্রুয়ারিতে ঘোষণা; উল্লেখযোগ্যভাবে কম খরচে 1.0 Ultra স্তরের গুণমান সহ) এবং 1.5 Flash (হালকা ও দ্রুত সংস্করণ, ২০২৪ সালের মে মাসে যুক্ত করা হয়েছে)।
  • সাপোর্ট বন্ধ: সমস্ত Gemini 1.5 মডেল (Pro, Flash, Flash-8B) ২০২৫ সালের ২৯ সেপ্টেম্বর পরিষেবা থেকে প্রত্যাহার করা হয়েছিল।

Gemini 2.0 (ডিসেম্বর ২০২৪ — ফেব্রুয়ারি ২০২৫)

«Agentic era»-তে রূপান্তর।

  • সময়রেখা: ২০২৪ সালের ১১ ডিসেম্বর — 2.0 Flash Experimental ঘোষণা (মাল্টিমোডাল ইনপুট, টেক্সট আউটপুট); ২০২৫ সালের ৫ ফেব্রুয়ারি — 2.0 Flash-এর ব্যাপক উপলব্ধতা (GA), 2.0 Pro Experimental এবং 2.0 Flash-Lite প্রকাশ।
  • মূল উদ্ভাবন: বিল্ট-ইন এজেন্টিক সক্ষমতা (tool use), নেটিভ ইমেজ এবং অডিও জেনারেশন (প্রাথমিকভাবে early-access অংশীদারদের জন্য সীমিত মোডে), এজেন্টিক পরিস্থিতিতে ফোকাস।
  • কনটেক্সট উইন্ডো: ২ মিলিয়ন token পর্যন্ত (2.0 Pro); ১ মিলিয়ন token পর্যন্ত (2.0 Flash-Lite)।
  • সাপোর্ট বন্ধ: 2.0 Flash এবং Flash-Lite মডেলগুলি ২০২৬ সালের ১ জুন পরিষেবা থেকে প্রত্যাহারের পরিকল্পনা করা হয়েছে।

Gemini 2.5 (মার্চ — জুন ২০২৫)

কাস্টমাইজযোগ্য যুক্তি বাজেট সহ প্রথম «thinking model»।

  • সময়রেখা: ২০২৫ সালের ২৫ মার্চ — 2.5 Pro Experimental ঘোষণা; ১৭ এপ্রিল — 2.5 Flash (পরিবর্তযোগ্য thinking মোড সহ প্রথম সম্পূর্ণ হাইব্রিড reasoning মডেল); ২০ মে (Google I/O) — 2.5 Pro এবং Flash আপডেট, Deep Think ঘোষণা; ২০২৫ সালের ১৭ জুন — 2.5 Pro এবং 2.5 Flash উভয়ের জন্য একযোগে GA; একই দিনে — 2.5 Flash-Lite প্রিভিউ (GA ২২ জুলাই)। ১ আগস্ট — Deep Think AI Ultra সদস্যদের জন্য উন্মুক্ত।
  • মূল উদ্ভাবন: কাস্টমাইজযোগ্য বাজেট সহ বিল্ট-ইন thinking প্রক্রিয়া; পৃথক বিস্তারিত মোড হিসেবে Deep Think। জটিল গাণিতিক, যৌক্তিক এবং প্রোগ্রামিং benchmark-এ SOTA ফলাফল (AIME 2025 — ৮৬.৭%, GPQA Diamond — ৮৪.০%, Humanity's Last Exam — ১৮.৮% সরঞ্জাম ছাড়া)।
  • কনটেক্সট উইন্ডো: ইনপুটে ১ মিলিয়ন token, আউটপুটে ৬৪ ০০০ token পর্যন্ত। 2.5 Pro-এর জন্য ২ মিলিয়ন token পর্যন্ত প্রতিশ্রুত বিস্তার মডেলের জীবনচক্র জুড়ে বাস্তবায়িত হিসেবে নিশ্চিত করা হয়নি।
  • বিশেষায়িত ভেরিয়েন্ট: Gemini 2.5 Flash Image (কোডনেম «Nano Banana», ১২ আগস্ট Arena-তে বেনামে আবির্ভূত হয়েছিল, ২৬ আগস্ট ২০২৫ আনুষ্ঠানিকভাবে প্রকাশিত — ফটোরিয়েলিস্টিক «৩D মূর্তি»-র কারণে ভাইরাল হয়েছিল, ১ কোটি নতুন ব্যবহারকারী আকৃষ্ট করেছিল); Computer Use Preview (৭ অক্টোবর ২০২৫, 2.5 Pro-এর উপর ভিত্তি করে); Text-to-Speech মডেল (2.5 Flash TTS, 2.5 Pro TTS)।
  • প্রযুক্তি প্রতিবেদন: সম্মিলিত Gemini 2.X প্রতিবেদন ৭ জুলাই ২০২৫ arXiv-এ প্রকাশিত (arXiv:2507.06261), ৩ ৩০০-এরও বেশি লেখক রয়েছেন এবং 2.5 Pro, 2.5 Flash, 2.0 Flash, 2.0 Flash-Lite মডেল অন্তর্ভুক্ত।

Gemini 3.x (নভেম্বর ২০২৫ — ফেব্রুয়ারি ২০২৬)

তৃতীয় প্রজন্ম মৌলিক জেনারেশন থেকে দীর্ঘমেয়াদী agentic workflows এবং আন্তঃবিভাগীয় বৈজ্ঞানিক সমস্যা সমাধানে রূপান্তর চিহ্নিত করেছে।

  • Gemini 3 Pro (১৮ নভেম্বর ২০২৫): Alphabet-এর সিইও সুন্দর পিচাই এবং DeepMind-এর প্রধান ডেমিস হাসাবিস কর্তৃক «Google-এর সবচেয়ে বুদ্ধিমান মডেল» হিসেবে ঘোষণা করা হয়েছে। লঞ্চের দিনে Google Search-এ মোতায়েন করা প্রথম Gemini মডেল। LMArena-তে ১৫০০ Elo রুবিকন অতিক্রম করা প্রথম মডেল হয়েছে (লঞ্চের সময় ১৫০১)। ফলাফল: GPQA Diamond — ৯১.৯%; SWE-bench Verified — ৭৬.২%; Humanity's Last Exam — ৩৭.৫% (সরঞ্জাম ছাড়া); SimpleQA — ৭২.১%।
  • Gemini 3 Flash (১৭ ডিসেম্বর ২০২৫): Gemini অ্যাপ্লিকেশনে ডিফল্ট মডেল হয়েছে। $০.৫০ / ১M ইনপুট token মূল্যে SWE-bench Verified-এ যুক্তি কাজে ৩০% কম token ব্যবহার করে 3 Pro (৭৮%)-কে ছাড়িয়ে গেছে। GPQA Diamond — ৯০.৪%; HLE — ৩৩.৭%।
  • Gemini 3.1 Pro (১৯ ফেব্রুয়ারি ২০২৬): প্রকাশনার তারিখে ফ্ল্যাগশিপ মডেল। প্রথম «ইনক্রিমেন্টাল» রিলিজ (পূর্ববর্তী .৫-এর পরিবর্তে .১)। মূল ফলাফল — ARC-AGI-2: ৭৭.১% (3 Pro-এর ৩১.১% থেকে দ্বিগুণেরও বেশি)। AIME 2025 — ৯১.২%; GPQA Diamond — ৯৪.৩%; SWE-bench Verified — ৮০.৬%। thinking_level প্যারামিটারের মাধ্যমে নতুন MEDIUM thinking স্তর চালু করা হয়েছে। bash-টার্মিনাল এবং ব্যবহারকারীর ফাংশনের সাথে কাজের জন্য বিশেষায়িত এন্ডপয়েন্ট gemini-3.1-pro-preview-customtools। দীর্ঘ জেনারেশনে আউটপুট ছেঁটে ফেলার সমস্যা সমাধান করা হয়েছে। চ্যানেল: Gemini App, Vertex AI, AI Studio, Gemini API, NotebookLM।
  • Gemini 3 Deep Think (১২ ফেব্রুয়ারি ২০২৬ আপডেট): বিশেষায়িত «thinking» মোডের বড় আপডেট। গণিত ও প্রোগ্রামিং ছাড়িয়ে গেছে: ২০২৫ সালের আন্তর্জাতিক পদার্থবিজ্ঞান অলিম্পিয়াড (IPhO) এবং রসায়ন অলিম্পিয়াডে (IChO) স্বর্ণপদক স্তরের ফলাফল; ARC-AGI-2 — ৮৪.৬%; Humanity's Last Exam — ৪৮.৪%; CMT-Benchmark (কনডেন্সড ম্যাটার পদার্থ তত্ত্ব) — ৫০.৫%; Codeforces Elo — ৩৪৫৫। Deep Think-এর উপর ভিত্তি করে গবেষণা এজেন্ট Aletheia তৈরি করা হয়েছে, যা Erdős ডেটাবেস থেকে বেশ কয়েকটি উন্মুক্ত সমস্যা স্বায়ত্তশাসিতভাবে সমাধান করেছে (Erdős-1051 সমস্যা সহ)।

Gemini প্রজন্মের সারসংক্ষেপ সারণী

Gemini মডেলের মূল বৈশিষ্ট্যের বিবর্তন
প্রজন্ম প্রকাশের বছর মূল সংস্করণ সর্বোচ্চ কনটেক্সট উইন্ডো মূল আর্কিটেকচারাল উদ্ভাবন ও উন্নতি
Gemini 1.0 ২০২৩ Ultra, Pro, Nano ৩২ ৭৬৮ token শূন্য থেকে নেটিভ মাল্টিমোডালিটি; ঘন ট্রান্সফর্মার; MMLU-তে মানব স্তরের উপরে (৯০.০৪% CoT@32)।
Gemini 1.5 ২০২৪ Pro, Flash ১ ০০০ ০০০ token (waitlist-এ ২ মিলিয়ন) Mixture-of-Experts (MoE) আর্কিটেকচার; কনটেক্সটের বিপ্লবী বৃদ্ধি; Needle In A Haystack-এ ৯৯%।
Gemini 2.0 ২০২৪–২০২৫ Pro, Flash, Flash-Lite ১ ০০০ ০০০ — ২ ০০০ ০০০ token «agentic AI» যুগ: সরঞ্জামের নেটিভ ইন্টিগ্রেশন, ইমেজ ও অডিও জেনারেশন, Live API।
Gemini 2.5 ২০২৫ Pro, Flash, Flash-Lite ১ ০০০ ০০০ token (ইনপুট), ৬৪ ০০০ (আউটপুট) «Thinking model»; কাস্টমাইজযোগ্য যুক্তি বাজেট; Deep Think; ইমেজ জেনারেশন (Nano Banana); Computer Use।
Gemini 3.x ২০২৫–২০২৬ 3 Pro, 3 Flash, 3.1 Pro, 3 Deep Think ১ ০০০ ০০০ token এজেন্টিক workflows; thinking_level প্যারামিটার; ARC-AGI-2 এবং বৈজ্ঞানিক অলিম্পিয়াডে অগ্রগতি; Aletheia।

মূল ফলাফল ও benchmark

ক্লাসিক benchmark-এর পরিপূর্ণতার (যেমন MMLU) কারণে Gemini মডেলের কার্যক্ষমতার মূল্যায়ন বিমূর্ত যুক্তি, বৈজ্ঞানিক মডেলিং এবং স্বায়ত্তশাসিত প্রোগ্রামিং কাজের দিকে সরে গেছে। ফলাফলগুলি Google-এর অফিসিয়াল ডেটা (self-reported) অনুযায়ী দেওয়া হয়েছে; সেগুলির তুলনা কেবল inference মোড, tool use-এর উপস্থিতি বা অনুপস্থিতি, স্যাম্পলিং পদ্ধতি (single-attempt বনাম majority voting) এবং নির্দিষ্ট model-id মিলে গেলে সঠিক।

মূল benchmark-এ Gemini মডেলের ফলাফল (ফেব্রুয়ারি ২০২৬ পর্যন্ত ডেটা)
Benchmark কাজের বিবরণ Gemini 2.5 Pro (জুন ২০২৫) Gemini 3 Pro (নভে. ২০২৫) Gemini 3.1 Pro (ফেব. ২০২৬) Gemini 3 Deep Think (ফেব. ২০২৬)
MMLU বহু-কার্য ভাষা বোঝাপড়া
GPQA Diamond PhD স্তরের বৈজ্ঞানিক প্রশ্ন ৮৪.০% ৯১.৯% ৯৪.৩% প্রযোজ্য নয়
Humanity's Last Exam অগ্রগামী বিষয়ভিত্তিক জ্ঞান ১৮.৮% ৩৭.৫% ৪৪.৪% ৪৮.৪%
ARC-AGI-2 বিমূর্ত যৌক্তিক ধাঁধা ৪.৯% ৩১.১% ৭৭.১% ৮৪.৬%
SWE-bench Verified GitHub রিপোজিটরিতে স্বায়ত্তশাসিত সমস্যা সমাধান ৬৩.৮%* ৭৬.২% ৮০.৬% প্রযোজ্য নয়
AIME 2025 অলিম্পিয়াড স্তরের গাণিতিক সমস্যা ৮৬.৭% ৯১.২%
Codeforces (Elo) প্রতিযোগিতামূলক প্রোগ্রামিং রেটিং ২৮৮৭ ৩৪৫৫

* SWE-bench-এ 2.5 Pro-এর ফলাফল custom agent setup দিয়ে প্রাপ্ত।

LMArena-তে অবস্থান (ফেব্রুয়ারি ২০২৬ শেষের স্ন্যাপশট)

LMArena (পূর্বে Chatbot Arena) — একটি স্বাধীন অন্ধ যুগল ভোটিং প্ল্যাটফর্ম। রেটিং গতিশীলভাবে পুনরায় গণনা করা হয়; মডেল লঞ্চের সময়ের মানগুলি বর্তমান মানগুলি থেকে আলাদা হতে পারে।

Overall (২৪ ফেব্রুয়ারি ২০২৬ স্ন্যাপশট)
মডেল রেটিং স্থান ভোট মন্তব্য
Gemini 3.1 Pro Preview 1500 ± 9 #3 4 060 Preliminary
Gemini 3 Pro 1486 ± 4 #5 37 854
Gemini 3 Flash 1473 ± 5 #7 28 847
Gemini 2.5 Pro 1464 ± 3 #9 97 296
Gemini 2.5 Flash 1411 ± 3 #64 96 163

২০২৫ সালের ১৮ নভেম্বর লঞ্চের সময় Gemini 3 Pro LMArena-তে ১৫০১ Elo রেটিং অর্জন করে, ১৫০০-এর রুবিকন অতিক্রম করা প্রথম মডেল হয়েছিল।

বিশেষায়িত ও এজেন্টিক সিস্টেম

Gemini ইকোসিস্টেম ডিজিটাল ও ভৌত পরিবেশে বহু-ধাপের কাজ সম্পাদন করতে সক্ষম মডেল ও প্ল্যাটফর্ম দ্বারা সমৃদ্ধ।

স্বায়ত্তশাসিত এজেন্ট

  • Jules — একটি স্বায়ত্তশাসিত কোডিং এজেন্ট, নিরাপদ ক্লাউড ভার্চুয়াল মেশিনে অ্যাসিঙ্ক্রোনাসভাবে কাজ করে। GitHub-এ শাখা এবং pull request তৈরি করে। ২০২৫ সালের ২০ মে Google I/O-তে ওপেন বেটায় প্রকাশিত হয়েছিল (বেটা পরীক্ষার সময় ১ লাখ ৪০ হাজারেরও বেশি কোড উন্নতি), GA — ২০২৫ সালের ৬ আগস্ট। ২০২৫ সালের শেষ নাগাদ Google-এর অভ্যন্তরীণ রিপোজিটরিতে অন্যতম বৃহত্তম অবদানকারী হয়ে ওঠে।
  • Project Mariner — বহু-ধাপের ওয়েব কাজের জন্য একটি গবেষণামূলক ব্রাউজার এজেন্ট প্রোটোটাইপ। ১০টি সমান্তরাল কাজ এবং «Teach & Repeat» ফিচার সাপোর্ট সহ ক্লাউড ভার্চুয়াল মেশিনে স্থানান্তরিত হয়েছে। WebVoyager benchmark-এ ৮৩.৫% অর্জন করেছে। Computer Use সক্ষমতা Gemini API-তে স্থানান্তরিত হয়েছে।
  • Google Antigravity — ২০২৫ সালের নভেম্বরে উপস্থাপিত AI এজেন্ট পরিচালনার জন্য একটি সমন্বিত উন্নয়ন পরিবেশ (IDE)। এজেন্টগুলি স্বায়ত্তশাসিতভাবে কোড পরিবর্তন করে, টার্মিনাল এবং বিল্ট-ইন ব্রাউজারের সাথে যোগাযোগ করে এবং ডেভেলপারের অনুমোদনের জন্য যাচাইযোগ্য আর্টিফ্যাক্ট (কোড ডিফ) ফেরত দেয়।
  • Aletheia এজেন্ট — Gemini 3 Deep Think-এর উপর ভিত্তি করে একটি বিশেষায়িত গাণিতিক গবেষণা এজেন্ট। প্রাকৃতিক ভাষা যাচাইকারী এবং সাহিত্য পর্যালোচনার জন্য ওয়েব অনুসন্ধান সরঞ্জাম দিয়ে সজ্জিত। ২০২৬ সালের শুরুতে Erdős ডেটাবেস থেকে বেশ কয়েকটি উন্মুক্ত গাণিতিক সমস্যা স্বায়ত্তশাসিতভাবে সমাধান করেছে এবং বৈজ্ঞানিক প্রকাশনায় সহ-লেখক হিসেবে অংশ নিয়েছে।

ভোক্তা AI এজেন্ট

  • Phone Automations — Android অপারেটিং সিস্টেম স্তরে স্বায়ত্তশাসিত এজেন্ট ইন্টিগ্রেশন (Pixel 10 এবং Samsung Galaxy S26-এর জন্য বেটা সংস্করণ)। একটি নিরাপদ বিচ্ছিন্ন পরিবেশে (secure sandbox) কাজ করে, GUI-এর দৃশ্যমান বিশ্লেষণের উপর ভিত্তি করে তৃতীয়-পক্ষের অ্যাপ্লিকেশনে নেভিগেট করতে সক্ষম।
  • Gemini in Chrome (Auto Browse) — বহু-ধাপের ওয়েব কাজ স্বয়ংক্রিয় করার জন্য একটি ব্রাউজার এজেন্ট, ২০২৫ সালের সেপ্টেম্বর থেকে সমস্ত Chrome ব্যবহারকারীদের জন্য উপলব্ধ (২০২৬ সালের জানুয়ারিতে Gemini 3-এ আপডেট করা হয়েছে)।

Computer Use

Gemini 2.5 Computer Use মডেলগুলি গ্রাফিকাল ব্যবহারকারী ইন্টারফেস (UI) পরিচালনার জন্য অপ্টিমাইজ করা হয়েছে। সিস্টেম স্ক্রিনশট এবং অ্যাকশন ইতিহাস ইনপুট হিসেবে নেয়, কার্সার সিমুলেশন এবং কীবোর্ড ইনপুট কমান্ডের জন্য (x,y) স্থানাঙ্ক তৈরি করে।

Gemini Robotics

২০২৫ সালের মার্চে উপস্থাপিত Vision-Language-Action (VLA) এবং Embodied Reasoning (ER) শ্রেণীর মডেল। এই আর্কিটেকচারগুলি স্থান-কালীন তথ্য প্রক্রিয়া করে এবং রোবটিক ম্যানিপুলেটরের গতিবিধির 3D ট্র্যাজেক্টরি নেটিভ আউটপুট মোডালিটি হিসেবে পূর্বাভাস দেয় (arXiv:2503.20020)।

বিশেষায়িত জেনারেটিভ মডেল (২০২৬ সালের শুরু)

  • Nano Banana 2 (Gemini 3.1 Flash Image) — ২০২৬ সালের ২৬ ফেব্রুয়ারি প্রকাশিত, একটি ভিজ্যুয়াল মডেল যা Flash আর্কিটেকচারের গতি এবং Pro-এর গুণমান একত্রিত করে। চরিত্রের পরিচিতির কঠোর সংরক্ষণ (character consistency), ছবির ভেতরে টাইপোগ্রাফির নেটিভ জেনারেশন এবং C2PA মেটাডেটা সহ SynthID ক্রিপ্টোগ্রাফিক ওয়াটারমার্কের ইন্টিগ্রেশন নিশ্চিত করে।
  • Lyria 3 — ২০২৬ সালের ১৮ ফেব্রুয়ারি Gemini অ্যাপ্লিকেশনে ইন্টিগ্রেট করা একটি সঙ্গীত মডেল। টেক্সট prompt, ফটোগ্রাফ বা ভিডিওর মাধ্যমে ৩০-সেকেন্ডের সঙ্গীত রচনা (ভোকাল ও ইন্সট্রুমেন্টাল সহ) তৈরি করে।
  • Veo 3.1 — একটি ভিডিও জেনারেশন মডেল। তিনটি পর্যন্ত রেফারেন্স ছবি ব্যবহার করে ক্লিপ তৈরি («Ingredients to Video»), নির্দিষ্ট প্রথম এবং শেষ ফ্রেমের মধ্যে ট্রানজিশন জেনারেশন, উল্লম্ব ভিডিওর (9:16) নেটিভ রেন্ডারিং এবং 4K রেজোলিউশনে আপস্কেলিং সমর্থন করে।
  • Med-Gemini — চিকিৎসা কাজের জন্য একটি ডোমেন-নির্দিষ্ট মডেল (arXiv:2404.18416, arXiv:2405.03162)।

প্রয়োগ ও ইকোসিস্টেম

Google তার ভোক্তা এবং ডেভেলপার পণ্যগুলিতে Gemini গভীরভাবে সংযুক্ত করছে।

ভোক্তা পণ্য

  • Gemini অ্যাপ্লিকেশন: একটি চ্যাটবট (পূর্বে Bard, ২০২৪ সালের ৮ ফেব্রুয়ারি পুনর্নামকরণ করা হয়েছে), সর্বজনীন AI সহায়ক হিসেবে Gemini পরিবারের মডেল ব্যবহার করছে। ২০২৬ সালের ফেব্রুয়ারি নাগাদ ৭৫ কোটিরও বেশি মাসিক সক্রিয় ব্যবহারকারী রয়েছে। বর্তমান rollout-এ 3.1 Pro মডেল অন্তর্ভুক্ত। সদস্যপদ: Google AI Pro ($১৯.৯৯/মাস, Google One AI Premium প্রতিস্থাপন করেছে) এবং Google AI Ultra ($২৪৯.৯৯/মাস, Deep Think, Veo 3 এবং অগ্রাধিকার ফিচারে প্রবেশাধিকার সহ)।
  • Google Workspace: টেক্সট লেখা, ডেটা বিশ্লেষণ এবং কনটেন্ট জেনারেশনে সহায়তার জন্য Gmail, Docs, Sheets, Meet-এ Gemini ইন্টিগ্রেশন (Duet AI থেকে পুনর্নামকরণ)।
  • Google অনুসন্ধান: AI Overviews ফিচার বিশেষায়িত Gemini মডেলের উপর ভিত্তি করে জটিল প্রশ্নের সারসংক্ষেপ উত্তর তৈরি করে। Google I/O 2025-এ চালু হওয়া AI Mode এজেন্টিক সক্ষমতা (বুকিং, কেনাকাটা) সহ গভীর অনুসন্ধান প্রদান করে।
  • Android ও Pixel: Gemini Nano (Pixel 10-এ v3, Tensor G5 চিপ সহ, আগস্ট ২০২৫) স্মার্টফোনে স্থানীয়ভাবে কাজ করে, ডেটা গোপনীয়তা বজায় রেখে স্মার্ট উত্তর, সারসংক্ষেপ, প্রতারণামূলক কল শনাক্তকরণ এবং অ্যাক্সেসিবিলিটি নিশ্চিত করে। ডেভেলপারদের জন্য ML Kit GenAI API ডিভাইসে সারসংক্ষেপ, প্রুফরিডিং এবং বক্তৃতা সনাক্তকরণ সমর্থন করে।
  • NotebookLM: নোট টুল থেকে একটি সম্পূর্ণ সৃজনশীল প্ল্যাটফর্মে বিকশিত হয়েছে। ২০২৫ সালের মার্চে Google Workspace-এর অংশ হয়েছে। ইন্টারেক্টিভ Audio Overviews, Video Overviews, Mind Maps, স্লাইড, ইনফোগ্রাফিক সমর্থন করে। ২০২৫ সালের ডিসেম্বরে Gemini 3-এ আপডেট করা হয়েছে; চ্যাটের জন্য ১ মিলিয়ন token সম্পূর্ণ কনটেক্সট উইন্ডো — ২০২৬ সালের ফেব্রুয়ারি থেকে।
  • Gemini Live: Project Astra-র ক্যামেরা এবং স্ক্রিন শেয়ারিং ফিচার সমস্ত Android এবং iOS ব্যবহারকারীদের জন্য বিনামূল্যে হয়েছে।

ডেভেলপার প্ল্যাটফর্ম

  • Google AI Studio ও Gemini API: API-এর মাধ্যমে Gemini মডেলে প্রবেশের প্রধান ইন্টারফেস। ২০২৬ সালের ফেব্রুয়ারি নাগাদ capability-ব্লক সমর্থন করে: Thinking, Thought signatures, Long context, Tools and agents (Google Search, Maps, Code Execution, URL Context, Computer Use, File Search, Deep Research, Live API)।
  • Vertex AI: উন্নত নিরাপত্তা ও ব্যবস্থাপনা সক্ষমতা সহ কর্পোরেট প্ল্যাটফর্ম।
  • Google Gen AI SDK: ২০২৫ সালের মে নাগাদ Python, JavaScript/TypeScript, Go এবং Java-এর জন্য GA অর্জন করেছে, Gemini Developer API এবং Vertex AI-তে একীভূত প্রবেশ প্রদান করছে। Model Context Protocol (MCP) সমর্থন করে।
  • Gemini CLI: টার্মিনালে AI কোডিং-এর জন্য কমান্ড-লাইন টুল (২০২৫ সালের জুনে চালু)।
  • Interactions API: মডেল এবং এজেন্টের জন্য একীভূত ইন্টারফেস (২০২৫ সালের ডিসেম্বর থেকে বেটা)।

API জীবনচক্র ও সংস্করণ ব্যবস্থাপনা

API-তে Gemini মডেলগুলি stable, preview, latest এবং experimental বিভাগে বিভক্ত। একটি নির্দিষ্ট model_id এবং মডেল পরিবার একই বিষয় নয়; production পরিস্থিতিতে একটি নির্দিষ্ট সংস্করণের সাথে এবং তার সাপোর্ট সময়কালের সাথে আবদ্ধ হওয়া অত্যন্ত গুরুত্বপূর্ণ। API ডকুমেন্টেশনে সাপোর্ট বন্ধের তারিখ সহ deprecation রেজিস্ট্রি রয়েছে।

দীর্ঘমেয়াদী স্বায়ত্তশাসিত কাজ সমর্থনের জন্য চালু করা হয়েছে: Session Resumption (সার্ভারে ২৪ ঘণ্টা পর্যন্ত সেশন স্টেট সংরক্ষণ) এবং Context Compression (সীমা অতিক্রম হলে কনটেক্সট স্বয়ংক্রিয় সংকোচনের জন্য স্লাইডিং উইন্ডো প্রক্রিয়া)।

২০২৫ সালের ডিসেম্বরে Google পূর্ব বিজ্ঞপ্তি ছাড়াই API বিনামূল্যের কোটা প্রায় ৯২% হ্রাস করেছে, যা ডেভেলপার সম্প্রদায়ের তীব্র প্রতিক্রিয়া সৃষ্টি করেছে। একই সময়ে, অপ্টিমাইজেশনের কারণে ২০২৫ সালে Gemini মডেল পরিষেবার খরচ ৭৮% কমেছে।

সীমাবদ্ধতা ও উন্মুক্ত সমস্যা

  • হ্যালুসিনেশন ও কনফ্যাবুলেশন: মডেলগুলি বিশেষত Search Grounding ফিচার অক্ষম করা হলে তথ্যগতভাবে ভুল তথ্য তৈরির প্রবণতা ধরে রাখে। Gemini 3.1 Pro পূর্ববর্তী সংস্করণের তুলনায় SimpleQA benchmark-এ হ্যালুসিনেশনের মাত্রা কমিয়েছে, তবে সমস্যাটি সমস্ত LLM-এর জন্য সিস্টেমিক থেকে যায়।
  • অবচেতন চুরি (Subconscious Plagiarism): Aletheia এজেন্টের পরীক্ষায় প্রশিক্ষণ ডেটা থেকে অ-তুচ্ছ প্রমাণ পুনরুৎপাদনের সমস্যা চিহ্নিত হয়েছে, যা স্বায়ত্তশাসিত আবিষ্কার হিসেবে উপস্থাপন করা হয়, যা AI গবেষণার নতুনত্ব যাচাই করা জটিল করে তোলে।
  • দীর্ঘ কনটেক্সটে অবনতি: ১ মিলিয়ন token আকারের কনটেক্সট প্রক্রিয়া করার সময়, মডেলগুলি «Lost in the Middle» প্রভাবের শিকার হয় — নথির মাঝখান থেকে তথ্য বের করার নির্ভুলতা কমে যায়।
  • উচ্চ গণনামূলক ব্যয়: সর্বোচ্চ Deep Think সেটিংসে inference উল্লেখযোগ্যভাবে বেশি সময় ও সম্পদ (TPU) প্রয়োজন, যা সিঙ্ক্রোনাস রিয়েল-টাইম অ্যাপ্লিকেশনে ব্যবহার সীমিত করে।
  • মিথ্যা ইতিবাচক অস্বীকৃতি (Over-refusals): কঠোর alignment অ্যালগরিদমের কারণে জটিল যুক্তির মডেলগুলি বৈধ অনুরোধ প্রত্যাখ্যান করতে প্রবণ, সেগুলিকে মিথ্যাভাবে সম্ভাব্য বিপজ্জনক হিসেবে শ্রেণীবদ্ধ করে (বিশেষত কোড বিশ্লেষণ এবং তথ্য সুরক্ষার প্রেক্ষাপটে)। model card-এ «উপদেশমূলক» (preachy) অস্বীকৃতির সুরের সমস্যাও উল্লেখ করা হয়েছে।
  • যুক্তির সীমাবদ্ধতা: ২.৫- এবং ৩-সিরিজের model card-গুলি causal understanding, complex logical deduction এবং counterfactual reasoning-এর সীমাবদ্ধতা এবং thinking বাজেট মেনে চলার অসম্পূর্ণ পূর্বাভাসযোগ্যতার তালিকা দেয়।

নৈতিক দিক ও নিরাপত্তা

Gemini মডেল মোতায়েনের সাথে নিরাপত্তার বহু-স্তরীয় ব্যবস্থার পদ্ধতি রয়েছে।

সাধারণ কাঠামো

Secure AI Framework (SAIF) — AI সিস্টেমের নিরাপত্তার জন্য Google-এর সাধারণ পদ্ধতি (২০২৩ সালের জুনে ঘোষণা করা হয়েছিল), উন্নয়নের প্রেক্ষাপট গঠন করে, কিন্তু Gemini-নির্দিষ্ট মান নয়। Frontier Safety Framework v3 (সেপ্টেম্বর ২০২৫) CBRN, সাইবার নিরাপত্তা, ML R&D, ম্যানিপুলেটিভ প্রভাব এবং misalignment ঝুঁকির পরীক্ষামূলক পদ্ধতির ডোমেন অন্তর্ভুক্ত করে।

Gemini-নির্দিষ্ট ব্যবস্থা

  • Model cards — নির্দিষ্ট মডেলের সীমাবদ্ধতা এবং নিরাপত্তার প্রাথমিক তথ্যের উৎস। Intended Usage and Limitations, Ethics and Content Safety, Frontier Safety বিভাগ ধারণ করে। Gemini 3 Pro-এর model card নিশ্চিত করেছে যে মডেলটি CBRN এবং সাইবার নিরাপত্তা ডোমেনে কোনো Critical Capability Level অর্জন করেনি।
  • পক্ষপাত ও বিষাক্ততার পরীক্ষা: প্রশিক্ষণ ডেটা এবং কনটেন্ট জেনারেশনে পক্ষপাত বিশ্লেষণ ও প্রশমিত করা।
  • রেড টিমিং (Red Teaming): দুর্বলতা এবং অবাঞ্ছিত আচরণ চিহ্নিত করতে আক্রমণের সিমুলেশন। misalignment-এর জন্য স্বাধীন পরীক্ষায় «কিছুটা বর্ধিত পরিস্থিতিগত সচেতনতা» পাওয়া গেছে, কিন্তু কোনো সমালোচনামূলক ঝুঁকি পাওয়া যায়নি।

নিরাপত্তা প্রোব (Safety Probes)

ক্ষতিকর কনটেন্ট তৈরি রোধ করতে লুকানো সক্রিয়করণের শ্রেণীবিভাগ ব্যবহার করা হয়। দীর্ঘ কনটেক্সটে সংকেত ক্ষতির সমস্যা সমাধানের জন্য MultiMax আর্কিটেকচার ব্যবহার করা হয়: প্রোব ক্রম ni-এ প্রতিটি token j-এর জন্য সমস্ত স্তর H জুড়ে সর্বোচ্চ মান নির্বাচন করে:

fMultiMax(Si)=h=1Hmaxj[ni][vhyi,j]

প্রোবগুলি বেস মডেলের সাথে ক্যাসকেড শ্রেণীবদ্ধকারীতে একত্রিত হয়, কম গণনামূলক ব্যয়ে ফিল্টারিং নির্ভুলতা বাড়ায় (arXiv:2601.11516)।

ক্রিপ্টোগ্রাফিক মার্কিং (SynthID)

Live API-এর মাধ্যমে তৈরি অডিও ডেটা এবং ছবি (Nano Banana / Flash Image মডেল থেকে) SynthID অ্যালগরিদম দ্বারা চিহ্নিত করা হয়। একটি অদৃশ্য ওয়াটারমার্ক পিক্সেল বা অডিও স্পেকট্রাম স্তরে এমবেড করা হয়, তৈরি করা কনটেন্টের মেশিন সনাক্তকরণ নিশ্চিত করে। Nano Banana 2 মডেল (ফেব্রুয়ারি ২০২৬) C2PA মেটাডেটার সাথে SynthID সংযুক্ত করে।

Thinking এবং স্বচ্ছতার প্রশ্ন

Thinking মোড সহ মডেলগুলি (২.৫/৩-সিরিজ) thought summaries ফেরত দিতে পারে — অভ্যন্তরীণ যুক্তির সংক্ষিপ্ত সারসংক্ষেপ, মধ্যবর্তী token-এর সম্পূর্ণ প্রবাহ নয়। এটি একটি নির্দিষ্ট মাত্রার স্বচ্ছতা প্রদান করে, তবে সমালোচনার শিকার হয় কারণ প্রকৃত «কাঁচা» যুক্তির শৃঙ্খল সরলীকৃত সারসংক্ষেপের আড়ালে লুকিয়ে থাকে।

নিয়ন্ত্রক দিক

EU AI Act (ইইউ কৃত্রিম বুদ্ধিমত্তা আইন)-এর কাঠামোর মধ্যে Google OpenAI এবং Anthropic-এর পাশাপাশি EU AI আচার সংহিতায় স্বাক্ষর করেছে (২০২৫ সালের ১০ জুলাই প্রকাশিত)। Gemini সিস্টেমিক ঝুঁকি সহ সাধারণ উদ্দেশ্য AI (GPAI) মডেল হিসেবে শ্রেণীবদ্ধ, যা অতিরিক্ত নিরাপত্তা বাধ্যবাধকতা আরোপ করে (২০২৫ সালের ২ আগস্ট থেকে কার্যকর)।

প্রতিযোগিতামূলক পরিবেশ

২০২৫ সালের নভেম্বর — ডিসেম্বর AI ইতিহাসে সবচেয়ে ঘন প্রতিযোগিতামূলক চক্র হয়ে উঠেছে: Gemini 3 Pro (১৮ নভেম্বর), Anthropic-এর Claude Opus 4.5 (২৪ নভেম্বর) এবং OpenAI-এর GPT-5.2 (১১ ডিসেম্বর) ২৪ দিনের মধ্যে প্রকাশিত হয়েছিল। ২০২৬ সালের ফেব্রুয়ারিতে কোনো মডেল সব বিভাগে আধিপত্য করে না: Gemini 3 Pro টেক্সট, দৃষ্টি, অনুসন্ধান এবং বহুভাষিকতায় LMArena-তে নেতৃত্ব দেয়; GPT-5.2 বিশুদ্ধ গণিতে (কোনো সরঞ্জাম ছাড়া AIME 2025-এ ১০০%) এবং SWE-bench Pro-তে নেতৃত্ব দেয়; Claude Opus 4.5 SWE-bench Verified-এ প্রতিযোগিতা করে। API মূল্যে Gemini সমতুল্য কলে GPT-5-এর তুলনায় প্রায় ৪২% সস্তা।

ব্যবসায়িক সূচক

Alphabet-এর Q4 2025 প্রতিবেদন (২০২৬ সালের ৪ ফেব্রুয়ারি প্রকাশিত) অনুযায়ী: Google Cloud রাজস্ব — ত্রৈমাসিকে $১৭.৭ বিলিয়ন (+৪৮% বছর-প্রতি-বছর); পরিচালন মার্জিন — ২৯.৯%; Cloud অর্ডার পোর্টফোলিও — $২৪০ বিলিয়ন (বছরে দ্বিগুণ)। ১ লাখ ২০ হাজারেরও বেশি উদ্যোগ Gemini ব্যবহার করছে। ২০২৬ সালের জানুয়ারিতে Apple Siri-তে Gemini ইন্টিগ্রেশনের পরিকল্পনা ঘোষণা করেছে। Google API-এর মাধ্যমে প্রতি মিনিটে ১ হাজার কোটিরও বেশি token প্রক্রিয়া করে। Google-এর অভ্যন্তরীণ AI এজেন্ট কোম্পানির প্রায় ৫০% নিজস্ব কোড তৈরি করে। ২০২৬ সালের মূলধন ব্যয় $১৭৫–১৮৫ বিলিয়ন স্তরে পরিকল্পনা করা হয়েছে (২০২৫ সালে $৯১.৪৫ বিলিয়নের প্রায় দ্বিগুণ বৃদ্ধি)।

তথ্যসূত্র

  • Google DeepMind মডেল সূচক
  • ডেভেলপারদের জন্য Gemini API ডকুমেন্টেশন
  • Gemini API মডেল ক্যাটালগ
  • Gemini Thinking ডকুমেন্টেশন
  • Gemini মডেল deprecation রেজিস্ট্রি
  • Google DeepMind model card সূচক

সাহিত্য

Gemini-এর প্রাথমিক প্রযুক্তি প্রতিবেদন

  • Gemini Team, Google (2023). Gemini: A Family of Highly Capable Multimodal Models. arXiv:2312.11805.
  • Gemini Team, Google (2024). Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context. arXiv:2403.05530.
  • Comanici, G. et al. (2025). Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities. arXiv:2507.06261.

বিশেষায়িত মডেল ও প্রয়োগ

  • Saab, K. et al. (2024). Capabilities of Gemini Models in Medicine. arXiv:2404.18416.
  • Yang, L. et al. (2024). Advancing Multimodal Medical Capabilities of Gemini. arXiv:2405.03162.
  • Gemini Robotics Team (2025). Gemini Robotics: Bringing AI into the Physical World. arXiv:2503.20020.
  • Feng, T., Trinh, T., Bingham, G. et al. (2026). Semi-Autonomous Mathematics Discovery with Gemini: A Case Study on the Erdős Problems. arXiv:2601.22401.
  • DeepMind Research Team (2026). Building Production-Ready Probes For Gemini. arXiv:2601.11516.
  • Fu, Y., Wang, X., Tian, Y., Zhao, J. (2025). Deep Think with Confidence. arXiv:2508.15260.

সাহিত্য (পর্যালোচনা ও পদ্ধতি)

  • Wei, J. et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. arXiv:2201.11903.
  • Zhang, Z. et al. (2022). Automatic Chain of Thought Prompting in Large Language Models. arXiv:2210.03493.
  • Zhang, Z. et al. (2023). Multimodal Chain-of-Thought Reasoning in Language Models. arXiv:2302.00923.
  • Cai, W. et al. (2024). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
  • Dai, Z. et al. (2019). Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context. arXiv:1901.02860.
  • Ding, J. et al. (2023). LongNet: Scaling Transformers to 1,000,000,000 Tokens. arXiv:2307.02486.
  • Yin, S. et al. (2024). A Survey on Multimodal Large Language Models. arXiv:2306.13549.
  • Wang, X. et al. (2023). Large-scale Multi-Modal Pre-trained Models: A Comprehensive Survey. arXiv:2302.10035.
  • Chen, Q. et al. (2025). Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models. arXiv:2503.09567.

Google-এর অফিসিয়াল ব্লগ পোস্ট

  • Google (2023). Introducing Gemini: Google's most capable AI model yet. The Keyword, 06.12.2023.
  • Google DeepMind (2024). Introducing Gemini 1.5. The Keyword, 15.02.2024.
  • Google (2024). Introducing Gemini 2.0: A new AI model for the agentic era. The Keyword, 11.12.2024.
  • Google DeepMind (2025). Gemini 2.0 model updates. The Keyword, 05.02.2025.
  • Google DeepMind (2025). Gemini 2.5: Our newest Gemini model with thinking. The Keyword, 25.03.2025.
  • Google DeepMind (2025). Google I/O 2025: Updates to Gemini 2.5. The Keyword, 20.05.2025.
  • Google (2025). Gemini 3: Introducing the latest Gemini AI model. The Keyword, 18.11.2025.
  • The Deep Think Team (2026). Gemini 3 Deep Think: Advancing science, research and engineering. Google Blog, 12.02.2026.
  • The Gemini Team (2026). Gemini 3.1 Pro: A smarter model for your most complex tasks. Google Blog, 19.02.2026.