Gemini (Google) (VI)
Google Gemini — là một họ các mô hình ngôn ngữ lớn (LLM) đa phương thức được phát triển bởi bộ phận nghiên cứu Google DeepMind. Các mô hình Gemini, được giới thiệu lần đầu vào tháng 12 năm 2023, được xây dựng trên kiến trúc mạng nơ-ron transformer với khả năng xử lý và tạo sinh dữ liệu đa phương thức nguyên bản, bao gồm văn bản, hình ảnh, âm thanh, video và mã nguồn chương trình.
Tính đến tháng 2 năm 2026, dòng sản phẩm hiện tại là Gemini 3.x. Hướng phát triển kiến trúc tập trung vào việc tích hợp các cơ chế mở rộng suy luận trong quá trình inference (inference-time scaling) và tối ưu hóa các mô hình để sử dụng trong các hệ thống tác nhân tự trị (Agentic AI). Ứng dụng Gemini có hơn 750 triệu người dùng hoạt động hàng tháng.
Tên gọi và triết lý
Tên "Gemini" (từ tiếng Latinh — Song Tử) tượng trưng cho sự hợp nhất của hai nhóm nghiên cứu hàng đầu của Google — Google Brain và DeepMind — để tạo ra dự án này. Jeff Dean, đồng giám đốc kỹ thuật của Google DeepMind, đã xác nhận điều này trong blog chính thức (tháng 5 năm 2024): «The twins here are the folks in the legacy Brain team and the legacy DeepMind team». Dự án ban đầu có tên mã là «Titan»; tên «Gemini» được Dean đề xuất vào tháng 4 năm 2023 — cùng tháng diễn ra sự sáp nhập chính thức giữa Google Brain và DeepMind. Tên gọi này cũng gợi nhắc đến chương trình vũ trụ Gemini của NASA (1965–1968), vai trò của chương trình này trong việc chuẩn bị cho chương trình Apollo đã tạo được tiếng vang trong nhóm phát triển.
Đặc điểm chủ chốt và nền tảng triết học của Gemini là tính đa phương thức nguyên bản. Khác với nhiều mô hình trước đây, nơi các khả năng đa phương thức được bổ sung chồng lên nền tảng văn bản hiện có, Gemini được thiết kế từ đầu để đồng thời hiểu, xử lý và kết hợp các loại thông tin khác nhau. Báo cáo kỹ thuật Gemini 1.0 (arXiv:2312.11805) xác nhận rằng mô hình được «trained jointly across image, audio, video, and text data». Điều này cho phép mô hình không chỉ đơn giản chuyển đổi dữ liệu giữa các phương thức, mà còn hình thành sự hiểu biết sâu sắc, toàn diện hơn về chúng.
Kiến trúc và các công nghệ chủ chốt
Sự thành công và khả năng của các mô hình Gemini được xác định bởi một số quyết định kiến trúc cơ bản. Google không công bố toàn bộ thiết kế cấp thấp của tất cả các thành phần nội bộ của Gemini, tuy nhiên các nguồn mở cho phép xác định lớp kiến trúc: tất cả các mô hình thuộc họ 1.5 trở lên đều là sparse mixture-of-experts transformer-based models với hỗ trợ đa phương thức nguyên bản (được xác nhận trong model card của Gemini 2.5 Flash).
Kiến trúc đa phương thức nguyên bản
Kiến trúc Gemini dựa trên khái niệm hợp nhất sớm (early fusion). Các patch pixel của hình ảnh, các khung thời gian của video, audiogram và token văn bản được chiếu vào một không gian ẩn thống nhất. Báo cáo kỹ thuật về Gemini 2.5 mô tả phương pháp này là «Unified Multimodal Token Interleaving». Vì tất cả các token của các phương thức khác nhau được xử lý trong một chuỗi chung, các cơ chế tự chú ý (self-attention) tiêu chuẩn tự nhiên đảm bảo tích hợp chéo dữ liệu từ các phương thức khác nhau ở mỗi lớp. Tín hiệu âm thanh được xử lý bởi các bộ mã hóa chuyên dụng trực tiếp từ dạng sóng âm thanh (waveform), giúp bảo toàn các đặc điểm âm học (ngữ điệu, âm sắc, tiếng ồn nền) vốn bị mất khi sử dụng các hệ thống phiên âm Speech-to-Text trung gian.
Đối với lớp transformer, phép toán cơ bản là cơ chế chú ý:
trong đó — ma trận truy vấn, — khóa, — giá trị, và — chiều của khóa.
Hỗn hợp chuyên gia thưa (Sparse MoE)
Bắt đầu từ phiên bản 1.5, các mô hình Gemini sử dụng kiến trúc Sparse Mixture-of-Experts (MoE). Gemini 1.0 sử dụng transformer dày đặc (dense); việc chuyển sang MoE được mô tả trực tiếp trong báo cáo kỹ thuật 1.5: «This is our first release from Gemini 1.5, a new family… which incorporates a novel mixture-of-experts architecture».
Trong kiến trúc MoE, các lớp kết nối đầy đủ tiêu chuẩn (Feed-Forward Networks) được thay thế bằng một tập hợp các mạng con chuyên biệt — «chuyên gia». Đối với token đầu vào , đầu ra được hình thành như một tổng có trọng số của các đầu ra của các chuyên gia đang hoạt động (, trong đó — tổng số chuyên gia):
trong đó — hàm phi tuyến của chuyên gia thứ , — tập hợp chỉ số của các mạng con được chọn, và trọng số định tuyến được tính bằng hàm định tuyến học được (learned routing function) với áp dụng hàm Softmax trên giá trị lớn nhất.
Phương pháp này cho phép tăng đáng kể dung lượng tham số tổng thể của mô hình, đồng thời duy trì chi phí tính toán (FLOPs) ở mức thấp, vì chỉ có một tập hợp con các tham số được kích hoạt cho mỗi token. Google không tiết lộ số lượng tham số thực tế của các mô hình Gemini.
Ngữ cảnh dài và «Học trong ngữ cảnh»
Gemini 1.5 đã tạo ra bước đột phá bằng cách tăng kích thước cửa sổ ngữ cảnh lên 1 triệu token trong chế độ production (với thử nghiệm thực nghiệm lên đến 10 triệu token). Con số này lớn hơn một bậc độ lớn so với các mô hình trước đây (ví dụ, GPT-4 Turbo với 128 nghìn token). Google tuyên bố đạt kết quả 99% trong bài kiểm tra Needle In A Haystack với độ dài ngữ cảnh 1 triệu token. Đối với các thế hệ tiếp theo, ngữ cảnh dài được xác lập là một trong những tính năng chủ chốt của dòng sản phẩm. Ngữ cảnh quy mô lớn như vậy cho phép mô hình:
- Phân tích toàn bộ sách, video nhiều giờ (lên đến 3 giờ) hoặc các cơ sở mã nguồn lớn trong một truy vấn duy nhất.
- Thực hiện «học trong ngữ cảnh» (in-context learning) trên khối lượng dữ liệu khổng lồ được cung cấp trong prompt, cho phép nhận được các câu trả lời được tùy chỉnh cao mà không cần fine-tuning.
«Mô hình suy nghĩ» và mở rộng tính toán khi inference
Bắt đầu từ Gemini 2.5, Google xác định thinking như một chế độ hoạt động riêng biệt của các mô hình. Tài liệu chính thức định nghĩa nó là một quy trình tính toán nội bộ, cải thiện khả năng lập kế hoạch và suy luận nhiều bước. Các mô hình phiên bản 2.5 (được mô tả là «thinking models») có khả năng tạo ra và đánh giá nội bộ các bước suy luận trung gian trước khi đưa ra câu trả lời cuối cùng. Điều này cải thiện đáng kể độ chính xác trên các bài toán logic và toán học phức tạp.
Cần phân biệt hai cơ chế:
- Tư duy tích hợp (Thinking): Chế độ cơ bản cho các mô hình dòng 2.5 và 3, tạo ra chuỗi suy luận ẩn (Chain-of-Thought). API có thể trả về thought summaries — các bản tóm tắt ngắn gọn về suy luận nội bộ, chứ không phải toàn bộ luồng «suy nghĩ thô». Bắt đầu từ mô hình 3.1 Pro, ngân sách tư duy được điều chỉnh bằng tham số
thinking_levelvới các giá trị từ Low đến Max. - Deep Think: Một chế độ suy luận mở rộng thực nghiệm riêng biệt, sử dụng khả năng tạo giả thuyết song song và đòi hỏi tài nguyên tính toán lớn hơn đáng kể. Được công bố tại Google I/O ngày 20 tháng 5 năm 2025 và mở cho người đăng ký AI Ultra từ ngày 1 tháng 8 năm 2025. Deep Think không nên đồng nhất với cơ chế thinking cơ bản.
Khả năng tác nhân (Agentic Capabilities)
Bắt đầu từ phiên bản 2.0, Gemini có thể tương tác với thế giới bên ngoài: gọi công cụ, thực hiện tìm kiếm trên Google, thực thi mã và quản lý các phần tử giao diện người dùng (UI). Google đã trực tiếp định vị Gemini 2.0 là mô hình dành cho «kỷ nguyên tác nhân mới» (agentic era) với hỗ trợ tool use nguyên bản.
Tính đến tháng 2 năm 2026, Gemini API bao gồm một lớp khả năng tác nhân được thiết lập chính thức với hỗ trợ các công cụ: Google Search, Google Maps, Code Execution, URL Context, Computer Use, File Search, cũng như Live API để tương tác hai chiều theo thời gian thực.
Sự tiến hóa của các mô hình Gemini
Họ Gemini phát triển với tốc độ cực kỳ nhanh: trong giai đoạn từ tháng 12 năm 2023 đến tháng 2 năm 2026, đã có bốn thế hệ mô hình chính được phát hành.
Gemini 1.0 (tháng 12 năm 2023)
Thế hệ đầu tiên, đặt nền tảng cho tính đa phương thức nguyên bản. Được giới thiệu công khai ngày 6 tháng 12 năm 2023.
- Các phiên bản: Ultra (mô hình hàng đầu cho các tác vụ phức tạp nhất), Pro (mô hình đa năng) và Nano (nhỏ gọn cho thiết bị di động; được chia thành Nano-1 với 1,8 tỷ tham số và Nano-2 với 3,25 tỷ tham số).
- Cửa sổ ngữ cảnh: 32 768 token cho tất cả các phiên bản.
- Thành tựu: Gemini 1.0 Ultra trở thành mô hình đầu tiên đạt và vượt qua mức độ chuyên gia của con người trên benchmark MMLU với kết quả 90,04% (khi sử dụng kỹ thuật CoT@32 — chuỗi suy luận với 32 mẫu và bỏ phiếu đa số; với prompt 5-shot tiêu chuẩn, kết quả đạt khoảng 83,7%). Đạt kết quả SOTA trên 30 trong số 32 benchmark học thuật.
- Ngừng hỗ trợ: Gemini 1.0 Pro được tuyên bố lỗi thời vào ngày 18 tháng 2 năm 2025.
Gemini 1.5 (tháng 2 — tháng 5 năm 2024)
Bước đột phá về độ dài ngữ cảnh và hiệu quả.
- Kiến trúc: Chuyển từ transformer dày đặc sang Mixture-of-Experts (MoE).
- Cửa sổ ngữ cảnh: Lên đến 1 triệu token trong production (2 triệu — theo danh sách chờ cho 1.5 Pro, được công bố vào tháng 5 năm 2024 tại Google I/O).
- Các phiên bản: 1.5 Pro (được công bố vào tháng 2 năm 2024; với chất lượng tương đương 1.0 Ultra nhưng chi phí thấp hơn đáng kể) và 1.5 Flash (phiên bản nhẹ và nhanh, được bổ sung vào tháng 5 năm 2024).
- Ngừng hỗ trợ: Tất cả các mô hình Gemini 1.5 (Pro, Flash, Flash-8B) đã ngừng hoạt động vào ngày 29 tháng 9 năm 2025.
Gemini 2.0 (tháng 12 năm 2024 — tháng 2 năm 2025)
Chuyển sang «kỷ nguyên tác nhân».
- Lịch sử: 11 tháng 12 năm 2024 — công bố 2.0 Flash Experimental (đầu vào đa phương thức, đầu ra văn bản); 5 tháng 2 năm 2025 — sẵn sàng rộng rãi (GA) của 2.0 Flash, phát hành 2.0 Pro Experimental và 2.0 Flash-Lite.
- Các đổi mới chủ chốt: Khả năng tác nhân tích hợp (tool use), tạo sinh hình ảnh và âm thanh nguyên bản (ban đầu ở chế độ hạn chế cho các đối tác early-access), định hướng vào các kịch bản tác nhân.
- Cửa sổ ngữ cảnh: Lên đến 2 triệu token (2.0 Pro); lên đến 1 triệu token (2.0 Flash-Lite).
- Ngừng hỗ trợ: Các mô hình 2.0 Flash và Flash-Lite dự kiến ngừng hoạt động vào ngày 1 tháng 6 năm 2026.
Gemini 2.5 (tháng 3 — tháng 6 năm 2025)
«Mô hình suy nghĩ» (thinking model) đầu tiên với ngân sách suy luận có thể điều chỉnh.
- Lịch sử: 25 tháng 3 năm 2025 — công bố 2.5 Pro Experimental; 17 tháng 4 — 2.5 Flash (mô hình reasoning lai hoàn toàn đầu tiên với chế độ tư duy có thể chuyển đổi); 20 tháng 5 (Google I/O) — cập nhật 2.5 Pro và Flash, công bố Deep Think; 17 tháng 6 năm 2025 — GA đồng thời cho 2.5 Pro và 2.5 Flash; cùng ngày — bản xem trước 2.5 Flash-Lite (GA ngày 22 tháng 7). 1 tháng 8 — Deep Think mở cho người đăng ký AI Ultra.
- Các đổi mới chủ chốt: Cơ chế «tư duy» (thinking) tích hợp với ngân sách có thể điều chỉnh; Deep Think như một chế độ mở rộng riêng biệt. Kết quả SOTA trên các benchmark toán học, logic và lập trình phức tạp (AIME 2025 — 86,7%, GPQA Diamond — 84,0%, Humanity's Last Exam — 18,8% không có công cụ).
- Cửa sổ ngữ cảnh: 1 triệu token đầu vào, lên đến 64 000 token đầu ra. Việc mở rộng đã hứa hẹn lên 2 triệu token cho 2.5 Pro chưa được xác nhận là đã triển khai trong vòng đời của mô hình.
- Các biến thể chuyên biệt: Gemini 2.5 Flash Image (tên mã «Nano Banana», xuất hiện ẩn danh trên Arena ngày 12 tháng 8, được phát hành chính thức ngày 26 tháng 8 năm 2025 — trở nên viral nhờ «mô hình 3D» siêu thực, thu hút 10 triệu người dùng mới); Computer Use Preview (7 tháng 10 năm 2025, dựa trên 2.5 Pro); các mô hình Text-to-Speech (2.5 Flash TTS, 2.5 Pro TTS).
- Báo cáo kỹ thuật: Báo cáo tổng hợp Gemini 2.X được công bố trên arXiv ngày 7 tháng 7 năm 2025 (arXiv:2507.06261), có hơn 3 300 tác giả và bao gồm các mô hình 2.5 Pro, 2.5 Flash, 2.0 Flash, 2.0 Flash-Lite.
Gemini 3.x (tháng 11 năm 2025 — tháng 2 năm 2026)
Thế hệ thứ ba đánh dấu sự chuyển đổi từ tạo sinh cơ bản sang các quy trình tác nhân kéo dài (agentic workflows) và giải quyết các nhiệm vụ khoa học liên ngành.
- Gemini 3 Pro (18 tháng 11 năm 2025): Được công bố bởi Giám đốc điều hành Alphabet Sundar Pichai và người đứng đầu DeepMind Demis Hassabis là «mô hình thông minh nhất của Google». Mô hình Gemini đầu tiên được triển khai trên Google Search ngay ngày ra mắt. Trở thành mô hình đầu tiên vượt ngưỡng 1500 Elo trên LMArena (1501 tại thời điểm ra mắt). Kết quả: GPQA Diamond — 91,9%; SWE-bench Verified — 76,2%; Humanity's Last Exam — 37,5% (không có công cụ); SimpleQA — 72,1%.
- Gemini 3 Flash (17 tháng 12 năm 2025): Trở thành mô hình mặc định trong ứng dụng Gemini. Với giá $0,50 / 1M token đầu vào, vượt qua 3 Pro trên SWE-bench Verified (78%) trong khi sử dụng ít hơn 30% token cho các tác vụ suy luận. GPQA Diamond — 90,4%; HLE — 33,7%.
- Gemini 3.1 Pro (19 tháng 2 năm 2026): Mô hình hàng đầu tại thời điểm công bố. Phát hành «gia tăng» đầu tiên (.1 thay vì .5 trước đây). Kết quả chủ chốt — ARC-AGI-2: 77,1% (hơn gấp đôi so với 31,1% của 3 Pro). AIME 2025 — 91,2%; GPQA Diamond — 94,3%; SWE-bench Verified — 80,6%. Triển khai mức tư duy MEDIUM mới thông qua tham số
thinking_level. Endpoint chuyên biệtgemini-3.1-pro-preview-customtoolsđể làm việc với bash terminal và các hàm người dùng. Khắc phục sự cố cắt ngắn đầu ra trong các thế hệ dài. Các kênh: Gemini App, Vertex AI, AI Studio, Gemini API, NotebookLM. - Gemini 3 Deep Think (cập nhật ngày 12 tháng 2 năm 2026): Cập nhật lớn cho chế độ «tư duy» chuyên biệt. Vượt ra ngoài toán học và lập trình: kết quả ở mức huy chương vàng tại các kỳ thi Olympic quốc tế về vật lý (IPhO) và hóa học (IChO) năm 2025; ARC-AGI-2 — 84,6%; Humanity's Last Exam — 48,4%; CMT-Benchmark (vật lý lý thuyết vật chất ngưng tụ) — 50,5%; Codeforces Elo — 3455. Dựa trên Deep Think, tác nhân nghiên cứu Aletheia đã được tạo ra, tự trị giải quyết một số bài toán mở từ cơ sở dữ liệu Erdős (bao gồm bài toán Erdős-1051).
Bảng tổng hợp các thế hệ Gemini
| Thế hệ | Năm phát hành | Các phiên bản chủ chốt | Cửa sổ ngữ cảnh tối đa | Các đổi mới kiến trúc và cải tiến chủ chốt |
|---|---|---|---|---|
| Gemini 1.0 | 2023 | Ultra, Pro, Nano | 32 768 token | Tính đa phương thức nguyên bản từ đầu; transformer dày đặc; vượt trội hơn con người trên MMLU (90,04% CoT@32). |
| Gemini 1.5 | 2024 | Pro, Flash | 1 000 000 token (2 triệu theo danh sách chờ) | Kiến trúc Mixture-of-Experts (MoE); mở rộng ngữ cảnh đột phá; 99% Needle In A Haystack. |
| Gemini 2.0 | 2024–2025 | Pro, Flash, Flash-Lite | 1 000 000 — 2 000 000 token | Kỷ nguyên «agentic AI»: tích hợp công cụ nguyên bản, tạo sinh hình ảnh và âm thanh, Live API. |
| Gemini 2.5 | 2025 | Pro, Flash, Flash-Lite | 1 000 000 token (đầu vào), 64 000 (đầu ra) | «Mô hình suy nghĩ» (thinking); ngân sách suy luận có thể điều chỉnh; Deep Think; tạo sinh hình ảnh (Nano Banana); Computer Use. |
| Gemini 3.x | 2025–2026 | 3 Pro, 3 Flash, 3.1 Pro, 3 Deep Think | 1 000 000 token | Agentic workflows; tham số thinking_level; đột phá trên ARC-AGI-2 và các kỳ thi khoa học; Aletheia. |
Kết quả chủ chốt và benchmark
Do sự bão hòa của các benchmark cổ điển (như MMLU), việc đánh giá hiệu suất của các mô hình Gemini đã chuyển sang các bài toán tư duy trừu tượng, mô hình hóa khoa học và lập trình tự trị. Kết quả được trích dẫn theo dữ liệu chính thức của Google (self-reported); việc so sánh chúng chỉ chính xác khi chế độ inference, sự có mặt/vắng mặt của tool use, phương pháp lấy mẫu (single-attempt vs. majority voting) và model-id cụ thể trùng khớp.
| Benchmark | Mô tả nhiệm vụ | Gemini 2.5 Pro (tháng 6 năm 2025) | Gemini 3 Pro (tháng 11 năm 2025) | Gemini 3.1 Pro (tháng 2 năm 2026) | Gemini 3 Deep Think (tháng 2 năm 2026) |
|---|---|---|---|---|---|
| MMLU | Hiểu ngôn ngữ đa nhiệm vụ | — | — | — | — |
| GPQA Diamond | Câu hỏi khoa học cấp độ Tiến sĩ | 84,0% | 91,9% | 94,3% | Không áp dụng |
| Humanity's Last Exam | Kiến thức chuyên ngành tiên tiến | 18,8% | 37,5% | 44,4% | 48,4% |
| ARC-AGI-2 | Câu đố logic trừu tượng | 4,9% | 31,1% | 77,1% | 84,6% |
| SWE-bench Verified | Giải quyết tự trị các tác vụ trong kho lưu trữ GitHub | 63,8%* | 76,2% | 80,6% | Không áp dụng |
| AIME 2025 | Bài toán toán học cấp độ Olympic | 86,7% | — | 91,2% | — |
| Codeforces (Elo) | Xếp hạng trong lập trình thi đấu | — | — | 2887 | 3455 |
* Kết quả của 2.5 Pro trên SWE-bench được đạt với custom agent setup.
Vị trí trên LMArena (tính đến cuối tháng 2 năm 2026)
LMArena (trước đây là Chatbot Arena) — nền tảng bình chọn cặp đôi mù độc lập. Xếp hạng được tính toán lại động; các giá trị tại thời điểm ra mắt mô hình có thể khác với hiện tại.
| Mô hình | Xếp hạng | Vị trí | Phiếu bầu | Ghi chú |
|---|---|---|---|---|
| Gemini 3.1 Pro Preview | 1500 ± 9 | #3 | 4 060 | Preliminary |
| Gemini 3 Pro | 1486 ± 4 | #5 | 37 854 | |
| Gemini 3 Flash | 1473 ± 5 | #7 | 28 847 | |
| Gemini 2.5 Pro | 1464 ± 3 | #9 | 97 296 | |
| Gemini 2.5 Flash | 1411 ± 3 | #64 | 96 163 |
Khi ra mắt ngày 18 tháng 11 năm 2025, Gemini 3 Pro đạt xếp hạng 1501 Elo, trở thành mô hình đầu tiên vượt ngưỡng 1500 trên LMArena.
Các hệ thống chuyên biệt và tác nhân
Hệ sinh thái Gemini được mở rộng bằng các mô hình và nền tảng có khả năng thực hiện các hành động nhiều bước trong môi trường kỹ thuật số và vật lý.
Các tác nhân tự trị
- Jules — tác nhân viết mã tự trị, hoạt động không đồng bộ trong các máy ảo đám mây được bảo vệ. Tạo các nhánh và pull request trên GitHub. Ra mắt bản beta mở tại Google I/O ngày 20 tháng 5 năm 2025 (hơn 140 000 cải tiến mã trong giai đoạn beta), GA — ngày 6 tháng 8 năm 2025. Đến cuối năm 2025 trở thành một trong những người đóng góp lớn nhất vào các kho lưu trữ nội bộ của Google.
- Project Mariner — nguyên mẫu nghiên cứu tác nhân trình duyệt cho các tác vụ web nhiều bước. Được chuyển sang các máy ảo đám mây với hỗ trợ lên đến 10 tác vụ song song và tính năng «Teach & Repeat». Đạt 83,5% trên benchmark WebVoyager. Khả năng Computer Use được chuyển sang Gemini API.
- Google Antigravity — môi trường phát triển tích hợp (IDE) để quản lý các tác nhân AI, được giới thiệu vào tháng 11 năm 2025. Các tác nhân tự trị sửa đổi mã, tương tác với terminal và trình duyệt tích hợp, trả về các tạo tác có thể xác minh (diff mã) để nhà phát triển phê duyệt.
- Tác nhân Aletheia — tác nhân nghiên cứu toán học chuyên biệt dựa trên Gemini 3 Deep Think. Được trang bị bộ xác minh ngôn ngữ tự nhiên và công cụ tìm kiếm web để kiểm tra tài liệu. Đầu năm 2026, tự trị giải quyết một số bài toán toán học mở từ cơ sở dữ liệu Erdős và đồng tác giả các công bố khoa học.
Các tác nhân AI tiêu dùng
- Phone Automations — tích hợp tác nhân tự trị ở cấp độ hệ điều hành Android (bản beta cho Pixel 10 và Samsung Galaxy S26). Hoạt động trong môi trường sandbox bảo mật (secure sandbox), có khả năng điều hướng trong các ứng dụng bên thứ ba dựa trên phân tích trực quan giao diện người dùng (GUI).
- Gemini in Chrome (Auto Browse) — tác nhân trình duyệt để tự động hóa các tác vụ web nhiều bước, có sẵn cho tất cả người dùng Chrome từ tháng 9 năm 2025 (được cập nhật lên Gemini 3 vào tháng 1 năm 2026).
Computer Use
Các mô hình Gemini 2.5 Computer Use được tối ưu hóa để điều khiển giao diện người dùng đồ họa (UI). Hệ thống nhận đầu vào là ảnh chụp màn hình và lịch sử hành động, tạo ra tọa độ để mô phỏng con trỏ theo chương trình và các lệnh nhập bàn phím.
Gemini Robotics
Các mô hình lớp Vision-Language-Action (VLA) và Embodied Reasoning (ER) được giới thiệu vào tháng 3 năm 2025. Các kiến trúc này xử lý thông tin không-thời gian và dự đoán quỹ đạo chuyển động 3D của các tay máy robot như một phương thức đầu ra nguyên bản (arXiv:2503.20020).
Các mô hình tạo sinh chuyên biệt (đầu năm 2026)
- Nano Banana 2 (Gemini 3.1 Flash Image) — được phát hành ngày 26 tháng 2 năm 2026, mô hình hình ảnh kết hợp tốc độ của kiến trúc Flash với chất lượng của Pro. Đảm bảo duy trì nhận dạng nhân vật nghiêm ngặt (character consistency), tạo sinh typography nguyên bản bên trong hình ảnh và tích hợp hình mờ mật mã học SynthID với siêu dữ liệu C2PA.
- Lyria 3 — mô hình âm nhạc, được tích hợp vào ứng dụng Gemini ngày 18 tháng 2 năm 2026. Tạo ra các tác phẩm âm nhạc 30 giây (bao gồm cả giọng hát và nhạc cụ) theo các prompt văn bản, ảnh chụp hoặc video.
- Veo 3.1 — mô hình tạo sinh video. Hỗ trợ tạo video sử dụng tối đa ba hình ảnh tham chiếu («Ingredients to Video»), tạo chuyển cảnh giữa khung đầu và khung cuối được chỉ định, render video dọc (9:16) nguyên bản và upscaling lên độ phân giải 4K.
- Med-Gemini — mô hình chuyên biệt theo lĩnh vực cho các tác vụ y tế (arXiv:2404.18416, arXiv:2405.03162).
Ứng dụng và hệ sinh thái
Google tích hợp sâu Gemini vào các sản phẩm tiêu dùng và dành cho nhà phát triển của mình.
Sản phẩm tiêu dùng
- Ứng dụng Gemini: Chatbot (trước đây là Bard, được đổi tên ngày 8 tháng 2 năm 2024), sử dụng các mô hình họ Gemini như một trợ lý AI đa năng. Tính đến tháng 2 năm 2026 có hơn 750 triệu người dùng hoạt động. Rollout hiện tại bao gồm mô hình 3.1 Pro. Các gói đăng ký: Google AI Pro ($19,99/tháng, thay thế Google One AI Premium) và Google AI Ultra ($249,99/tháng, với quyền truy cập Deep Think, Veo 3 và các tính năng ưu tiên).
- Google Workspace: Tích hợp Gemini vào Gmail, Docs, Sheets, Meet để hỗ trợ viết văn bản, phân tích dữ liệu và tạo nội dung (đổi thương hiệu từ Duet AI).
- Google Tìm kiếm: Tính năng AI Overviews tạo ra các câu trả lời tổng hợp cho các truy vấn phức tạp dựa trên mô hình Gemini chuyên biệt. AI Mode, ra mắt tại Google I/O 2025, cung cấp tìm kiếm chuyên sâu với khả năng tác nhân (đặt chỗ, mua sắm).
- Android và Pixel: Gemini Nano (v3 trên Pixel 10 với chip Tensor G5, tháng 8 năm 2025) chạy cục bộ trên điện thoại thông minh, cung cấp các phản hồi thông minh, tóm tắt, phát hiện cuộc gọi lừa đảo và khả năng tiếp cận, bảo vệ quyền riêng tư dữ liệu. ML Kit GenAI API dành cho nhà phát triển hỗ trợ tóm tắt, sửa lỗi và nhận dạng giọng nói trên thiết bị.
- NotebookLM: Đã phát triển từ công cụ ghi chú thành một nền tảng sáng tạo toàn diện. Được đưa vào Google Workspace vào tháng 3 năm 2025. Hỗ trợ Audio Overviews tương tác, Video Overviews, Mind Maps, slide, infographic. Được cập nhật lên Gemini 3 vào tháng 12 năm 2025; cửa sổ ngữ cảnh đầy đủ 1 triệu token cho chat — từ tháng 2 năm 2026.
- Gemini Live: Các tính năng camera và chia sẻ màn hình từ Project Astra trở nên miễn phí cho tất cả người dùng Android và iOS.
Nền tảng dành cho nhà phát triển
- Google AI Studio và Gemini API: Các giao diện chính để truy cập các mô hình Gemini qua API. Tính đến tháng 2 năm 2026, hỗ trợ các khối tính năng: Thinking, Thought signatures, Long context, Tools and agents (Google Search, Maps, Code Execution, URL Context, Computer Use, File Search, Deep Research, Live API).
- Vertex AI: Nền tảng doanh nghiệp với các khả năng bảo mật và quản trị mở rộng.
- Google Gen AI SDK: Đạt GA cho Python, JavaScript/TypeScript, Go và Java vào tháng 5 năm 2025, cung cấp quyền truy cập thống nhất vào Gemini Developer API và Vertex AI. Hỗ trợ Model Context Protocol (MCP).
- Gemini CLI: Công cụ dòng lệnh để viết mã AI trong terminal (ra mắt tháng 6 năm 2025).
- Interactions API: Giao diện thống nhất cho các mô hình và tác nhân (bản beta từ tháng 12 năm 2025).
Vòng đời API và quản lý phiên bản
Các mô hình Gemini trong API được chia thành các danh mục stable, preview, latest và experimental. Một model_id cụ thể và họ mô hình không phải là một; đối với các kịch bản production, việc gắn kết với một phiên bản cụ thể và thời hạn hỗ trợ của nó là cực kỳ quan trọng. Tài liệu API duy trì sổ đăng ký ngừng sử dụng với các ngày kết thúc hỗ trợ được chỉ định.
Để hỗ trợ các tác vụ tự trị kéo dài, đã được triển khai: Session Resumption (lưu trữ trạng thái phiên trên máy chủ lên đến 24 giờ) và Context Compression (cơ chế cửa sổ trượt để tự động nén ngữ cảnh khi vượt quá giới hạn).
Vào tháng 12 năm 2025, Google đã giảm hạn mức API cấp miễn phí khoảng 92% (không có cảnh báo trước), gây ra phản ứng gay gắt từ cộng đồng nhà phát triển. Trong khi đó, chi phí phục vụ các mô hình Gemini đã giảm 78% trong năm 2025 nhờ các tối ưu hóa.
Giới hạn và các vấn đề còn tồn tại
- Ảo giác và bịa đặt: Các mô hình vẫn có xu hướng tạo ra thông tin không chính xác về mặt thực tế, đặc biệt khi tắt các tính năng grounding (Search Grounding). Gemini 3.1 Pro đã giảm mức độ ảo giác trên benchmark SimpleQA so với các phiên bản trước, nhưng vấn đề vẫn mang tính hệ thống đối với tất cả các LLM.
- Đạo văn tiềm thức (Subconscious Plagiarism): Trong các thí nghiệm với tác nhân Aletheia, đã xác định được vấn đề tái tạo các bằng chứng không tầm thường từ tập dữ liệu huấn luyện, được trình bày như các khám phá tự trị, điều này làm phức tạp việc xác nhận tính mới của nghiên cứu AI.
- Suy giảm hiệu suất trong ngữ cảnh dài: Khi xử lý các ngữ cảnh có kích thước 1 triệu token, các mô hình dễ bị hiệu ứng «Lost in the Middle» — giảm độ chính xác trong việc trích xuất thông tin từ giữa tài liệu.
- Chi phí tính toán cao: Inference với cài đặt tối đa của Deep Think đòi hỏi nhiều thời gian và tài nguyên (TPU) hơn đáng kể, điều này hạn chế việc sử dụng trong các ứng dụng thời gian thực đồng bộ.
- Từ chối nhầm (Over-refusals): Do các thuật toán alignment nghiêm ngặt, các mô hình suy luận phức tạp có xu hướng từ chối các yêu cầu hợp lệ, phân loại nhầm chúng là nguy hiểm tiềm ẩn (đặc biệt trong bối cảnh phân tích mã và bảo mật thông tin). Model card cũng ghi nhận các vấn đề về giọng điệu «giáo huấn» (preachy) của các từ chối.
- Giới hạn suy luận: Model card của các dòng 2.5 và 3 liệt kê các giới hạn trong hiểu biết nhân quả (causal understanding), suy diễn logic phức tạp (complex logical deduction) và suy luận phản thực (counterfactual reasoning), cũng như khả năng dự đoán không đầy đủ về việc tuân thủ ngân sách tư duy.
Các khía cạnh đạo đức và an toàn
Việc triển khai các mô hình Gemini đi kèm với một hệ thống biện pháp an toàn nhiều lớp.
Khung chung
Secure AI Framework (SAIF) — phương pháp tiếp cận chung của Google về bảo mật hệ thống AI (được công bố vào tháng 6 năm 2023), tạo bối cảnh phát triển nhưng không phải là tiêu chuẩn đặc thù của Gemini. Frontier Safety Framework v3 (tháng 9 năm 2025) bao gồm các lĩnh vực CBRN, an ninh mạng, ML R&D, tác động thao túng và phương pháp tiếp cận thực nghiệm đối với rủi ro không liên kết (misalignment).
Các biện pháp đặc thù của Gemini
- Model cards — các nguồn thông tin chính về giới hạn và an toàn của các mô hình cụ thể. Chứa các phần Intended Usage and Limitations, Ethics and Content Safety, Frontier Safety. Model card của Gemini 3 Pro xác nhận rằng mô hình không đạt bất kỳ Mức độ Khả năng Quan trọng (Critical Capability Level) nào trong các lĩnh vực CBRN và an ninh mạng.
- Kiểm tra về định kiến và độc tính: Phân tích và giảm thiểu định kiến trong dữ liệu huấn luyện và tạo sinh nội dung.
- Nhóm đỏ (Red Teaming): Mô phỏng tấn công để xác định các lỗ hổng và hành vi không mong muốn. Kiểm tra độc lập về không liên kết đã phát hiện «một số gia tăng nhận thức tình huống», nhưng không tìm thấy rủi ro nghiêm trọng.
Đầu dò an toàn (Safety Probes)
Để ngăn chặn việc tạo nội dung có hại, phân loại các kích hoạt ẩn được áp dụng. Để giải quyết vấn đề mất tín hiệu trong các ngữ cảnh dài, kiến trúc MultiMax được sử dụng: đầu dò trích xuất giá trị tối đa trên tất cả các lớp cho mỗi token trong chuỗi :
Các đầu dò được kết hợp với các mô hình cơ sở thành các bộ phân loại tầng, nâng cao độ chính xác lọc với chi phí tính toán thấp (arXiv:2601.11516).
Đánh dấu mật mã học (SynthID)
Dữ liệu âm thanh được tạo qua Live API và hình ảnh (từ các mô hình Nano Banana / Flash Image) được đánh dấu bằng thuật toán SynthID. Hình mờ vô hình được nhúng ở cấp độ pixel hoặc phổ âm thanh, cho phép nhận dạng tự động nội dung được tạo sinh. Mô hình Nano Banana 2 (tháng 2 năm 2026) tích hợp SynthID với siêu dữ liệu C2PA.
Thinking và câu hỏi về tính minh bạch
Các mô hình có chế độ tư duy (dòng 2.5/3) có thể trả về thought summaries — các bản tóm tắt ngắn gọn về suy luận nội bộ, chứ không phải toàn bộ luồng token trung gian. Điều này cung cấp một mức độ minh bạch nhất định, nhưng bị chỉ trích vì các chuỗi suy luận «thô» thực sự bị ẩn sau các bản tóm tắt đơn giản hóa.
Các khía cạnh quy định
Trong khuôn khổ Đạo luật Trí tuệ Nhân tạo của EU (EU AI Act), Google đã ký Bộ quy tắc thực hành AI của EU (được công bố ngày 10 tháng 7 năm 2025) cùng với OpenAI và Anthropic. Gemini được phân loại là mô hình AI đa năng (GPAI) có rủi ro hệ thống, kéo theo các nghĩa vụ an toàn bổ sung (có hiệu lực từ ngày 2 tháng 8 năm 2025).
Môi trường cạnh tranh
Giai đoạn tháng 11 — tháng 12 năm 2025 trở thành chu kỳ cạnh tranh dày đặc nhất trong lịch sử AI: Gemini 3 Pro (18 tháng 11), Claude Opus 4.5 từ Anthropic (24 tháng 11) và GPT-5.2 từ OpenAI (11 tháng 12) được phát hành trong vòng 24 ngày. Tính đến tháng 2 năm 2026, không có mô hình nào thống trị ở tất cả các hạng mục: Gemini 3 Pro dẫn đầu trên LMArena về văn bản, thị giác, tìm kiếm và đa ngôn ngữ; GPT-5.2 dẫn đầu về toán học thuần túy (100% AIME 2025 không có công cụ) và SWE-bench Pro; Claude Opus 4.5 cạnh tranh trên SWE-bench Verified. Về chi phí API, Gemini rẻ hơn khoảng 42% so với GPT-5 cho các lời gọi có thể so sánh được.
Chỉ số kinh doanh
Theo dữ liệu báo cáo của Alphabet cho Q4 năm 2025 (công bố ngày 4 tháng 2 năm 2026): doanh thu Google Cloud — 17,7 tỷ đô la cho quý (+48% so với cùng kỳ năm trước); biên lợi nhuận hoạt động — 29,9%; danh mục đơn hàng Cloud — 240 tỷ đô la (tăng gấp đôi trong năm). Hơn 120 000 doanh nghiệp sử dụng Gemini. Vào tháng 1 năm 2026, Apple thông báo kế hoạch tích hợp Gemini vào Siri. Google xử lý hơn 10 tỷ token mỗi phút qua API. Các tác nhân AI nội bộ của Google tạo ra khoảng 50% mã nguồn của công ty. Chi tiêu vốn cho năm 2026 được lên kế hoạch ở mức 175–185 tỷ đô la (tăng gần gấp đôi so với 91,45 tỷ đô la vào năm 2025).
Tham khảo
- Chỉ mục mô hình Google DeepMind
- Tài liệu Gemini API dành cho nhà phát triển
- Danh mục mô hình Gemini API
- Tài liệu Gemini Thinking
- Sổ đăng ký ngừng sử dụng mô hình Gemini
- Chỉ mục model card Google DeepMind
Tài liệu
Báo cáo kỹ thuật chính của Gemini
- Gemini Team, Google (2023). Gemini: A Family of Highly Capable Multimodal Models. arXiv:2312.11805.
- Gemini Team, Google (2024). Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context. arXiv:2403.05530.
- Comanici, G. et al. (2025). Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities. arXiv:2507.06261.
Các mô hình chuyên biệt và ứng dụng
- Saab, K. et al. (2024). Capabilities of Gemini Models in Medicine. arXiv:2404.18416.
- Yang, L. et al. (2024). Advancing Multimodal Medical Capabilities of Gemini. arXiv:2405.03162.
- Gemini Robotics Team (2025). Gemini Robotics: Bringing AI into the Physical World. arXiv:2503.20020.
- Feng, T., Trinh, T., Bingham, G. et al. (2026). Semi-Autonomous Mathematics Discovery with Gemini: A Case Study on the Erdős Problems. arXiv:2601.22401.
- DeepMind Research Team (2026). Building Production-Ready Probes For Gemini. arXiv:2601.11516.
- Fu, Y., Wang, X., Tian, Y., Zhao, J. (2025). Deep Think with Confidence. arXiv:2508.15260.
Tài liệu (tổng quan và phương pháp)
- Wei, J. et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. arXiv:2201.11903.
- Zhang, Z. et al. (2022). Automatic Chain of Thought Prompting in Large Language Models. arXiv:2210.03493.
- Zhang, Z. et al. (2023). Multimodal Chain-of-Thought Reasoning in Language Models. arXiv:2302.00923.
- Cai, W. et al. (2024). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
- Dai, Z. et al. (2019). Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context. arXiv:1901.02860.
- Ding, J. et al. (2023). LongNet: Scaling Transformers to 1,000,000,000 Tokens. arXiv:2307.02486.
- Yin, S. et al. (2024). A Survey on Multimodal Large Language Models. arXiv:2306.13549.
- Wang, X. et al. (2023). Large-scale Multi-Modal Pre-trained Models: A Comprehensive Survey. arXiv:2302.10035.
- Chen, Q. et al. (2025). Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models. arXiv:2503.09567.
Bài đăng blog chính thức của Google
- Google (2023). Introducing Gemini: Google's most capable AI model yet. The Keyword, 06.12.2023.
- Google DeepMind (2024). Introducing Gemini 1.5. The Keyword, 15.02.2024.
- Google (2024). Introducing Gemini 2.0: A new AI model for the agentic era. The Keyword, 11.12.2024.
- Google DeepMind (2025). Gemini 2.0 model updates. The Keyword, 05.02.2025.
- Google DeepMind (2025). Gemini 2.5: Our newest Gemini model with thinking. The Keyword, 25.03.2025.
- Google DeepMind (2025). Google I/O 2025: Updates to Gemini 2.5. The Keyword, 20.05.2025.
- Google (2025). Gemini 3: Introducing the latest Gemini AI model. The Keyword, 18.11.2025.
- The Deep Think Team (2026). Gemini 3 Deep Think: Advancing science, research and engineering. Google Blog, 12.02.2026.
- The Gemini Team (2026). Gemini 3.1 Pro: A smarter model for your most complex tasks. Google Blog, 19.02.2026.