Gemini

Материал из Systems analysis wiki
Перейти к навигации Перейти к поиску

Google Gemini — это семейство мультимодальных больших языковых моделей (LLM), разрабатываемое исследовательским подразделением Google DeepMind. Модели Gemini, впервые представленные в декабре 2023 года, построены на архитектуре нейросетевых трансформеров (Transformer) с нативной поддержкой обработки и генерации данных различных модальностей, включая текст, изображения, аудио, видео и программный код.

По состоянию на февраль 2026 года актуальным поколением является линейка Gemini 3.x. Развитие архитектуры направлено на интеграцию механизмов масштабируемого логического вывода во время инференса (inference-time scaling) и оптимизацию моделей для использования в составе автономных агентных систем (Agentic AI). Приложение Gemini насчитывает более 750 миллионов активных пользователей в месяц.

Наименование и философия

Название "Gemini" (с лат. — Близнецы) символизирует объединение двух ведущих исследовательских групп Google — Google Brain и DeepMind — для создания этого проекта. Джефф Дин, сотехнический руководитель Google DeepMind, подтвердил это в официальном блоге (май 2024): «The twins here are the folks in the legacy Brain team and the legacy DeepMind team». Проект изначально имел кодовое имя «Titan»; название «Gemini» было предложено Дином в апреле 2023 года — в том же месяце, когда состоялось формальное слияние Google Brain и DeepMind. Название также отсылает к космической программе НАСА «Джемини» (1965–1968), роль которой в подготовке программы «Аполлон» нашла отклик у команды разработчиков.

Ключевой особенностью и философской основой Gemini является нативная мультимодальность. В отличие от многих предыдущих моделей, где мультимодальные возможности добавлялись поверх существующей текстовой основы, Gemini был спроектирован с нуля для одновременного понимания, оперирования и комбинирования различных типов информации. Технический отчёт Gemini 1.0 (arXiv:2312.11805) подтверждает, что модель «trained jointly across image, audio, video, and text data». Это позволяет модели не просто транслировать данные между модальностями, а формировать более глубокое, холистическое их понимание.

Архитектура и ключевые технологии

Успех и возможности моделей Gemini определяются рядом фундаментальных архитектурных решений. Google не публикует полный низкоуровневый дизайн всех внутренних компонентов Gemini, однако открытые источники позволяют установить класс архитектуры: все модели семейства 1.5 и выше являются sparse mixture-of-experts transformer-based models с нативной мультимодальной поддержкой (подтверждено model card Gemini 2.5 Flash).

Нативная мультимодальная архитектура

Архитектура Gemini базируется на концепции раннего слияния (early fusion). Пиксельные патчи изображений, временные кадры видео, аудиограммы и текстовые токены проецируются в единое латентное пространство. Технический отчёт по Gemini 2.5 описывает этот подход как «Unified Multimodal Token Interleaving». Поскольку все токены различных модальностей обрабатываются в общей последовательности, стандартные механизмы самовнимания (self-attention) естественным образом обеспечивают перекрёстную интеграцию данных из разных модальностей на каждом слое. Звуковые сигналы обрабатываются специализированными кодировщиками напрямую из аудиоволны (waveform), что сохраняет акустические характеристики (интонацию, тембр, фоновые шумы), которые теряются при использовании промежуточных систем транскрибирования Speech-to-Text.

Для трансформерного класса базовой операцией служит механизм внимания:

Attention(Q,K,V)=softmax(QKdk)V

где Q — матрица запросов, K — ключей, V — значений, а dk — размерность ключей.

Разреженная смесь экспертов (Sparse MoE)

Начиная с версии 1.5, модели Gemini используют архитектуру Sparse Mixture-of-Experts (MoE). Gemini 1.0 использовал плотный (dense) трансформер; переход к MoE прямо описан в техническом отчёте 1.5: «This is our first release from Gemini 1.5, a new family… which incorporates a novel mixture-of-experts architecture».

В MoE-архитектуре стандартные полносвязные слои (Feed-Forward Networks) заменены набором специализированных подсетей — «экспертов». Для входного токена xd выход y формируется как взвешенная сумма выходов k активных экспертов (kE, где E — общее число экспертов):

y=i𝒯k(x)gi(x)Ei(x)

где Ei(x) — нелинейная функция i-го эксперта, 𝒯k(x) — множество индексов k выбранных подсетей, а вес маршрутизации gi(x) вычисляется обученной функцией маршрутизации (learned routing function) с применением функции Softmax поверх k наибольших значений.

Такой подход позволяет значительно увеличить общую параметрическую ёмкость модели, сохраняя при этом вычислительные затраты (FLOPs) на низком уровне, поскольку для каждого токена активируется лишь подмножество параметров. Google не раскрывала фактическое число параметров моделей Gemini.

Длинный контекст и «Обучение в контексте»

Gemini 1.5 совершила прорыв, увеличив размер контекстного окна до 1 миллиона токенов в production-режиме (с экспериментальным тестированием до 10 миллионов токенов). Это на порядок больше, чем у предыдущих моделей (например, GPT-4 Turbo с 128 тыс. токенов). Google заявляла о результате 99% в тесте Needle In A Haystack при длине контекста 1 млн токенов. Для последующих поколений long context закрепился как одна из ключевых особенностей линейки. Такой масштабный контекст позволяет модели:

  • Анализировать целые книги, многочасовые видео (до 3 часов) или большие кодовые базы внутри одного запроса.
  • Выполнять «обучение в контексте» (in-context learning) на огромных объёмах данных, предоставленных в промпте, что позволяет получать высоко кастомизированные ответы без необходимости дообучения (fine-tuning).

«Мыслящие модели» и масштабирование вычислений при инференсе

Начиная с Gemini 2.5, Google выделяет thinking как отдельный режим работы моделей. Официальная документация определяет его как внутренний вычислительный процесс, улучшающий многошаговое планирование и рассуждение. Модели версии 2.5 (описанные как «thinking models») способны внутренне генерировать и оценивать промежуточные шаги рассуждений перед тем, как дать финальный ответ. Это значительно повышает точность на сложных логических и математических задачах.

Важно различать два механизма:

  • Встроенное мышление (Thinking): Базовый режим для моделей 2.5 и 3-серии, генерирующий скрытую цепочку рассуждений (Chain-of-Thought). API может возвращать thought summaries — краткие сводки по внутренним рассуждениям, а не полный поток «сырых мыслей». Начиная с модели 3.1 Pro, бюджет мышления регулируется параметром thinking_level со значениями от Low до Max.
  • Deep Think: Отдельный экспериментальный расширенный режим рассуждений, использующий параллельную генерацию гипотез и требующий значительно больших вычислительных ресурсов. Был анонсирован на Google I/O 20 мая 2025 года и открыт для подписчиков AI Ultra 1 августа 2025. Deep Think не следует отождествлять с базовым механизмом thinking.

Агентные возможности (Agentic Capabilities)

Начиная с версии 2.0, Gemini может взаимодействовать с внешним миром: вызывать инструменты, осуществлять поиск в Google, исполнять код и управлять UI-элементами. Google прямо позиционировала Gemini 2.0 как модель для «новой агентной эры» (agentic era) с нативной поддержкой tool use.

К февралю 2026 года Gemini API включает формально закреплённый слой агентных возможностей с поддержкой инструментов: Google Search, Google Maps, Code Execution, URL Context, Computer Use, File Search, а также Live API для двунаправленного взаимодействия в реальном времени.

Эволюция моделей Gemini

Семейство Gemini развивается чрезвычайно быстрыми темпами: за период с декабря 2023 по февраль 2026 года было выпущено четыре основных поколения моделей.

Gemini 1.0 (декабрь 2023)

Первое поколение, заложившее фундамент нативной мультимодальности. Публично представлено 6 декабря 2023 года.

  • Версии: Ultra (флагман для самых сложных задач), Pro (универсальная модель) и Nano (компактная для мобильных устройств; подразделялась на Nano-1 с 1,8 млрд параметров и Nano-2 с 3,25 млрд).
  • Контекстное окно: 32 768 токенов для всех версий.
  • Достижения: Gemini 1.0 Ultra стала первой моделью, достигшей и превзошедшей уровень человека-эксперта на бенчмарке MMLU с результатом 90,04% (при использовании техники CoT@32 — цепочки рассуждений с 32 выборками и голосованием большинства; при стандартном 5-shot промптинге результат составил около 83,7%). Показала SOTA-результаты на 30 из 32 академических бенчмарков.
  • Прекращение поддержки: Gemini 1.0 Pro был объявлен устаревшим 18 февраля 2025 года.

Gemini 1.5 (февраль — май 2024)

Прорыв в длине контекста и эффективности.

  • Архитектура: Переход от плотного трансформера к Mixture-of-Experts (MoE).
  • Контекстное окно: До 1 миллиона токенов в production (2 миллиона — по waitlist для 1.5 Pro, объявлено в мае 2024 на Google I/O).
  • Версии: 1.5 Pro (анонсирован в феврале 2024; с качеством на уровне 1.0 Ultra при значительно меньших затратах) и 1.5 Flash (облегчённая и быстрая версия, добавлена в мае 2024).
  • Прекращение поддержки: Все модели Gemini 1.5 (Pro, Flash, Flash-8B) были выведены из эксплуатации 29 сентября 2025 года.

Gemini 2.0 (декабрь 2024 — февраль 2025)

Переход к «агентной эре».

  • Хронология: 11 декабря 2024 — анонс 2.0 Flash Experimental (мультимодальный ввод, текстовый вывод); 5 февраля 2025 — широкая доступность (GA) 2.0 Flash, выпуск 2.0 Pro Experimental и 2.0 Flash-Lite.
  • Ключевые инновации: Встроенные агентные возможности (tool use), нативная генерация изображений и аудио (изначально в ограниченном режиме для early-access партнёров), ориентация на агентные сценарии.
  • Контекстное окно: До 2 млн токенов (2.0 Pro); до 1 млн токенов (2.0 Flash-Lite).
  • Прекращение поддержки: Модели 2.0 Flash и Flash-Lite запланированы к выводу из эксплуатации 1 июня 2026 года.

Gemini 2.5 (март — июнь 2025)

Первая «мыслящая модель» (thinking model) с настраиваемым бюджетом рассуждений.

  • Хронология: 25 марта 2025 — анонс 2.5 Pro Experimental; 17 апреля — 2.5 Flash (первая полностью гибридная reasoning-модель с переключаемым режимом мышления); 20 мая (Google I/O) — обновления 2.5 Pro и Flash, анонс Deep Think; 17 июня 2025 — одновременная GA для 2.5 Pro и 2.5 Flash; в тот же день — превью 2.5 Flash-Lite (GA 22 июля). 1 августа — Deep Think открыт для подписчиков AI Ultra.
  • Ключевые инновации: Встроенный механизм «мышления» (thinking) с настраиваемыми бюджетами; Deep Think как отдельный расширенный режим. SOTA-результаты на сложных математических, логических и программных бенчмарках (AIME 2025 — 86,7%, GPQA Diamond — 84,0%, Humanity's Last Exam — 18,8% без инструментов).
  • Контекстное окно: 1 миллион токенов на входе, до 64 000 токенов на выходе. Обещанное расширение до 2 млн токенов для 2.5 Pro так и не было подтверждено как реализованное в течение жизненного цикла модели.
  • Специализированные варианты: Gemini 2.5 Flash Image (кодовое имя «Nano Banana», анонимно появился на Arena 12 августа, официально выпущен 26 августа 2025 — стал вирусным благодаря фотореалистичным «3D-фигуркам», привлёк 10 млн новых пользователей); Computer Use Preview (7 октября 2025, на базе 2.5 Pro); модели Text-to-Speech (2.5 Flash TTS, 2.5 Pro TTS).
  • Технический отчёт: Объединённый отчёт Gemini 2.X опубликован на arXiv 7 июля 2025 (arXiv:2507.06261), содержит более 3 300 авторов и охватывает модели 2.5 Pro, 2.5 Flash, 2.0 Flash, 2.0 Flash-Lite.

Gemini 3.x (ноябрь 2025 — февраль 2026)

Третье поколение ознаменовало переход от базовой генерации к длительным агентным процессам (agentic workflows) и решению междисциплинарных научных задач.

  • Gemini 3 Pro (18 ноября 2025): Объявлена генеральным директором Alphabet Сундаром Пичаем и главой DeepMind Демисом Хассабисом как «наиболее интеллектуальная модель Google». Первая модель Gemini, развёрнутая в Google Search в день запуска. Стала первой моделью, преодолевшей рубеж 1500 Elo на LMArena (1501 на момент запуска). Результаты: GPQA Diamond — 91,9%; SWE-bench Verified — 76,2%; Humanity's Last Exam — 37,5% (без инструментов); SimpleQA — 72,1%.
  • Gemini 3 Flash (17 декабря 2025): Стала моделью по умолчанию в приложении Gemini. При цене $0,50 / 1M входных токенов превзошла 3 Pro на SWE-bench Verified (78%) при использовании на 30% меньше токенов на задачи рассуждения. GPQA Diamond — 90,4%; HLE — 33,7%.
  • Gemini 3.1 Pro (19 февраля 2026): Флагманская модель на дату публикации. Первый «инкрементальный» релиз (.1 вместо прежних .5). Ключевой результат — ARC-AGI-2: 77,1% (более чем вдвое выше 31,1% у 3 Pro). AIME 2025 — 91,2%; GPQA Diamond — 94,3%; SWE-bench Verified — 80,6%. Внедрён новый уровень мышления MEDIUM через параметр thinking_level. Специализированный эндпоинт gemini-3.1-pro-preview-customtools для работы с bash-терминалом и пользовательскими функциями. Устранена проблема усечения вывода при длинных генерациях. Каналы: Gemini App, Vertex AI, AI Studio, Gemini API, NotebookLM.
  • Gemini 3 Deep Think (обновление 12 февраля 2026): Мажорное обновление специализированного «мыслящего» режима. Вышел за рамки математики и программирования: результаты уровня золотых медалей на международных олимпиадах по физике (IPhO) и химии (IChO) 2025 года; ARC-AGI-2 — 84,6%; Humanity's Last Exam — 48,4%; CMT-Benchmark (теоретическая физика конденсированных сред) — 50,5%; Codeforces Elo — 3455. На базе Deep Think создан исследовательский агент Aletheia, автономно решивший несколько открытых задач из базы Эрдёша (включая проблему Erdős-1051).

Сводная таблица поколений Gemini

Эволюция ключевых характеристик моделей Gemini
Поколение Год выпуска Ключевые версии Макс. контекстное окно Ключевые архитектурные инновации и улучшения
Gemini 1.0 2023 Ultra, Pro, Nano 32 768 токенов Нативная мультимодальность с нуля; плотный трансформер; превосходство над человеком на MMLU (90,04% CoT@32).
Gemini 1.5 2024 Pro, Flash 1 000 000 токенов (2 млн по waitlist) Архитектура Mixture-of-Experts (MoE); революционное увеличение контекста; 99% Needle In A Haystack.
Gemini 2.0 2024–2025 Pro, Flash, Flash-Lite 1 000 000 — 2 000 000 токенов Эра «agentic AI»: нативная интеграция инструментов, генерация изображений и аудио, Live API.
Gemini 2.5 2025 Pro, Flash, Flash-Lite 1 000 000 токенов (вход), 64 000 (выход) «Мыслящая модель» (thinking); настраиваемые бюджеты рассуждений; Deep Think; генерация изображений (Nano Banana); Computer Use.
Gemini 3.x 2025–2026 3 Pro, 3 Flash, 3.1 Pro, 3 Deep Think 1 000 000 токенов Агентные workflows; параметр thinking_level; прорыв на ARC-AGI-2 и научных олимпиадах; Aletheia.

Ключевые результаты и бенчмарки

В связи с насыщением классических бенчмарков (таких как MMLU), оценка производительности моделей Gemini сместилась к задачам на абстрактное мышление, научное моделирование и автономное программирование. Результаты приводятся по официальным данным Google (self-reported); их сопоставление корректно только при совпадении режима инференса, наличия/отсутствия tool use, метода выборки (single-attempt vs. majority voting) и конкретного model-id.

Результаты моделей Gemini на ключевых бенчмарках (данные на февраль 2026 года)
Бенчмарк Описание задачи Gemini 2.5 Pro (июнь 2025) Gemini 3 Pro (нояб. 2025) Gemini 3.1 Pro (фев. 2026) Gemini 3 Deep Think (фев. 2026)
MMLU Многозадачное понимание языка
GPQA Diamond Научные вопросы уровня PhD 84,0% 91,9% 94,3% Н/Д
Humanity's Last Exam Фронтирные предметные знания 18,8% 37,5% 44,4% 48,4%
ARC-AGI-2 Абстрактные логические головоломки 4,9% 31,1% 77,1% 84,6%
SWE-bench Verified Автономное решение задач в репозиториях GitHub 63,8%* 76,2% 80,6% Н/Д
AIME 2025 Математические задачи олимпиадного уровня 86,7% 91,2%
Codeforces (Elo) Рейтинг в соревновательном программировании 2887 3455

* Результат 2.5 Pro на SWE-bench получен с custom agent setup.

Специализированные и агентные системы

Экосистема Gemini расширена моделями и платформами, способными выполнять многоэтапные действия в цифровой и физической среде.

Автономные агенты

  • Jules — автономный агент кодирования, работающий асинхронно в защищённых облачных виртуальных машинах. Создаёт ветки и pull-реквесты в GitHub. Вышел в открытую бету на Google I/O 20 мая 2025 года (более 140 000 улучшений кода за период бета-тестирования), GA — 6 августа 2025 года. К концу 2025 года стал одним из крупнейших контрибьюторов во внутренние репозитории Google.
  • Project Mariner — исследовательский прототип браузерного агента для многошаговых веб-задач. Перенесён на облачные виртуальные машины с поддержкой до 10 параллельных задач и функцией «Teach & Repeat». Достиг 83,5% на бенчмарке WebVoyager. Возможности Computer Use перенесены в Gemini API.
  • Google Antigravity — представленная в ноябре 2025 года интегрированная среда разработки (IDE) для управления ИИ-агентами. Агенты автономно модифицируют код, взаимодействуют с терминалом и встроенным браузером, возвращая верифицируемые артефакты (диффы кода) для утверждения разработчиком.
  • Агент Aletheia — специализированный математический исследовательский агент на базе Gemini 3 Deep Think. Оснащён верификатором на естественном языке и инструментами веб-поиска для проверки литературы. В начале 2026 года автономно решил несколько открытых математических задач из базы Эрдёша и выступил соавтором научных публикаций.

Потребительские ИИ-агенты

  • Phone Automations — интеграция автономного агента на уровень операционной системы Android (бета-версия для Pixel 10 и Samsung Galaxy S26). Функционирует в защищённой изолированной среде (secure sandbox), способен навигировать по сторонним приложениям на основе визуального анализа GUI.
  • Gemini in Chrome (Auto Browse) — браузерный агент для автоматизации многошаговых веб-задач, доступный всем пользователям Chrome с сентября 2025 года (обновлён до Gemini 3 в январе 2026).

Computer Use

Модели Gemini 2.5 Computer Use оптимизированы для управления графическими пользовательскими интерфейсами (UI). Система принимает на вход скриншоты и историю действий, генерируя координаты (x,y) для программной симуляции курсора и команды клавиатурного ввода.

Gemini Robotics

Представленные в марте 2025 года модели класса Vision-Language-Action (VLA) и Embodied Reasoning (ER). Данные архитектуры обрабатывают пространственно-временную информацию и предсказывают 3D-траектории движения робототехнических манипуляторов в качестве нативной выходной модальности (arXiv:2503.20020).

Специализированные генеративные модели (начало 2026 года)

  • Nano Banana 2 (Gemini 3.1 Flash Image) — выпущена 26 февраля 2026, визуальная модель, комбинирующая скорость Flash-архитектуры с качеством Pro. Обеспечивает строгое сохранение идентичности персонажей (character consistency), нативную генерацию типографики внутри изображений и интеграцию криптографических водяных знаков SynthID с метаданными C2PA.
  • Lyria 3 — музыкальная модель, интегрированная в приложение Gemini 18 февраля 2026 года. Генерирует 30-секундные музыкальные композиции (включая вокал и инструментал) по текстовым промптам, фотографиям или видео.
  • Veo 3.1 — модель генерации видео. Поддерживает создание роликов с использованием до трёх опорных изображений («Ingredients to Video»), генерацию переходов между заданными первым и последним кадрами, нативный рендеринг вертикальных видео (9:16) и апскейлинг до 4K-разрешения.
  • Med-Gemini — доменно-специфичная модель для медицинских задач (arXiv:2404.18416, arXiv:2405.03162).

Применение и экосистема

Google глубоко интегрирует Gemini в свои потребительские и разработческие продукты.

Потребительские продукты

  • Приложение Gemini: Чат-бот (ранее Bard, переименован 8 февраля 2024 года), использующий модели семейства Gemini как универсальный AI-ассистент. К февралю 2026 года насчитывает более 750 миллионов активных пользователей. Актуальный rollout включает модель 3.1 Pro. Подписки: Google AI Pro ($19,99/мес., заменила Google One AI Premium) и Google AI Ultra ($249,99/мес., с доступом к Deep Think, Veo 3 и приоритетным функциям).
  • Google Workspace: Интеграция Gemini в Gmail, Docs, Sheets, Meet для помощи в написании текстов, анализа данных и генерации контента (ребрендинг с Duet AI).
  • Google Поиск: Функция AI Overviews генерирует сводные ответы на сложные запросы на основе специализированной модели Gemini. AI Mode, запущенный на Google I/O 2025, обеспечивает глубокий поиск с агентными возможностями (бронирование, покупки).
  • Android и Pixel: Gemini Nano (v3 на Pixel 10 с чипом Tensor G5, август 2025) работает локально на смартфонах, обеспечивая умные ответы, суммирование, обнаружение мошеннических звонков и доступность, сохраняя приватность данных. ML Kit GenAI API для разработчиков поддерживает суммирование, корректуру и распознавание речи на устройстве.
  • NotebookLM: Эволюционировал из инструмента заметок в полноценную креативную платформу. Вошёл в состав Google Workspace в марте 2025 года. Поддерживает интерактивные Audio Overviews, Video Overviews, Mind Maps, слайды, инфографику. Обновлён до Gemini 3 в декабре 2025; полное контекстное окно 1 млн токенов для чата — с февраля 2026.
  • Gemini Live: Функции камеры и экранного шаринга из Project Astra стали бесплатными для всех пользователей Android и iOS.

Платформы для разработчиков

  • Google AI Studio и Gemini API: Основные интерфейсы для доступа к моделям Gemini через API. К февралю 2026 поддерживают capability-блоки: Thinking, Thought signatures, Long context, Tools and agents (Google Search, Maps, Code Execution, URL Context, Computer Use, File Search, Deep Research, Live API).
  • Vertex AI: Корпоративная платформа с расширенными возможностями безопасности и управления.
  • Google Gen AI SDK: Достиг GA для Python, JavaScript/TypeScript, Go и Java к маю 2025 года, предоставляя единый доступ к Gemini Developer API и Vertex AI. Поддерживает Model Context Protocol (MCP).
  • Gemini CLI: Инструмент командной строки для AI-кодирования в терминале (запущен в июне 2025).
  • Interactions API: Единый интерфейс для моделей и агентов (бета с декабря 2025).

Жизненный цикл API и управление версиями

Модели Gemini в API делятся на категории stable, preview, latest и experimental. Конкретный model_id и семейство моделей — не одно и то же; для production-сценариев критически важна привязка к конкретной версии и срокам её поддержки. В документации API ведётся реестр депрекаций с указанием дат прекращения поддержки.

Для поддержки длительных автономных задач внедрены: Session Resumption (хранение состояния сессии на сервере до 24 часов) и Context Compression (механизм скользящего окна для автоматического сжатия контекста при превышении лимита).

В декабре 2025 года Google снизила квоты бесплатного уровня API примерно на 92% (без предварительного предупреждения), что вызвало резкую реакцию сообщества разработчиков. При этом стоимость обслуживания моделей Gemini снизилась на 78% за 2025 год благодаря оптимизациям.

Ограничения и открытые проблемы

  • Галлюцинации и конфабуляции: Модели сохраняют склонность к генерации фактологически неверной информации, особенно при отключённых функциях заземления (Search Grounding). Gemini 3.1 Pro снизила уровень галлюцинаций по бенчмарку SimpleQA по сравнению с предыдущими версиями, однако проблема остаётся системной для всех LLM.
  • Подсознательный плагиат (Subconscious Plagiarism): В экспериментах с агентом Aletheia выявлена проблема воспроизведения нетривиальных доказательств из обучающей выборки, выдаваемых за автономные открытия, что усложняет валидацию новизны ИИ-исследований.
  • Деградация в длинном контексте: При обработке контекстов размером в 1 миллион токенов модели подвержены эффекту «Lost in the Middle» — снижению точности извлечения фактов из середины документа.
  • Высокие вычислительные затраты: Инференс с максимальными настройками Deep Think требует значительно большего времени и ресурсов (TPU), что ограничивает применение в синхронных приложениях реального времени.
  • Ложноположительные отказы (Over-refusals): Из-за строгих алгоритмов выравнивания (alignment) модели для сложных рассуждений склонны отклонять легитимные запросы, ложно классифицируя их как потенциально опасные (особенно в контексте анализа кода и информационной безопасности). В model card отмечаются также проблемы «назидательного» (preachy) тона отказов.
  • Ограничения рассуждений: Model cards 2.5- и 3-серии перечисляют ограничения в каузальном понимании (causal understanding), сложных логических дедукциях (complex logical deduction) и контрфактическом рассуждении (counterfactual reasoning), а также неполную предсказуемость соблюдения бюджетов мышления.

Этические аспекты и безопасность

Развёртывание моделей Gemini сопровождается многоуровневой системой мер безопасности.

Общие рамки

Secure AI Framework (SAIF) — общий Google-подход к безопасности AI-систем (анонсирован в июне 2023), формирующий контекст разработки, но не являющийся Gemini-специфичным стандартом. Frontier Safety Framework v3 (сентябрь 2025) охватывает домены CBRN, кибербезопасности, ML R&D, манипулятивного воздействия и экспериментальный подход к рискам несогласованности (misalignment).

Gemini-специфичные меры

  • Model cards — первичные источники информации об ограничениях и безопасности конкретных моделей. Содержат разделы Intended Usage and Limitations, Ethics and Content Safety, Frontier Safety. Model card Gemini 3 Pro подтвердил, что модель не достигла ни одного критического уровня возможностей (Critical Capability Level) по доменам CBRN и кибербезопасности.
  • Тестирование на предвзятость и токсичность: Анализ и смягчение предвзятости в обучающих данных и генерации контента.
  • Красные команды (Red Teaming): Имитация атак для выявления уязвимостей и нежелательного поведения. Независимое тестирование на несогласованность выявило «некоторое повышение ситуационной осведомлённости», но не обнаружило критических рисков.

Зонды безопасности (Safety Probes)

Для предотвращения генерации вредоносного контента применяется классификация скрытых активаций. Для решения проблемы потери сигнала в длинных контекстах используется архитектура MultiMax: зонд выделяет максимальное значение по всем слоям H для каждого токена j в последовательности ni:

fMultiMax(Si)=h=1Hmaxj[ni][vhyi,j]

Зонды объединяются с базовыми моделями в каскадные классификаторы, повышая точность фильтрации при низких вычислительных затратах (arXiv:2601.11516).

Криптографическая маркировка (SynthID)

Аудиоданные, генерируемые через Live API, и изображения (от моделей Nano Banana / Flash Image) проходят маркировку алгоритмом SynthID. Невидимый водяной знак внедряется на уровне пикселей или аудиоспектра, обеспечивая машинное распознавание сгенерированного контента. Модель Nano Banana 2 (февраль 2026) интегрирует SynthID с метаданными C2PA.

Thinking и вопрос прозрачности

Модели с режимом мышления (2.5/3-серии) могут возвращать thought summaries — краткие сводки внутренних рассуждений, а не полный поток промежуточных токенов. Это обеспечивает определённый уровень прозрачности, однако подвергается критике за то, что реальные «сырые» цепочки рассуждений скрываются за упрощёнными сводками.

Регуляторные аспекты

В рамках Акта ЕС об искусственном интеллекте (EU AI Act) Google подписала Кодекс практик ЕС по ИИ (опубликован 10 июля 2025 года) наряду с OpenAI и Anthropic. Gemini классифицируется как модель ИИ общего назначения (GPAI) с системным риском, что влечёт дополнительные обязательства по безопасности (в силе с 2 августа 2025).

Конкурентная среда

Период ноябрь — декабрь 2025 года стал наиболее плотным конкурентным циклом в истории ИИ: Gemini 3 Pro (18 ноября), Claude Opus 4.5 от Anthropic (24 ноября) и GPT-5.2 от OpenAI (11 декабря) были выпущены в течение 24 дней. На февраль 2026 года ни одна модель не доминирует во всех категориях: Gemini 3 Pro лидирует на LMArena по тексту, зрению, поиску и мультиязычности; GPT-5.2 лидирует на чистой математике (100% AIME 2025 без инструментов) и SWE-bench Pro; Claude Opus 4.5 конкурирует на SWE-bench Verified. По стоимости API Gemini примерно на 42% дешевле GPT-5 при сопоставимых вызовах.

Бизнес-показатели

По данным отчётности Alphabet за Q4 2025 (опубликована 4 февраля 2026): выручка Google Cloud — $17,7 млрд за квартал (+48% год к году); операционная маржа — 29,9%; портфель заказов Cloud — $240 млрд (удвоение за год). Более 120 000 предприятий используют Gemini. В январе 2026 года Apple объявила о планах интеграции Gemini в Siri. Google обрабатывает более 10 миллиардов токенов в минуту через API. Внутренние ИИ-агенты Google генерируют около 50% собственного кода компании. Капитальные расходы на 2026 год запланированы на уровне $175–185 млрд (почти двукратный рост к $91,45 млрд в 2025).

См. также

Ссылки

Литература

Первичные технические отчёты Gemini

  • Gemini Team, Google (2023). Gemini: A Family of Highly Capable Multimodal Models. arXiv:2312.11805.
  • Gemini Team, Google (2024). Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context. arXiv:2403.05530.
  • Comanici, G. et al. (2025). Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities. arXiv:2507.06261.

Специализированные модели и применения

  • Saab, K. et al. (2024). Capabilities of Gemini Models in Medicine. arXiv:2404.18416.
  • Yang, L. et al. (2024). Advancing Multimodal Medical Capabilities of Gemini. arXiv:2405.03162.
  • Gemini Robotics Team (2025). Gemini Robotics: Bringing AI into the Physical World. arXiv:2503.20020.
  • Feng, T., Trinh, T., Bingham, G. et al. (2026). Semi-Autonomous Mathematics Discovery with Gemini: A Case Study on the Erdős Problems. arXiv:2601.22401.
  • DeepMind Research Team (2026). Building Production-Ready Probes For Gemini. arXiv:2601.11516.
  • Fu, Y., Wang, X., Tian, Y., Zhao, J. (2025). Deep Think with Confidence. arXiv:2508.15260.

Литература (обзоры и методы)

  • Wei, J. et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. arXiv:2201.11903.
  • Zhang, Z. et al. (2022). Automatic Chain of Thought Prompting in Large Language Models. arXiv:2210.03493.
  • Zhang, Z. et al. (2023). Multimodal Chain-of-Thought Reasoning in Language Models. arXiv:2302.00923.
  • Cai, W. et al. (2024). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
  • Dai, Z. et al. (2019). Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context. arXiv:1901.02860.
  • Ding, J. et al. (2023). LongNet: Scaling Transformers to 1,000,000,000 Tokens. arXiv:2307.02486.
  • Yin, S. et al. (2024). A Survey on Multimodal Large Language Models. arXiv:2306.13549.
  • Wang, X. et al. (2023). Large-scale Multi-Modal Pre-trained Models: A Comprehensive Survey. arXiv:2302.10035.
  • Chen, Q. et al. (2025). Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models. arXiv:2503.09567.

Официальные блог-посты Google