Mistral
Mistral AI — французская компания в области искусственного интеллекта, специализирующаяся на разработке больших языковых моделей (LLM). Основанная в апреле 2023 года, компания быстро стала одним из ключевых игроков на европейском и мировом рынках, позиционируя себя как альтернатива проприетарным моделям от американских технологических гигантов.
Ключевой особенностью подхода Mistral AI является фокус на создании высокопроизводительных моделей с открытыми весами (преимущественно под лицензией Apache 2.0), что способствует демократизации доступа к передовым технологиям ИИ. Компания известна своими архитектурными инновациями, такими как Grouped-Query Attention (GQA), Sliding Window Attention (SWA) и Sparse Mixture-of-Experts (MoE), которые позволяют их моделям достигать высокой эффективности при относительно небольшом размере и вычислительных затратах.
История
Компания Mistral AI была основана в Париже в апреле 2023 года тремя французскими исследователями: Артуром Меншем (Arthur Mensch), Гийомом Ламплем (Guillaume Lample) и Тимоте Лакруа (Timothée Lacroix). Все трое основателей ранее работали над крупными языковыми моделями в ведущих мировых компаниях: Менш был исследователем в Google DeepMind, а Лампль и Лакруа занимались LLM в Meta AI.
Миссия компании — сделать передовые достижения ИИ доступными для всех, продвигая открытость, сотрудничество и прозрачность. Этот подход позволил Mistral AI быстро привлечь значительные инвестиции:
- Июнь 2023: €105 млн в seed-раунде, что стало рекордом для Европы.
- Декабрь 2023: €385 млн в раунде Series A, после чего оценка компании превысила $2 млрд, и она получила статус «единорога».
- Февраль 2024: Объявлено о стратегическом партнёрстве с Microsoft, которое включало инвестиции в размере $16 млн и размещение моделей Mistral в облаке Azure.
- Июнь 2024: Новый раунд финансирования на €600 млн, в результате которого оценка компании достигла ~€5,8 млрд, сделав её одним из самых дорогих ИИ-стартапов в мире.
Технические особенности архитектуры
Модели Mistral AI основаны на архитектуре трансформеров, но включают ряд ключевых инноваций, направленных на повышение эффективности и снижение вычислительных затрат.
Трансформер с улучшениями (Mistral 7B)
Первая модель компании, Mistral 7B, представила два важных архитектурных улучшения:
- Sliding Window Attention (SWA) (Внимание со скользящим окном): Вместо того чтобы каждый токен взаимодействовал со всеми предыдущими токенами (что имеет квадратичную сложность), SWA ограничивает внимание фиксированным окном (например, 4096 токенов). Это позволяет обрабатывать очень длинные последовательности (до 32 000 токенов и более) с линейной вычислительной сложностью, значительно ускоряя обработку.
- Grouped-Query Attention (GQA) (Сгруппированное внимание по запросам): Оптимизация стандартного механизма multi-head attention. GQA использует меньшее количество «голов» для ключей (keys) и значений (values), чем для запросов (queries) (например, в соотношении 8:1), что существенно снижает требования к памяти и ускоряет процесс генерации (инференс) без значительной потери качества.
Sparse Mixture-of-Experts (MoE)
В моделях серии Mixtral (например, Mixtral 8x7B, Mixtral 8x22B) применяется архитектура Sparse Mixture-of-Experts (разреженная смесь экспертов). Вместо одного плотного слоя нейронной сети используется несколько параллельных «экспертных» подсетей. Для каждого входного токена специальный gating-слой (маршрутизатор) динамически выбирает небольшое подмножество экспертов для активации (обычно 2 из 8).
Это позволяет создавать модели с огромным общим числом параметров (Mixtral 8x22B имеет 141 млрд), но при обработке каждого токена используется лишь малая их часть (~39 млрд). В результате модель достигает качества, сопоставимого с гораздо более крупными «плотными» моделями, но со скоростью и стоимостью инференса, как у моделей значительно меньшего размера.
Архитектура Mamba (SSM)
В 2024 году Mistral AI представила экспериментальную модель Codestral Mamba, основанную на архитектуре Mamba (Selective State-Space Model). В отличие от трансформеров, Mamba использует рекуррентный механизм, основанный на моделях пространства состояний. Ключевые преимущества:
- Линейная сложность по длине последовательности, что делает её чрезвычайно быстрой на длинных контекстах.
- Теоретически «бесконечный» контекст, ограниченный только доступной памятью.
- Высокая скорость инференса по сравнению с эквивалентными трансформерами.
Хронология и модели
| Месяц / Год | Модель | Параметры (млрд) | Ключевые особенности | Лицензия |
|---|---|---|---|---|
| 09 / 2023 | Mistral 7B | 7,3 | Архитектура GQA + SWA; контекст 32k; превосходит Llama 2 13B на всех бенчмарках. | Apache 2.0 |
| 12 / 2023 | Mixtral 8x7B | 46,7 (12,9 активных) | Первая открытая MoE-модель; качество на уровне GPT-3.5. | Apache 2.0 |
| 02 / 2024 | Mistral Small / Large | ? | «Младшая» и флагманская модели, доступные через API. | Small: Apache 2.0, Large: Research |
| 04 / 2024 | Mixtral 8x22B | 141 (39 активных) | Контекст 64k; SOTA-качество среди open-source моделей на момент выхода. | Apache 2.0 |
| 05 / 2024 | Codestral 22B | 22 | Специализированная модель для генерации кода (80+ языков). | Non-Production |
| 07 / 2024 | Mathstral 7B / Nemo 12B | 7 / 12 | Специализированные модели для математики и многоязычия. | Apache 2.0 |
| 07 / 2024 | Codestral Mamba 7.3B | 7,3 | Экспериментальная модель для кода на архитектуре Mamba; контекст 256k+. | Apache 2.0 |
| 09 / 2024 | Pixtral 12B | 12 | Первая открытая мультимодальная модель (текст + изображения). | Apache 2.0 |
| 11 / 2024 | Mistral Large 24.11 | ~100+ (оценка) | Обновленная флагманская модель с улучшенным reasoning. | Research |
| 01 / 2025 | Mistral Small 3 | 24 | Оптимизирована для низкой задержки (до 150 токенов/с); качество на уровне 70B-моделей. | Apache 2.0 |
| 05 / 2025 | Mistral Medium 3 | ? | Фронтирная мультимодальная модель (текст, изображения) с контекстом 128k. | Проприетарная |
| 05 / 2025 | Devstral 24B | 24 | «Агентная» модель для автономной разработки ПО; 46,8% на SWE-Bench. | Apache 2.0 |
Сравнение с конкурентами
- vs. Llama (Meta): Модели Mistral стабильно превосходят модели Llama аналогичного или даже большего размера. Mistral 7B превзошла Llama 2 13B, а Mixtral 8x7B — Llama 2 70B. Главное отличие — лицензия: Mistral использует полностью разрешительную Apache 2.0, в то время как лицензия Llama имеет ограничения.
- vs. GPT (OpenAI): Флагманские модели OpenAI (GPT-4) остаются лидерами в самых сложных задачах, однако открытые модели Mistral (например, Mixtral 8x7B) демонстрируют качество, сопоставимое с GPT-3.5. Mistral предоставляет открытую альтернативу, позволяя разворачивать модели локально и полностью их контролировать.
- vs. Claude (Anthropic): Модели Claude известны большим контекстным окном и ориентацией на безопасность. Mistral предложила открытые модели с сопоставимым или большим контекстом. По производительности на стандартных бенчмарках (LMSys Arena) модель Medium 3 превзошла Claude 3 Opus.
Применение и экосистема
Продукты
- Le Chat: Публичный чат-ассистент (веб, iOS/Android), демонстрирующий возможности моделей Mistral, включая веб-поиск и генерацию изображений.
- La Plateforme: Корпоративная платформа с доступом по API ко всем моделям Mistral, позволяющая компаниям интегрировать LLM в свои продукты.
Корпоративные клиенты
Технологии Mistral используются крупными компаниями, такими как BNP Paribas (финансы), CMA CGM (логистика), Zalando (e-commerce) и государственным агентством France Travail. Для европейских клиентов важна возможность локального развёртывания моделей для соответствия GDPR.
Сообщество Open-Source
Благодаря открытой лицензии, модели Mistral стали основой для тысяч проектов на платформах вроде Hugging Face. Сообщество активно дообучает модели для решения специализированных задач, создавая версии для биологии (BioMistral), юриспруденции (SaulLM-7B) и локализации на различные языки (например, Polish Bielik 7B).
Лицензирование
| Серия моделей | Лицензия | Ограничения |
|---|---|---|
| Базовые, Small, Mixtral, Mathstral, Nemo, Pixtral, Devstral | Apache 2.0 | Свободное коммерческое использование. |
| Codestral 22B | Non-Production License | Коммерческое использование запрещено без отдельного соглашения. |
| Large-серия, Medium-серия | Mistral Research / Проприетарная | Доступ только через облачный API. |
См. также
Ссылки
Литература
- Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
- Beltagy, I.; Peters, M. E.; Cohan, A. (2020). Longformer: The Long‑Document Transformer. arXiv:2004.05150.
- Dao, T. et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
- Ding, Y. et al. (2024). LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens. arXiv:2402.13753.
- Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Gu, A.; Dao, T. (2023). Mamba: Linear‑Time Sequence Modeling with Selective State Spaces. arXiv:2312.00752.
- He, L. et al. (2025). Scaling Instruction‑Tuned LLMs to Million‑Token Contexts via Hierarchical Synthetic Data Generation. arXiv:2504.12637.
- Jiang, A. Q. et al. (2023). Mistral 7B. arXiv:2310.06825.
- Jiang, A. Q. et al. (2024). Mixtral of Experts. arXiv:2401.04088.
- Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of Large Language Models. arXiv:2309.00071.
- Shazeer, N. (2019). Fast Transformer Decoding: One Write‑Head is All You Need. arXiv:1911.02150.