Kimi (Moonshot AI)
Kimi (серия моделей Moonshot AI) — серия больших языковых моделей (Large Language Model, LLM), разрабатываемых китайской компанией Moonshot AI (Пекин, КНР) для задач текстовой и мультимодальной генерации, программирования и агентных систем (agentic systems — систем, способных к автономному планированию, рассуждению и действию с использованием внешних инструментов). Семейство включает текстовые и мультимодальные модели с архитектурой Mixture-of-Experts (MoE, смесь экспертов) масштаба порядка 1 трлн параметров и активируемым поднабором порядка 32 млрд параметров на токен.[1][2] Важной особенностью серии является ориентация на агентное поведение (многошаговое планирование с вызовом внешних инструментов) и поддержка длинного контекста до 256 000 токенов в версиях Kimi K2 и Kimi K2.5.[1][2]
Модели серии Kimi распространяются как с открытыми весами (open-weight) на платформе Hugging Face под модифицированной MIT-лицензией, так и через проприетарный API платформы Moonshot AI Open Platform.[3][4]
История и предпосылки
Основание Moonshot AI
Moonshot AI основана в марте 2023 года в Пекине Ян Чжилином (Yang Zhilin, CEO), Чжоу Синьюем (Zhou Xinyu) и У Юйсинем (Wu Yuxin) — выпускниками Университета Цинхуа (Tsinghua University). Ян Чжилин ранее работал в Google Brain и Meta, участвовал в исследованиях в области компьютерного зрения и рассуждения. Компания получила финансирование от Alibaba (раунд объёмом $1 млрд, февраль 2024), Tencent и других инвесторов.[5][6]
Хронология ключевых релизов
- Октябрь–ноябрь 2023 — запуск чатбота Kimi с поддержкой контекста до 128 тыс. токенов (до 200 тыс. китайских иероглифов). Первые версии использовали проприетарные модели с ограниченно раскрытыми техническими деталями.[6][7]
- Март 2024 — расширение контекста до 2 млн иероглифов в бета-версии.[6]
- Январь 2025 — выпуск Kimi k1.5 — мультимодальной модели с масштабированным обучением с подкреплением (Reinforcement Learning, RL), заявленной как сопоставимая по производительности с OpenAI o1 в задачах математики, программирования и мультимодального рассуждения. Контекст до 128 тыс. токенов.[8]
- Апрель 2025 — представлена Kimi-VL — открытая мультимодальная MoE-модель (vision-language model, VLM) с визуальным энкодером MoonViT (~400 млн параметров) и ~2,8 млрд активных параметров в декодере. Технический отчёт опубликован на arXiv.[9]
- Июль 2025 — выпуск Kimi K2 — основной открытой MoE-модели с 1 трлн параметров и 32 млрд активных параметров. Технический отчёт опубликован на arXiv.[1] Модель занимала первое место среди открытых моделей на LMSYS Chatbot Arena на момент выпуска (более 3000 голосов).[1]
- Сентябрь 2025 — обновление Kimi-K2-Instruct-0905 с расширенным контекстом до 256 тыс. токенов и улучшенным агентным кодированием.[1]
- Ноябрь 2025 — выпуск Kimi K2 Thinking — версии с усиленным пошаговым рассуждением (chain-of-thought) и поддержкой 200–300 последовательных вызовов инструментов (tool calls).[10]
- Январь 2026 — представлена Kimi K2.5 — мультимодальная MoE-модель с нативной мультимодальностью и механизмом Agent Swarm (параллельная оркестрация суб-агентов).[2]
Параллельно с разработкой моделей в 2024 году был представлен собственный сервис инференса Mooncake — KVCache-центричная дезагрегированная архитектура для обслуживания LLM с длинным контекстом.[11]
Теоретические основы и архитектура
Архитектура Mixture-of-Experts
Модели серии Kimi K2 и K2.5 реализуют архитектуру Transformer с Mixture-of-Experts в отдельных слоях. Стандартный блок трансформера представляет собой композицию слоёв многоголового самовнимания (Multi-Head Attention, MHA) и позиционно-wise MLP (многослойного перцептрона) с резидуальными соединениями:[1][12]
где — входные токеновые представления, — длина последовательности, — размер скрытого состояния.
В MoE-слое вместо одного MLP используется набор экспертов , каждый из которых представляет отдельный MLP с параметрами . Маршрутизатор (gating network) для каждого токена выбирает подмножество экспертов. Выход MoE-слоя для токена с представлением задаётся как:[1]
где — множество выбранных экспертов для данного токена, — нормированные веса маршрутизатора, . Функция маршрутизации выбирает экспертов через операцию TopK:[1]
где — обучаемая матрица маршрутизатора. Такая схема позволяет масштабировать общее число параметров при ограниченном числе параметров, активируемых на каждый токен.
Архитектурные гиперпараметры Kimi K2 / K2.5
| Параметр | Значение |
|---|---|
| Тип архитектуры | Transformer с Mixture-of-Experts |
| Общее число параметров | 1,04 трлн |
| Активируемые параметры на токен | 32 млрд |
| Число слоёв | 61 (1 плотный + 60 MoE) |
| Размер скрытого состояния | 7168 |
| Число голов внимания | 64 |
| Число экспертов | 384 (8 выбираемых на токен + 1 общий) |
| Размер скрытого состояния эксперта (MoE hidden size) | 2048 |
| Размер словаря | 160 000 токенов |
| Функция активации | SwiGLU |
| Механизм внимания | Multi-head Latent Attention (MLA) |
| Максимальный контекст | 256 000 токенов (расширение через YaRN) |
| Визуальный энкодер (K2.5) | MoonViT-3D, ~400 млн параметров |
Спарсити (отношение общего числа экспертов к активируемому) составляет 48:1 (384 экспертов, 8 активных), что обеспечивает значительное снижение вычислительных затрат относительно плотной (dense) модели того же масштаба.[1]
Механизм Multi-head Latent Attention (MLA)
В моделях серии Kimi K2/K2.5 используется механизм Multi-head Latent Attention (MLA) — модификация стандартного многоголового внимания, направленная на повышение эффективности и масштабируемости. Стандартное внимание для одного слоя вычисляется как:[12]
где — матрицы запросов, ключей и значений. В MLA вводятся латентные представления, на которые проектируются запросы и ключи, что уменьшает размерность промежуточных операций и позволяет сократить объём KV-кэша. Подход аналогичен механизму, использованному в DeepSeek-V3.[1][13]
Оптимизатор MuonClip и QK-clip
Для обучения модели Kimi K2 предложен оптимизатор MuonClip — модификация оптимизатора Muon (моментный оптимизатор с нормализацией Newton-Schulz) с добавлением техники QK-clip для стабилизации обучения больших языковых моделей с MoE-архитектурой.[1]
QK-clip применяет ограничения на логиты внимания через операцию обрезки (clipping). Для каждой головы внимания определяется максимальный логит:
и вычисляется коэффициент масштабирования:
где — гиперпараметр-порог, — размер головы внимания. Коэффициент применяется для масштабирования весов , если максимальный логит превышает порог. Это ограничивает диапазон значений логитов перед softmax и уменьшает риск резких скачков потерь (loss spikes) при обучении на больших масштабах.[1]
По данным авторов, предобучение Kimi K2 на 15,5 трлн токенов с MuonClip прошло без единого зафиксированного всплеска функции потерь (zero loss spikes).[1]
Мультимодальность и MoonViT
Модели Kimi K2.5 и Kimi-VL используют визуальный энкодер MoonViT (в версии K2.5 — MoonViT-3D) с приблизительно 400 млн параметров, построенный на основе SigLIP-SO-400M с NaViT-пакингом (поддержка переменного разрешения входных изображений) и 3D-расширением для обработки видео (группировка по 4 кадра).[2][9]
Визуальный энкодер преобразует входные изображения и видео в последовательность визуальных токенов. Пусть — входное изображение, — визуальный энкодер:
далее через линейную проекцию (двухслойный MLP) :
где — размер скрытого пространства языковой части модели. В мультимодальном режиме конкатенируется с текстовыми токенами и подаётся в трансформер.[9][2]
В отличие от двухэтапных схем (добавление визуального адаптера поверх текстовой модели), K2.5 обучена на смешанных визуально-текстовых данных с начала предобучения (joint text-vision pre-training), с низкой долей визуальных токенов (~10 %) на ранних этапах и постепенным увеличением. Общий объём — приблизительно 15 трлн смешанных визуально-текстовых токенов.[2]
Предобучение и постобучение
Предобучение
Kimi K2 предобучена на 15,5 трлн токенов (веб-тексты, код, математика, энциклопедические знания) с использованием оптимизатора MuonClip. Ни одного всплеска потерь (loss spike) не зафиксировано за весь период предобучения.[1]
Kimi K2.5 прошла непрерывное предобучение (continual pre-training) от контрольной точки K2 на дополнительных ~15 трлн смешанных визуально-текстовых токенов с совместной оптимизацией модальностей (joint pre-training). Отдельно проведено 1 трлн токенов standalone-обучения визуального энкодера и дополнительный этап long-context mid-training для расширения контекста.[2]
Постобучение
Постобучение моделей серии K2 включает несколько стадий:[1][2]
Supervised Fine-Tuning (SFT, контролируемая тонкая настройка):
- Синтетические агентные траектории (agentic data synthesis) — генерация спецификаций инструментов, моделирование взаимодействий с окружением, верификация результатов.
- Для K2.5 дополнительно применяется zero-vision SFT — текстовый SFT, активирующий визуальные способности без непосредственного использования изображений на этапе fine-tuning.
Reinforcement Learning (RL, обучение с подкреплением):
- Комбинация верифицируемых наград (Reinforcement Learning with Verifiable Rewards, RLVR) для задач математики, кода и безопасности.
- Самооценка по рубрикам (self-critique rubric rewards) — использование LLM-оценщиков для автоматической оценки качества агентных сценариев.
- Для K2.5 — совместное мультимодальное RL (joint multimodal RL).
Quantization-Aware Training (QAT):
- Kimi K2 Thinking и K2.5 поддерживают нативную INT4-квантовку весов (weight-only quantization, группа 32, сжатые тензоры), оптимизированную под архитектуру NVIDIA Hopper, что снижает требования к памяти при выводе.[10][2]
Agent Swarm (K2.5)
Для модели K2.5 разработан механизм Agent Swarm — фреймворк самоуправляемой параллельной оркестрации агентов. Модель-оркестратор динамически создаёт суб-агентов (через операции create_subagent, assign_task), распределяет подзадачи и собирает результаты. Каждый суб-агент может самостоятельно вызывать инструменты и работать параллельно с другими суб-агентами.[2]
Обучение механизма Agent Swarm реализовано через Parallel-Agent Reinforcement Learning (PARL) с разделением исполнения и оптимизации (decoupling execution/optimization). По данным авторов, Agent Swarm обеспечивает снижение задержки (latency) до 4,5× по сравнению с однопоточным агентным режимом (single-agent).[2]
Основные модели серии
| Модель | Тип | Параметры (общие / активные) | Контекст, токенов | Мультимодальность | Дата выпуска |
|---|---|---|---|---|---|
| Kimi k1.5 | LLM, RL-scaling | не раскрыто | 128 000 | Да (ограниченная) | Январь 2025 |
| Kimi-VL | VLM, MoE | компактная / ~2,8 млрд активных + 400 млн ViT | длинный контекст | Да (изображения) | Апрель 2025 |
| Kimi K2 | LLM, MoE | 1,04 трлн / 32 млрд | 256 000 | Нет (текст) | Июль 2025 |
| Kimi K2 Thinking | LLM, MoE | 1,04 трлн / 32 млрд | 256 000 | Нет (текст) | Ноябрь 2025 |
| Kimi K2.5 | VLM-LLM, MoE | 1,04 трлн / 32 млрд | 256 000 | Да (изображения, видео, PDF) | Январь 2026 |
Kimi K2
Kimi K2 — Mixture-of-Experts LLM с 1,04 трлн общих параметров и 32 млрд активируемых параметров на токен. Предобучена на 15,5 трлн токенов с оптимизатором MuonClip. Архитектура включает 384 эксперта и совместимый с длительным контекстом механизм MLA. Модель ориентирована на задачи программирования, математического рассуждения и агентных сценариев с последовательными вызовами инструментов.[1]
В техническом отчёте описан многостадийный пайплайн постобучения: масштабный синтез агентных данных путём моделирования взаимодействий с инструментами; обучение с подкреплением в смешанной среде реальных и синтетических задач; использование LLM-оценщиков для автоматической оценки качества.[1][14]
Kimi K2 Thinking
Вариант Kimi K2 Thinking оптимизирован для многошагового рассуждения (chain-of-thought) с возможностью динамического вызова инструментов и поддержкой контекста до 256 000 токенов. Модель реализует отдельный режим «Thinking» с явно возвращаемым полем reasoning_content, содержащим внутренние рассуждения. K2 Thinking поддерживает 200–300 последовательных вызовов инструментов в одном агентном эпизоде без существенной деградации поведения, а также нативную INT4-квантовку с использованием QAT.[10]
Kimi-VL
Kimi-VL — открытая мультимодальная MoE-VLM (vision-language model), ориентированная на задачи визуального понимания, визуально-текстового рассуждения и реальных сцен. Модель описывается как компактная MoE-архитектура с визуальным энкодером MoonViT. Технический отчёт опубликован на arXiv в апреле 2025 года.[9]
Kimi K2.5
Kimi K2.5 — мультимодальная MoE-модель масштаба 1,04 трлн параметров с 32 млрд активируемых, основанная на контрольной точке Kimi-K2-Base с продолженным предобучением на ~15 трлн смешанных визуально-текстовых токенов. Модель поддерживает входы изображений, видео, PDF и текста с контекстом до 256 000 токенов.[2]
K2.5 поддерживает два основных режима вывода:
- Thinking mode — с явным
reasoning_contentи многошаговой генерацией; - Instant mode — без вывода рассуждений, с более низкой задержкой.[2][13]
Модель реализует нативную INT4-квантовку весов (weight-only, группа 32), оптимизированную под архитектуру NVIDIA Hopper.[2]
Ключевые результаты и бенчмарки
Текстовые и агентные бенчмарки Kimi K2
Результаты приведены для Kimi-K2-Instruct в режиме non-thinking (без расширенного chain-of-thought) по данным технического отчёта.[1]
| Бенчмарк | Kimi K2-Instruct | DeepSeek-V3-0324 | Claude 4 Opus / Sonnet | Источник |
|---|---|---|---|---|
| SWE-Bench Verified (Pass@1) | 65,8 % | 38,8 % | 72,5 % / 72,7 % | arXiv:2507.20534 |
| SWE-Bench Multilingual | 47,3 % | 20,9 % | 51,0 % | arXiv:2507.20534 |
| LiveCodeBench v6 (Pass@1) | 53,7 % | 44,7 % | 46,9 % | arXiv:2507.20534 |
| Tau2-Bench (micro-avg) | 66,1 % | 48,8 % | 66,1 % | arXiv:2507.20534 |
| ACEBench (En) | 76,5 % | 75,6 % | 80,1 % | arXiv:2507.20534 |
| AIME 2025 (Avg@64) | 49,5 % | 33,9 % | 46,7 % | arXiv:2507.20534 |
| GPQA-Diamond (Avg@8) | 75,1 % | 68,2 % | 74,9 % | arXiv:2507.20534 |
По заявлению авторов, данные результаты позиционируют K2 среди лидеров открытых моделей в режиме без thinking-развёртки, особенно на инженерных и агентных задачах (по состоянию на момент публикации отчёта).[1]
Бенчмарки Kimi-VL
| Бенчмарк | Kimi-VL | Qwen2.5-VL-7B | GPT-4o-mini | Источник |
|---|---|---|---|---|
| MMVet (точность) | 66,7 % | 67,1 % | 66,9 % | arXiv:2504.07491 |
| RealWorldQA | 68,1 % | 68,5 % | — | arXiv:2504.07491 |
Результаты демонстрируют, что компактная мультимодальная MoE-архитектура достигает уровня, сопоставимого с более крупными моделями при меньшем числе активных параметров.[9]
Бенчмарки Kimi K2.5
Результаты приведены в режиме Thinking (temperature = 1,0; top-p = 0,95; контекст 256 000 токенов; движок vLLM; аппаратная платформа NVIDIA H200) по данным модельной карты на платформе NVIDIA NIM и технического отчёта.[2][13]
| Категория | Бенчмарк | Kimi K2.5 |
|---|---|---|
| Reasoning & Knowledge | HLE-Full (без инструментов) | 30,1 |
| HLE-Full (с инструментами) | 50,2 | |
| AIME 2025 | 96,1 | |
| HMMT 2025 (Feb) | 95,4 | |
| GPQA-Diamond | 87,6 | |
| MMLU-Pro | 87,1 | |
| Vision & Video | MMMU-Pro | 78,5 |
| MathVision | 84,2 | |
| MathVista (mini) | 90,1 | |
| OCRBench | 92,3 | |
| OmniDocBench 1.5 | 88,8 | |
| VideoMMMU | 86,6 | |
| LongVideoBench | 79,8 | |
| Coding | SWE-Bench Verified | 76,8 |
| SWE-Bench Pro | 50,7 | |
| SWE-Bench Multilingual | 73,0 | |
| Terminal Bench 2.0 | 50,8 | |
| PaperBench | 63,5 | |
| LiveCodeBench v6 | 85,0 | |
| OJBench (C++) | 57,4 | |
| Long Context | Longbench v2 | 61,0 |
| AA-LCR | 70,0 | |
| Agentic Search | BrowseComp | 60,6 |
| BrowseComp (Agent Swarm) | 78,4 | |
| WideSearch (iter-F1) | 72,7 | |
| DeepSearchQA | 77,1 |
Дополнительно K2.5 демонстрирует положительный трансфер визуального обучения на текстовые задачи: +1,7 % на MMLU-Pro и +2,1 % на GPQA-Diamond по сравнению с текстовой базовой моделью K2.[2]
Окончательная сравнительная оценка зависит от выбора метрик и сценариев; результаты приведены по данным авторов. Независимая валидация части бенчмарков на момент публикации ограничена.[2][15]
Применение
Текстовый ассистент и поиск
Платформа Kimi используется как ассистент с поддержкой обработки длинных документов (исследовательские отчёты, финансовые данные), автоматизированного анализа и онлайн-поиска с агрегированием информации. Moonshot AI указывает, что Kimi поддерживает более 300 вызовов инструментов (tool calls) в рамках одного агентного сценария.[7][4]
Программирование и инженерные задачи
Kimi K2 и K2.5 демонстрируют высокие результаты на SWE-Bench Verified, SWE-Bench Multilingual, LiveCodeBench и других бенчмарках программирования. Модели применяются для автоматизации исправления ошибок в репозиториях, генерации и рефакторинга кода, решения задач онлайн-судей (OJBench, LiveCodeBench). Технический отчёт K2 указывает, что модель обучалась на масштабном синтетическом агентном корпусе, включая взаимодействия с системами управления версиями, пакетными менеджерами и средами исполнения.[1][2][14]
Мультимодальные приложения
Kimi-VL и K2.5 предназначены для визуального вопрос-ответа (VQA) на изображениях и документах; понимания документов (OCRBench, OmniDocBench); анализа видео (VideoMMMU, LongVideoBench); комбинированных задач программирования по визуальным спецификациям (например, генерация интерфейса по макету изображения). Для K2.5 описаны сценарии «vision-grounded coding» и «autonomous visual debugging», где модель генерирует код по визуальному описанию и итеративно анализирует визуальный результат.[2][9][15]
API и развёртывание
Модели доступны через API платформы Moonshot AI Open Platform с поддержкой tool calling, thinking-режима, JSON-режима и кэширования контекста. Открытые веса используются для локального развёртывания через vLLM, SGLang и TensorRT-LLM. Сервис Mooncake обеспечивает масштабирование инференса для длинного контекста.[4][11][16]
Ограничения и открытые проблемы
Требования к ресурсам
MoE-модели масштаба 1 трлн параметров, даже при активируемых 32 млрд параметров и INT4-квантовке, требуют значительных ресурсов памяти и пропускной способности. В инженерных обсуждениях развёртывания Kimi K2.5 упоминаются оценки порядка сотен гигабайт видеопамяти для полной загрузки модели; конкретные числа зависят от формы квантовки и фреймворка (vLLM, SGLang и т. п.).[2][17]
Галлюцинации и качество генерации
Как и другие LLM, модели серии Kimi подвержены галлюцинациям. В отчётах по тестам FACTS Grounding и FaithJudge зафиксированы показатели hallucination rate в пределах 1,1–7,4 % в RAG-сценариях. В non-thinking режиме модель может генерировать избыточные токены при нечётких спецификациях инструментов; при принудительном включении tool-use производительность падает на некоторых задачах.[1]
Зависимость от синтетических данных и RL-пайплайна
Пайплайн синтеза агентных данных и обучения с подкреплением опирается на большую коллекцию синтетических инструментов и сцен, а также LLM-оценщики для автоматической оценки (self-judging). Такая схема порождает открытые вопросы: устойчивость к смещению (bias) самооценки; потенциальная деградация при многократной итерации (bootstrap); переносимость агентных навыков на реальные среды, отличающиеся от симулированных; влияние распределения синтетических задач на обобщающую способность.[1][14]
Прозрачность и воспроизводимость
Часть информации о составе обучающих данных, процессе фильтрации, распределении языков и доменов не раскрывается или раскрывается ограниченно. Это затрудняет точную оценку источников смещения, воспроизводимость обучения и независимую валидацию влияния отдельных компонентов (MuonClip, QK-clip) на стабильность. По состоянию на февраль 2026 года полное воспроизведение обучения Kimi K2 и K2.5 третьими сторонами не зафиксировано в открытой литературе.[1][2]
Этические и регуляторные аспекты
В модельных картах и технических отчётах подчёркивается, что разработчики несут ответственность за входы и выходы модели; требуется добавление защитных механизмов (guardrails) и тестирование на данных конкретного случая перед внедрением; модель может обрабатывать изображения и видео, потенциально содержащие персональные данные, и интегратор обязан соблюдать соответствующее законодательство.[2][16]
В технических отчётах описаны оценки безопасности (биологические, химические, киберриски) с использованием инструментов типа Promptfoo. Модели проходят RL-выравнивание (alignment) с верифицируемыми наградами и самооценкой.[1]
Как продукт китайской компании, модели подчиняются национальному регулированию КНР в области ИИ. На момент написания не обнаружено отдельных публичных регуляторных документов, посвящённых исключительно моделям Kimi; регулирование осуществляется в рамках общих подходов к генеративным моделям и ИИ в соответствующих юрисдикциях.[18]
В феврале 2026 года компания Anthropic заявила, что Moonshot AI (наряду с другими китайскими разработчиками) использовала поддельные аккаунты для генерации взаимодействий с Claude с целью дистилляции данных для обучения моделей. Информация носит характер утверждения одной стороны и не подтверждена независимыми расследованиями на момент публикации; Moonshot AI не публиковала официального ответа.[5]
Перспективы и направления исследований
По опубликованным материалам можно выделить несколько направлений дальнейших исследований:
- Масштабируемые агентные системы. Развитие подходов к тренировке LLM как агентных систем с использованием синтетического инструментария, RL и self-judging. Расширение Agent Swarm на большее число суб-агентов и новые типы задач.[2][1]
- Эффективные MoE-архитектуры. Использование 1 трлн параметров с 32 млрд активируемых и 384 экспертов представляет один из вариантов компромисса между масштабом и эффективностью; исследуются альтернативы с различными схемами маршрутизации.[1]
- Нативная мультимодальность. Обучение K2.5 на смешанных визуально-текстовых данных с начала предобучения представляет подход к «нативной» мультимодальности, который сравнивается с двухэтапными схемами.[2][9]
- Эффективный инференс и длинный контекст. INT4-квантовка и поддержка контекста 256 000 токенов стимулируют дальнейшие исследования в области спарс-внимания, латентных представлений и внешней памяти. Отдельно описан проект Kimi Linear — гибридное линейное внимание с сокращением KV-кэша на 75 % и ускорением декодирования в 6 раз при контексте 1 млн токенов.[2][19]
В официальных материалах Moonshot AI не публикуются детальные дорожные карты по будущим версиям Kimi; перечисленные направления основаны на опубликованных исследованиях.
См. также
Ссылки
- https://www.moonshot.ai/ — официальный сайт Moonshot AI
- https://platform.moonshot.ai/ — Moonshot AI Open Platform (API)
- https://github.com/MoonshotAI/Kimi-K2.5 — GitHub-репозиторий Kimi K2.5
- https://huggingface.co/moonshotai — профиль Moonshot AI на Hugging Face
Литература
- Kimi Team (2025). Kimi K2: Open Agentic Intelligence. arXiv:2507.20534. https://arxiv.org/abs/2507.20534
- Kimi Team (2026). Kimi K2.5: Visual Agentic Intelligence. arXiv:2602.02276. https://arxiv.org/abs/2602.02276
- Kimi Team (2025). Kimi k1.5: Scaling Reinforcement Learning with LLMs. arXiv:2501.12599. https://arxiv.org/abs/2501.12599
- Moonshot AI (2025). Kimi-VL Technical Report. arXiv:2504.07491. https://arxiv.org/abs/2504.07491
- Kimi Team (2025). Kimi Linear: An Expressive, Efficient Attention Architecture. arXiv:2510.26692. https://arxiv.org/abs/2510.26692
- Qin, R. et al. (2024). Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving. arXiv:2407.00079. https://arxiv.org/abs/2407.00079
- Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
Примечания
- ↑ 1,00 1,01 1,02 1,03 1,04 1,05 1,06 1,07 1,08 1,09 1,10 1,11 1,12 1,13 1,14 1,15 1,16 1,17 1,18 1,19 1,20 1,21 1,22 1,23 1,24 1,25 1,26 1,27 Kimi Team (2025). Kimi K2: Open Agentic Intelligence. arXiv:2507.20534 [cs.LG], 28 июля 2025 (v2: 3 февраля 2026). https://arxiv.org/abs/2507.20534
- ↑ 2,00 2,01 2,02 2,03 2,04 2,05 2,06 2,07 2,08 2,09 2,10 2,11 2,12 2,13 2,14 2,15 2,16 2,17 2,18 2,19 2,20 2,21 2,22 2,23 2,24 2,25 2,26 Kimi Team (2026). Kimi K2.5: Visual Agentic Intelligence. arXiv:2602.02276 [cs.CL], 2 февраля 2026. https://arxiv.org/abs/2602.02276
- ↑ Moonshot AI. moonshotai/Kimi-K2.5. Hugging Face. https://huggingface.co/moonshotai/Kimi-K2.5
- ↑ 4,0 4,1 4,2 Moonshot AI Open Platform. https://platform.moonshot.ai/
- ↑ 5,0 5,1 Moonshot AI. Wikipedia (англ.). https://en.wikipedia.org/wiki/Moonshot_AI
- ↑ 6,0 6,1 6,2 Kimi (chatbot). Wikipedia (англ.). https://en.wikipedia.org/wiki/Kimi_(chatbot)
- ↑ 7,0 7,1 Moonshot AI. Официальный сайт. https://www.moonshot.ai/
- ↑ 8,0 8,1 Kimi Team (2025). Kimi k1.5: Scaling Reinforcement Learning with LLMs. arXiv:2501.12599 [cs.AI], 22 января 2025. https://arxiv.org/abs/2501.12599
- ↑ 9,0 9,1 9,2 9,3 9,4 9,5 9,6 9,7 Moonshot AI (2025). Kimi-VL Technical Report. arXiv:2504.07491 [cs.CV], 10 апреля 2025. https://arxiv.org/abs/2504.07491
- ↑ 10,0 10,1 10,2 10,3 Moonshot AI. moonshotai/Kimi-K2-Thinking. Hugging Face Model Card, 26 января 2026. https://huggingface.co/moonshotai/Kimi-K2-Thinking
- ↑ 11,0 11,1 Qin, R. et al. (2024). Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving. arXiv:2407.00079 [cs.DC]. https://arxiv.org/abs/2407.00079
- ↑ 12,0 12,1 Vaswani, A. et al. (2017). Attention Is All You Need. https://arxiv.org/abs/1706.03762
- ↑ 13,0 13,1 13,2 13,3 NVIDIA. kimi-k2.5 Model by Moonshotai — NVIDIA NIM APIs (Model Card). 26 января 2026. https://build.nvidia.com/moonshotai/kimi-k2.5/modelcard
- ↑ 14,0 14,1 14,2 Import AI (Jack Clark). Import AI 421: Kimi 2 — a great Chinese open weight model. 20 июля 2025. https://importai.substack.com/p/import-ai-421-kimi-2-a-great-chinese
- ↑ 15,0 15,1 DeepLearning.ai. Moonshot AI's Kimi K2.5 Takes the Open Model Crown with Vision Updates Aided by Subagents. The Batch, 9 февраля 2026. https://www.deeplearning.ai/the-batch/moonshot-ais-kimi-k2-5-takes-the-open-model-crown-with-vision-updates-aided-by-subagents/
- ↑ 16,0 16,1 MoonshotAI. MoonshotAI/Kimi-K2.5. GitHub. https://github.com/MoonshotAI/Kimi-K2.5
- ↑ Baseten. Kimi K2 Explained: The 1 Trillion Parameter Model. 17 июля 2025. https://www.baseten.co/blog/kimi-k2-explained-the-1-trillion-parameter-model-redefining-how-to-build-agents/
- ↑ Bismarck Analysis. AI 2026: China's Moonshot AI Contends For Technical…. 23 сентября 2025. https://brief.bismarckanalysis.com/p/ai-2026-chinas-moonshot-ai-contends
- ↑ Kimi Team (2025). Kimi Linear: An Expressive, Efficient Attention Architecture. arXiv:2510.26692. https://arxiv.org/abs/2510.26692