Kimi (Moonshot AI)

Материал из Systems analysis wiki
Перейти к навигации Перейти к поиску

Kimi (серия моделей Moonshot AI) — серия больших языковых моделей (Large Language Model, LLM), разрабатываемых китайской компанией Moonshot AI (Пекин, КНР) для задач текстовой и мультимодальной генерации, программирования и агентных систем (agentic systems — систем, способных к автономному планированию, рассуждению и действию с использованием внешних инструментов). Семейство включает текстовые и мультимодальные модели с архитектурой Mixture-of-Experts (MoE, смесь экспертов) масштаба порядка 1 трлн параметров и активируемым поднабором порядка 32 млрд параметров на токен.[1][2] Важной особенностью серии является ориентация на агентное поведение (многошаговое планирование с вызовом внешних инструментов) и поддержка длинного контекста до 256 000 токенов в версиях Kimi K2 и Kimi K2.5.[1][2]

Модели серии Kimi распространяются как с открытыми весами (open-weight) на платформе Hugging Face под модифицированной MIT-лицензией, так и через проприетарный API платформы Moonshot AI Open Platform.[3][4]

История и предпосылки

Основание Moonshot AI

Moonshot AI основана в марте 2023 года в Пекине Ян Чжилином (Yang Zhilin, CEO), Чжоу Синьюем (Zhou Xinyu) и У Юйсинем (Wu Yuxin) — выпускниками Университета Цинхуа (Tsinghua University). Ян Чжилин ранее работал в Google Brain и Meta, участвовал в исследованиях в области компьютерного зрения и рассуждения. Компания получила финансирование от Alibaba (раунд объёмом $1 млрд, февраль 2024), Tencent и других инвесторов.[5][6]

Хронология ключевых релизов

  • Октябрь–ноябрь 2023 — запуск чатбота Kimi с поддержкой контекста до 128 тыс. токенов (до 200 тыс. китайских иероглифов). Первые версии использовали проприетарные модели с ограниченно раскрытыми техническими деталями.[6][7]
  • Март 2024 — расширение контекста до 2 млн иероглифов в бета-версии.[6]
  • Январь 2025 — выпуск Kimi k1.5 — мультимодальной модели с масштабированным обучением с подкреплением (Reinforcement Learning, RL), заявленной как сопоставимая по производительности с OpenAI o1 в задачах математики, программирования и мультимодального рассуждения. Контекст до 128 тыс. токенов.[8]
  • Апрель 2025 — представлена Kimi-VL — открытая мультимодальная MoE-модель (vision-language model, VLM) с визуальным энкодером MoonViT (~400 млн параметров) и ~2,8 млрд активных параметров в декодере. Технический отчёт опубликован на arXiv.[9]
  • Июль 2025 — выпуск Kimi K2 — основной открытой MoE-модели с 1 трлн параметров и 32 млрд активных параметров. Технический отчёт опубликован на arXiv.[1] Модель занимала первое место среди открытых моделей на LMSYS Chatbot Arena на момент выпуска (более 3000 голосов).[1]
  • Сентябрь 2025 — обновление Kimi-K2-Instruct-0905 с расширенным контекстом до 256 тыс. токенов и улучшенным агентным кодированием.[1]
  • Ноябрь 2025 — выпуск Kimi K2 Thinking — версии с усиленным пошаговым рассуждением (chain-of-thought) и поддержкой 200–300 последовательных вызовов инструментов (tool calls).[10]
  • Январь 2026 — представлена Kimi K2.5 — мультимодальная MoE-модель с нативной мультимодальностью и механизмом Agent Swarm (параллельная оркестрация суб-агентов).[2]

Параллельно с разработкой моделей в 2024 году был представлен собственный сервис инференса Mooncake — KVCache-центричная дезагрегированная архитектура для обслуживания LLM с длинным контекстом.[11]

Теоретические основы и архитектура

Архитектура Mixture-of-Experts

Модели серии Kimi K2 и K2.5 реализуют архитектуру Transformer с Mixture-of-Experts в отдельных слоях. Стандартный блок трансформера представляет собой композицию слоёв многоголового самовнимания (Multi-Head Attention, MHA) и позиционно-wise MLP (многослойного перцептрона) с резидуальными соединениями:[1][12]

H=MHA(H)+H,H*=MLP(H)+H,

где HL×d — входные токеновые представления, L — длина последовательности, d — размер скрытого состояния.

В MoE-слое вместо одного MLP используется набор экспертов {Ei}i=1N, каждый из которых представляет отдельный MLP с параметрами θi. Маршрутизатор (gating network) для каждого токена выбирает подмножество экспертов. Выход MoE-слоя для токена с представлением h задаётся как:[1]

MoE(h)=i𝒮(h)gi(h)Ei(h),

где 𝒮(h){1,,N} — множество выбранных экспертов для данного токена, gi(h) — нормированные веса маршрутизатора, i𝒮gi=1. Функция маршрутизации выбирает экспертов через операцию TopK:[1]

g(h)=TopK(Softmax(hWg)),

где Wg — обучаемая матрица маршрутизатора. Такая схема позволяет масштабировать общее число параметров при ограниченном числе параметров, активируемых на каждый токен.

Архитектурные гиперпараметры Kimi K2 / K2.5

Параметр Значение
Тип архитектуры Transformer с Mixture-of-Experts
Общее число параметров 1,04 трлн
Активируемые параметры на токен 32 млрд
Число слоёв 61 (1 плотный + 60 MoE)
Размер скрытого состояния 7168
Число голов внимания 64
Число экспертов 384 (8 выбираемых на токен + 1 общий)
Размер скрытого состояния эксперта (MoE hidden size) 2048
Размер словаря 160 000 токенов
Функция активации SwiGLU
Механизм внимания Multi-head Latent Attention (MLA)
Максимальный контекст 256 000 токенов (расширение через YaRN)
Визуальный энкодер (K2.5) MoonViT-3D, ~400 млн параметров

[1][2][13]

Спарсити (отношение общего числа экспертов к активируемому) составляет 48:1 (384 экспертов, 8 активных), что обеспечивает значительное снижение вычислительных затрат относительно плотной (dense) модели того же масштаба.[1]

Механизм Multi-head Latent Attention (MLA)

В моделях серии Kimi K2/K2.5 используется механизм Multi-head Latent Attention (MLA) — модификация стандартного многоголового внимания, направленная на повышение эффективности и масштабируемости. Стандартное внимание для одного слоя вычисляется как:[12]

Attention(Q,K,V)=softmax(QKdk)V,

где Q,K,VL×dk — матрицы запросов, ключей и значений. В MLA вводятся латентные представления, на которые проектируются запросы и ключи, что уменьшает размерность промежуточных операций и позволяет сократить объём KV-кэша. Подход аналогичен механизму, использованному в DeepSeek-V3.[1][13]

Оптимизатор MuonClip и QK-clip

Для обучения модели Kimi K2 предложен оптимизатор MuonClip — модификация оптимизатора Muon (моментный оптимизатор с нормализацией Newton-Schulz) с добавлением техники QK-clip для стабилизации обучения больших языковых моделей с MoE-архитектурой.[1]

QK-clip применяет ограничения на логиты внимания QK через операцию обрезки (clipping). Для каждой головы внимания h определяется максимальный логит:

Shmax=1dmaxi,j(Qhi(Khj)),

и вычисляется коэффициент масштабирования:

γh=min(1,τShmax),

где τ=100 — гиперпараметр-порог, d — размер головы внимания. Коэффициент γh применяется для масштабирования весов Wq,Wk, если максимальный логит превышает порог. Это ограничивает диапазон значений логитов перед softmax и уменьшает риск резких скачков потерь (loss spikes) при обучении на больших масштабах.[1]

По данным авторов, предобучение Kimi K2 на 15,5 трлн токенов с MuonClip прошло без единого зафиксированного всплеска функции потерь (zero loss spikes).[1]

Мультимодальность и MoonViT

Модели Kimi K2.5 и Kimi-VL используют визуальный энкодер MoonViT (в версии K2.5 — MoonViT-3D) с приблизительно 400 млн параметров, построенный на основе SigLIP-SO-400M с NaViT-пакингом (поддержка переменного разрешения входных изображений) и 3D-расширением для обработки видео (группировка по 4 кадра).[2][9]

Визуальный энкодер преобразует входные изображения и видео в последовательность визуальных токенов. Пусть XH×W×3 — входное изображение, Φvis — визуальный энкодер:

Zvis=Φvis(X)Lv×dv,

далее через линейную проекцию (двухслойный MLP) Pdv×d:

Hvis=ZvisP,

где d — размер скрытого пространства языковой части модели. В мультимодальном режиме Hvis конкатенируется с текстовыми токенами и подаётся в трансформер.[9][2]

В отличие от двухэтапных схем (добавление визуального адаптера поверх текстовой модели), K2.5 обучена на смешанных визуально-текстовых данных с начала предобучения (joint text-vision pre-training), с низкой долей визуальных токенов (~10 %) на ранних этапах и постепенным увеличением. Общий объём — приблизительно 15 трлн смешанных визуально-текстовых токенов.[2]

Предобучение и постобучение

Предобучение

Kimi K2 предобучена на 15,5 трлн токенов (веб-тексты, код, математика, энциклопедические знания) с использованием оптимизатора MuonClip. Ни одного всплеска потерь (loss spike) не зафиксировано за весь период предобучения.[1]

Kimi K2.5 прошла непрерывное предобучение (continual pre-training) от контрольной точки K2 на дополнительных ~15 трлн смешанных визуально-текстовых токенов с совместной оптимизацией модальностей (joint pre-training). Отдельно проведено 1 трлн токенов standalone-обучения визуального энкодера и дополнительный этап long-context mid-training для расширения контекста.[2]

Постобучение

Постобучение моделей серии K2 включает несколько стадий:[1][2]

Supervised Fine-Tuning (SFT, контролируемая тонкая настройка):

  • Синтетические агентные траектории (agentic data synthesis) — генерация спецификаций инструментов, моделирование взаимодействий с окружением, верификация результатов.
  • Для K2.5 дополнительно применяется zero-vision SFT — текстовый SFT, активирующий визуальные способности без непосредственного использования изображений на этапе fine-tuning.

Reinforcement Learning (RL, обучение с подкреплением):

  • Комбинация верифицируемых наград (Reinforcement Learning with Verifiable Rewards, RLVR) для задач математики, кода и безопасности.
  • Самооценка по рубрикам (self-critique rubric rewards) — использование LLM-оценщиков для автоматической оценки качества агентных сценариев.
  • Для K2.5 — совместное мультимодальное RL (joint multimodal RL).

Quantization-Aware Training (QAT):

  • Kimi K2 Thinking и K2.5 поддерживают нативную INT4-квантовку весов (weight-only quantization, группа 32, сжатые тензоры), оптимизированную под архитектуру NVIDIA Hopper, что снижает требования к памяти при выводе.[10][2]

Agent Swarm (K2.5)

Для модели K2.5 разработан механизм Agent Swarm — фреймворк самоуправляемой параллельной оркестрации агентов. Модель-оркестратор динамически создаёт суб-агентов (через операции create_subagent, assign_task), распределяет подзадачи и собирает результаты. Каждый суб-агент может самостоятельно вызывать инструменты и работать параллельно с другими суб-агентами.[2]

Обучение механизма Agent Swarm реализовано через Parallel-Agent Reinforcement Learning (PARL) с разделением исполнения и оптимизации (decoupling execution/optimization). По данным авторов, Agent Swarm обеспечивает снижение задержки (latency) до 4,5× по сравнению с однопоточным агентным режимом (single-agent).[2]

Основные модели серии

Модель Тип Параметры (общие / активные) Контекст, токенов Мультимодальность Дата выпуска
Kimi k1.5 LLM, RL-scaling не раскрыто 128 000 Да (ограниченная) Январь 2025
Kimi-VL VLM, MoE компактная / ~2,8 млрд активных + 400 млн ViT длинный контекст Да (изображения) Апрель 2025
Kimi K2 LLM, MoE 1,04 трлн / 32 млрд 256 000 Нет (текст) Июль 2025
Kimi K2 Thinking LLM, MoE 1,04 трлн / 32 млрд 256 000 Нет (текст) Ноябрь 2025
Kimi K2.5 VLM-LLM, MoE 1,04 трлн / 32 млрд 256 000 Да (изображения, видео, PDF) Январь 2026

[8][9][1][10][2]

Kimi K2

Kimi K2 — Mixture-of-Experts LLM с 1,04 трлн общих параметров и 32 млрд активируемых параметров на токен. Предобучена на 15,5 трлн токенов с оптимизатором MuonClip. Архитектура включает 384 эксперта и совместимый с длительным контекстом механизм MLA. Модель ориентирована на задачи программирования, математического рассуждения и агентных сценариев с последовательными вызовами инструментов.[1]

В техническом отчёте описан многостадийный пайплайн постобучения: масштабный синтез агентных данных путём моделирования взаимодействий с инструментами; обучение с подкреплением в смешанной среде реальных и синтетических задач; использование LLM-оценщиков для автоматической оценки качества.[1][14]

Kimi K2 Thinking

Вариант Kimi K2 Thinking оптимизирован для многошагового рассуждения (chain-of-thought) с возможностью динамического вызова инструментов и поддержкой контекста до 256 000 токенов. Модель реализует отдельный режим «Thinking» с явно возвращаемым полем reasoning_content, содержащим внутренние рассуждения. K2 Thinking поддерживает 200–300 последовательных вызовов инструментов в одном агентном эпизоде без существенной деградации поведения, а также нативную INT4-квантовку с использованием QAT.[10]

Kimi-VL

Kimi-VL — открытая мультимодальная MoE-VLM (vision-language model), ориентированная на задачи визуального понимания, визуально-текстового рассуждения и реальных сцен. Модель описывается как компактная MoE-архитектура с визуальным энкодером MoonViT. Технический отчёт опубликован на arXiv в апреле 2025 года.[9]

Kimi K2.5

Kimi K2.5 — мультимодальная MoE-модель масштаба 1,04 трлн параметров с 32 млрд активируемых, основанная на контрольной точке Kimi-K2-Base с продолженным предобучением на ~15 трлн смешанных визуально-текстовых токенов. Модель поддерживает входы изображений, видео, PDF и текста с контекстом до 256 000 токенов.[2]

K2.5 поддерживает два основных режима вывода:

  • Thinking mode — с явным reasoning_content и многошаговой генерацией;
  • Instant mode — без вывода рассуждений, с более низкой задержкой.[2][13]

Модель реализует нативную INT4-квантовку весов (weight-only, группа 32), оптимизированную под архитектуру NVIDIA Hopper.[2]

Ключевые результаты и бенчмарки

Текстовые и агентные бенчмарки Kimi K2

Результаты приведены для Kimi-K2-Instruct в режиме non-thinking (без расширенного chain-of-thought) по данным технического отчёта.[1]

Бенчмарк Kimi K2-Instruct DeepSeek-V3-0324 Claude 4 Opus / Sonnet Источник
SWE-Bench Verified (Pass@1) 65,8 % 38,8 % 72,5 % / 72,7 % arXiv:2507.20534
SWE-Bench Multilingual 47,3 % 20,9 % 51,0 % arXiv:2507.20534
LiveCodeBench v6 (Pass@1) 53,7 % 44,7 % 46,9 % arXiv:2507.20534
Tau2-Bench (micro-avg) 66,1 % 48,8 % 66,1 % arXiv:2507.20534
ACEBench (En) 76,5 % 75,6 % 80,1 % arXiv:2507.20534
AIME 2025 (Avg@64) 49,5 % 33,9 % 46,7 % arXiv:2507.20534
GPQA-Diamond (Avg@8) 75,1 % 68,2 % 74,9 % arXiv:2507.20534

По заявлению авторов, данные результаты позиционируют K2 среди лидеров открытых моделей в режиме без thinking-развёртки, особенно на инженерных и агентных задачах (по состоянию на момент публикации отчёта).[1]

Бенчмарки Kimi-VL

Бенчмарк Kimi-VL Qwen2.5-VL-7B GPT-4o-mini Источник
MMVet (точность) 66,7 % 67,1 % 66,9 % arXiv:2504.07491
RealWorldQA 68,1 % 68,5 % arXiv:2504.07491

Результаты демонстрируют, что компактная мультимодальная MoE-архитектура достигает уровня, сопоставимого с более крупными моделями при меньшем числе активных параметров.[9]

Бенчмарки Kimi K2.5

Результаты приведены в режиме Thinking (temperature = 1,0; top-p = 0,95; контекст 256 000 токенов; движок vLLM; аппаратная платформа NVIDIA H200) по данным модельной карты на платформе NVIDIA NIM и технического отчёта.[2][13]

Категория Бенчмарк Kimi K2.5
Reasoning & Knowledge HLE-Full (без инструментов) 30,1
HLE-Full (с инструментами) 50,2
AIME 2025 96,1
HMMT 2025 (Feb) 95,4
GPQA-Diamond 87,6
MMLU-Pro 87,1
Vision & Video MMMU-Pro 78,5
MathVision 84,2
MathVista (mini) 90,1
OCRBench 92,3
OmniDocBench 1.5 88,8
VideoMMMU 86,6
LongVideoBench 79,8
Coding SWE-Bench Verified 76,8
SWE-Bench Pro 50,7
SWE-Bench Multilingual 73,0
Terminal Bench 2.0 50,8
PaperBench 63,5
LiveCodeBench v6 85,0
OJBench (C++) 57,4
Long Context Longbench v2 61,0
AA-LCR 70,0
Agentic Search BrowseComp 60,6
BrowseComp (Agent Swarm) 78,4
WideSearch (iter-F1) 72,7
DeepSearchQA 77,1

Дополнительно K2.5 демонстрирует положительный трансфер визуального обучения на текстовые задачи: +1,7 % на MMLU-Pro и +2,1 % на GPQA-Diamond по сравнению с текстовой базовой моделью K2.[2]

Окончательная сравнительная оценка зависит от выбора метрик и сценариев; результаты приведены по данным авторов. Независимая валидация части бенчмарков на момент публикации ограничена.[2][15]

Применение

Текстовый ассистент и поиск

Платформа Kimi используется как ассистент с поддержкой обработки длинных документов (исследовательские отчёты, финансовые данные), автоматизированного анализа и онлайн-поиска с агрегированием информации. Moonshot AI указывает, что Kimi поддерживает более 300 вызовов инструментов (tool calls) в рамках одного агентного сценария.[7][4]

Программирование и инженерные задачи

Kimi K2 и K2.5 демонстрируют высокие результаты на SWE-Bench Verified, SWE-Bench Multilingual, LiveCodeBench и других бенчмарках программирования. Модели применяются для автоматизации исправления ошибок в репозиториях, генерации и рефакторинга кода, решения задач онлайн-судей (OJBench, LiveCodeBench). Технический отчёт K2 указывает, что модель обучалась на масштабном синтетическом агентном корпусе, включая взаимодействия с системами управления версиями, пакетными менеджерами и средами исполнения.[1][2][14]

Мультимодальные приложения

Kimi-VL и K2.5 предназначены для визуального вопрос-ответа (VQA) на изображениях и документах; понимания документов (OCRBench, OmniDocBench); анализа видео (VideoMMMU, LongVideoBench); комбинированных задач программирования по визуальным спецификациям (например, генерация интерфейса по макету изображения). Для K2.5 описаны сценарии «vision-grounded coding» и «autonomous visual debugging», где модель генерирует код по визуальному описанию и итеративно анализирует визуальный результат.[2][9][15]

API и развёртывание

Модели доступны через API платформы Moonshot AI Open Platform с поддержкой tool calling, thinking-режима, JSON-режима и кэширования контекста. Открытые веса используются для локального развёртывания через vLLM, SGLang и TensorRT-LLM. Сервис Mooncake обеспечивает масштабирование инференса для длинного контекста.[4][11][16]

Ограничения и открытые проблемы

Требования к ресурсам

MoE-модели масштаба 1 трлн параметров, даже при активируемых 32 млрд параметров и INT4-квантовке, требуют значительных ресурсов памяти и пропускной способности. В инженерных обсуждениях развёртывания Kimi K2.5 упоминаются оценки порядка сотен гигабайт видеопамяти для полной загрузки модели; конкретные числа зависят от формы квантовки и фреймворка (vLLM, SGLang и т. п.).[2][17]

Галлюцинации и качество генерации

Как и другие LLM, модели серии Kimi подвержены галлюцинациям. В отчётах по тестам FACTS Grounding и FaithJudge зафиксированы показатели hallucination rate в пределах 1,1–7,4 % в RAG-сценариях. В non-thinking режиме модель может генерировать избыточные токены при нечётких спецификациях инструментов; при принудительном включении tool-use производительность падает на некоторых задачах.[1]

Зависимость от синтетических данных и RL-пайплайна

Пайплайн синтеза агентных данных и обучения с подкреплением опирается на большую коллекцию синтетических инструментов и сцен, а также LLM-оценщики для автоматической оценки (self-judging). Такая схема порождает открытые вопросы: устойчивость к смещению (bias) самооценки; потенциальная деградация при многократной итерации (bootstrap); переносимость агентных навыков на реальные среды, отличающиеся от симулированных; влияние распределения синтетических задач на обобщающую способность.[1][14]

Прозрачность и воспроизводимость

Часть информации о составе обучающих данных, процессе фильтрации, распределении языков и доменов не раскрывается или раскрывается ограниченно. Это затрудняет точную оценку источников смещения, воспроизводимость обучения и независимую валидацию влияния отдельных компонентов (MuonClip, QK-clip) на стабильность. По состоянию на февраль 2026 года полное воспроизведение обучения Kimi K2 и K2.5 третьими сторонами не зафиксировано в открытой литературе.[1][2]

Этические и регуляторные аспекты

В модельных картах и технических отчётах подчёркивается, что разработчики несут ответственность за входы и выходы модели; требуется добавление защитных механизмов (guardrails) и тестирование на данных конкретного случая перед внедрением; модель может обрабатывать изображения и видео, потенциально содержащие персональные данные, и интегратор обязан соблюдать соответствующее законодательство.[2][16]

В технических отчётах описаны оценки безопасности (биологические, химические, киберриски) с использованием инструментов типа Promptfoo. Модели проходят RL-выравнивание (alignment) с верифицируемыми наградами и самооценкой.[1]

Как продукт китайской компании, модели подчиняются национальному регулированию КНР в области ИИ. На момент написания не обнаружено отдельных публичных регуляторных документов, посвящённых исключительно моделям Kimi; регулирование осуществляется в рамках общих подходов к генеративным моделям и ИИ в соответствующих юрисдикциях.[18]

В феврале 2026 года компания Anthropic заявила, что Moonshot AI (наряду с другими китайскими разработчиками) использовала поддельные аккаунты для генерации взаимодействий с Claude с целью дистилляции данных для обучения моделей. Информация носит характер утверждения одной стороны и не подтверждена независимыми расследованиями на момент публикации; Moonshot AI не публиковала официального ответа.[5]

Перспективы и направления исследований

По опубликованным материалам можно выделить несколько направлений дальнейших исследований:

  • Масштабируемые агентные системы. Развитие подходов к тренировке LLM как агентных систем с использованием синтетического инструментария, RL и self-judging. Расширение Agent Swarm на большее число суб-агентов и новые типы задач.[2][1]
  • Эффективные MoE-архитектуры. Использование 1 трлн параметров с 32 млрд активируемых и 384 экспертов представляет один из вариантов компромисса между масштабом и эффективностью; исследуются альтернативы с различными схемами маршрутизации.[1]
  • Нативная мультимодальность. Обучение K2.5 на смешанных визуально-текстовых данных с начала предобучения представляет подход к «нативной» мультимодальности, который сравнивается с двухэтапными схемами.[2][9]
  • Эффективный инференс и длинный контекст. INT4-квантовка и поддержка контекста 256 000 токенов стимулируют дальнейшие исследования в области спарс-внимания, латентных представлений и внешней памяти. Отдельно описан проект Kimi Linear — гибридное линейное внимание с сокращением KV-кэша на 75 % и ускорением декодирования в 6 раз при контексте 1 млн токенов.[2][19]

В официальных материалах Moonshot AI не публикуются детальные дорожные карты по будущим версиям Kimi; перечисленные направления основаны на опубликованных исследованиях.

См. также

Ссылки

Литература

Примечания

  1. 1,00 1,01 1,02 1,03 1,04 1,05 1,06 1,07 1,08 1,09 1,10 1,11 1,12 1,13 1,14 1,15 1,16 1,17 1,18 1,19 1,20 1,21 1,22 1,23 1,24 1,25 1,26 1,27 Kimi Team (2025). Kimi K2: Open Agentic Intelligence. arXiv:2507.20534 [cs.LG], 28 июля 2025 (v2: 3 февраля 2026). https://arxiv.org/abs/2507.20534
  2. 2,00 2,01 2,02 2,03 2,04 2,05 2,06 2,07 2,08 2,09 2,10 2,11 2,12 2,13 2,14 2,15 2,16 2,17 2,18 2,19 2,20 2,21 2,22 2,23 2,24 2,25 2,26 Kimi Team (2026). Kimi K2.5: Visual Agentic Intelligence. arXiv:2602.02276 [cs.CL], 2 февраля 2026. https://arxiv.org/abs/2602.02276
  3. Moonshot AI. moonshotai/Kimi-K2.5. Hugging Face. https://huggingface.co/moonshotai/Kimi-K2.5
  4. 4,0 4,1 4,2 Moonshot AI Open Platform. https://platform.moonshot.ai/
  5. 5,0 5,1 Moonshot AI. Wikipedia (англ.). https://en.wikipedia.org/wiki/Moonshot_AI
  6. 6,0 6,1 6,2 Kimi (chatbot). Wikipedia (англ.). https://en.wikipedia.org/wiki/Kimi_(chatbot)
  7. 7,0 7,1 Moonshot AI. Официальный сайт. https://www.moonshot.ai/
  8. 8,0 8,1 Kimi Team (2025). Kimi k1.5: Scaling Reinforcement Learning with LLMs. arXiv:2501.12599 [cs.AI], 22 января 2025. https://arxiv.org/abs/2501.12599
  9. 9,0 9,1 9,2 9,3 9,4 9,5 9,6 9,7 Moonshot AI (2025). Kimi-VL Technical Report. arXiv:2504.07491 [cs.CV], 10 апреля 2025. https://arxiv.org/abs/2504.07491
  10. 10,0 10,1 10,2 10,3 Moonshot AI. moonshotai/Kimi-K2-Thinking. Hugging Face Model Card, 26 января 2026. https://huggingface.co/moonshotai/Kimi-K2-Thinking
  11. 11,0 11,1 Qin, R. et al. (2024). Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving. arXiv:2407.00079 [cs.DC]. https://arxiv.org/abs/2407.00079
  12. 12,0 12,1 Vaswani, A. et al. (2017). Attention Is All You Need. https://arxiv.org/abs/1706.03762
  13. 13,0 13,1 13,2 13,3 NVIDIA. kimi-k2.5 Model by Moonshotai — NVIDIA NIM APIs (Model Card). 26 января 2026. https://build.nvidia.com/moonshotai/kimi-k2.5/modelcard
  14. 14,0 14,1 14,2 Import AI (Jack Clark). Import AI 421: Kimi 2 — a great Chinese open weight model. 20 июля 2025. https://importai.substack.com/p/import-ai-421-kimi-2-a-great-chinese
  15. 15,0 15,1 DeepLearning.ai. Moonshot AI's Kimi K2.5 Takes the Open Model Crown with Vision Updates Aided by Subagents. The Batch, 9 февраля 2026. https://www.deeplearning.ai/the-batch/moonshot-ais-kimi-k2-5-takes-the-open-model-crown-with-vision-updates-aided-by-subagents/
  16. 16,0 16,1 MoonshotAI. MoonshotAI/Kimi-K2.5. GitHub. https://github.com/MoonshotAI/Kimi-K2.5
  17. Baseten. Kimi K2 Explained: The 1 Trillion Parameter Model. 17 июля 2025. https://www.baseten.co/blog/kimi-k2-explained-the-1-trillion-parameter-model-redefining-how-to-build-agents/
  18. Bismarck Analysis. AI 2026: China's Moonshot AI Contends For Technical…. 23 сентября 2025. https://brief.bismarckanalysis.com/p/ai-2026-chinas-moonshot-ai-contends
  19. Kimi Team (2025). Kimi Linear: An Expressive, Efficient Attention Architecture. arXiv:2510.26692. https://arxiv.org/abs/2510.26692