Yi (01.AI) (TL)
Yi — pamilya ng malalaking modelo ng wika (Large Language Model, LLM) at visual-language na mga modelo (Vision-Language Model, VLM), na binuo ng kumpanyang 01.AI (零一万物) sa ilalim ng pamumuno ni Kai-Fu Lee. Ang mga modelo ay sinanay mula sa simula sa isang mataas na kalidad na bilinggwal na korpus (Ingles at Tsino) na may dami na 3.1 trilyon na token at kinabibilangan ng mga variant para sa pagbuo ng teksto, pagproseso ng mahabang konteksto (hanggang 200 libo na token), multimodal na input (teksto + larawan), pagbuo ng code, at episyenteng inference batay sa arkitektura ng Mixture-of-Experts (MoE). Ang mga bukas na variant ay ipinamamahagi sa ilalim ng lisensyang Apache 2.0 na may pahintulot para sa komersyal na paggamit; ang mga saradong flagship na modelo (Yi-Large, Yi-Lightning) ay available sa pamamagitan ng API.[1][2][3]
Kasaysayan at Kronolohiya ng Pag-unlad
Ang kumpanyang 01.AI ay itinatag noong Marso 2023 ni Kai-Fu Lee, dating pinuno ng Microsoft Research Asia at Google China, na may punong tanggapan sa Beijing. Ang pokus ng kumpanya ay ang pagbuo ng episyenteng LLM na may diin sa kalidad ng datos at engineering na pag-optimize ng imprastraktura. Noong Nobyembre 2023, naabot ng 01.AI ang katayuan ng "unicorn" (pagpapahalaga na higit sa 1 bilyong dolyar) pagkatapos ng isang round ng financing na may pakikilahok ng Alibaba.[4][5]
Unang Henerasyon (2023–2024)
Ang mga unang bukas na modelo na Yi-6B at Yi-34B ay ipinakita noong ika-2 ng Nobyembre 2023. Sa loob ng mga susunod na linggo, ang linya ay pinalawak ng mga variant na may konteksto na 200 libo na token (ika-5 ng Nobyembre 2023), mga chat na variant at mga quantized na modelo (ika-23 ng Nobyembre 2023). Noong Enero 2024, lumabas ang mga multimodal na Yi-VL-6B at Yi-VL-34B. Noong Marso 2024, ipinakita ang modelo na Yi-9B, na nakuha sa pamamagitan ng paraan ng depth upscaling mula sa Yi-6B, at na-publish ang teknikal na ulat na arXiv:2403.04652.[1][2]
Yi-1.5 at mga Espesyalisadong Modelo (2024)
Noong ika-13 ng Mayo 2024, inilabas ang serye ng Yi-1.5 (6B/9B/34B) — resulta ng patuloy na pre-training sa karagdagang 500 bilyong token at fine-tuning sa 3 milyong halimbawa ng mga instruksyon. Noong Mayo–Hunyo 2024, ipinakita ang saradong proprietary na modelo na Yi-Large na may API-access, na inirekomenda bilang SOTA. Noong Setyembre 2024, lumabas ang espesyalisadong serye na Yi-Coder (1.5B/9B) para sa pagbuo ng code na may konteksto na 128 libo na token at suporta para sa 52 na wika ng programming.[1][6][7]
Yi-Lightning (2024)
Noong Oktubre 2024, ipinakita ang flagship na modelo na Yi-Lightning batay sa arkitektura ng Mixture-of-Experts (MoE), na na-optimize para sa bilis at kahusayan ng inference. Nagtamo ang Yi-Lightning ng ika-6 na lugar sa pangkalahatang ranggo ng LMSYS Chatbot Arena (Elo 1287), ika-2 na lugar sa wikang Tsino, at ika-3–4 na lugar sa matematika at coding. Ang teknikal na ulat ay na-publish noong Disyembre 2024 (arXiv:2412.01253).[8]
Pagbabago ng Estratehiya (2025)
Noong Marso 2025, inihayag ng kumpanyang 01.AI ang pagtigil sa pre-training ng mga bagong malalaking modelo ng wika at nakatuon sa mga enterprise na aplikasyon, mga multi-agent na sistema, at ang WorldWise LLM Platform 2.5 na nakabase sa mga pangatlong partido na modelo (kasama ang DeepSeek).[4]
Buod na Kronolohiya
| Petsa | Kaganapan |
|---|---|
| Nobyembre 2023 | Paglabas ng Yi-6B at Yi-34B (base, chat, 200K-variant) |
| Enero 2024 | Multimodal na Yi-VL-6B at Yi-VL-34B |
| Marso 2024 | Yi-9B (depth-upscaled); paglalathala ng teknikal na ulat na arXiv:2403.04652 |
| Mayo 2024 | Yi-1.5 (6B/9B/34B); Yi-Large (sarado, API) |
| Setyembre 2024 | Yi-Coder-1.5B/9B (espesyalisasyon sa code, konteksto 128K) |
| Oktubre 2024 | Yi-Lightning (arkitektura ng MoE, flagship na modelo) |
| Disyembre 2024 | Paglalathala ng teknikal na ulat ng Yi-Lightning (arXiv:2412.01253) |
| Marso 2025 | Pagtigil ng pre-training ng mga bagong LLM; pokus sa mga solusyon para sa enterprise |
Teoretikal na Pundasyon at Arkitektura
Pangunahing Arkitektura
Lahat ng mga modelo ng pamilya Yi ay nakabatay sa arkitektura ng decoder-only Transformer, na inilalarawan sa gawa ni Vaswani et al.[9] Ang mga modelo ay sinanay mula sa simula at hindi mga derivative ng LLaMA, sa kabila ng pagkakatulad ng implementasyon.[1]
Ang pangunahing mekanismo ng Multi-Head Self-Attention ay inilalarawan ng formula:
kung saan ang , , — mga matrix ng mga query, key, at value ayon sa pagkakasunod, at ang — dimensyon ng mga key.[9]
Mga pangunahing arkitektura na pagbabago ng Yi:[1]
- Grouped-Query Attention (GQA) — paghahati ng mga query-head sa mga grupo na may mga shared na key/value-head, na nagpapababa ng paggamit ng memorya habang pinapanatili ang kalidad.
- SwiGLU-activation — kapalit ng karaniwang ReLU/GELU; nagpapababa ng laki ng mga activation sa 8/3 ng dimensyon ng nakatagong layer (hidden size).
- Rotary Position Embedding (RoPE) na may naangkop na base frequency (adjusted base frequency, ABF), na nagbibigay ng pagpapalawak ng konteksto nang walang mga arkitektura na pagbabago.
- Bokabularyo (vocabulary): 64,000 token batay sa BPE (SentencePiece) na may paghihiwalay ng mga numero sa mga digit at unicode-byte fallback para sa mga bihirang simbolo.
Mga Konfigurasyon ng mga Pangunahing Modelo
Mga parameter ng arkitektura mula sa teknikal na ulat na arXiv:2403.04652:[1]
| Parameter | Yi-6B | Yi-34B |
|---|---|---|
| Hidden Size | 4096 | 7168 |
| Query-heads | 32 | 56 |
| KV-heads | 4 | 8 |
| Bilang ng mga layer | 32 | 60 |
| Haba ng pre-training (Pretrain Seq. Len) | 4096 | 4096 |
| Pinakamataas na bilis ng pag-aaral (Max LR) | 3×10⁻⁴ | 1.5×10⁻⁴ |
Pinagmulan: arXiv:2403.04652, talahanayan ng mga parameter.[1]
Arkitektura ng Yi-Lightning (MoE)
Ginamit ng Yi-Lightning (2024) ang pinahusay na arkitektura ng Mixture-of-Experts (MoE) na may mga sumusunod na katangian:[8]
- Fine-grained expert segmentation — pinong paghahati ng mga FFN-block sa mga eksperto para sa mas mataas na espesyalisasyon.
- Multilevel na pagbabalanse ng load — kombinasyon ng mga Switch-Transformer (ST), Expert Parallel (EP), at Partitioned EP (PEP) na loss para sa pantay na pamamahagi ng mga token sa pagitan ng mga eksperto.
- Hybrid na attention — paghahalili ng 3 layer na may sliding window at 1 layer na may buong attention (full attention), na may muling paggamit ng KV-cache sa pagitan ng mga layer.
- Pagbawas ng memorya ng KV-cache ng 82.8% kumpara sa karaniwang paraan kapag pinoproseso ang mahahabang sequence.
- Konteksto na window na pinalawak hanggang 64 libo na token.
Ang eksaktong bilang ng mga eksperto at kabuuang bilang ng mga parameter ng Yi-Lightning ay hindi isinahayag sa mga pampublikong pinagkukunan.[8]
Mga Multimodal na Variant (Yi-VL)
Sa mga multimodal na modelo ng Yi-VL, ang modelo ng wika ay konektado sa visual encoder na CLIP ViT-H/14 sa pamamagitan ng MLP-projection. Ang larawan ay ginagawang sequence ng mga embedding ng visual encoder, na isinasama sa modelo ng wika kasama ang mga text token. Ang pagsasanay ay nagaganap sa tatlong yugto na may pagtaas ng resolusyon: 224×224 → 448×448 pixel.[1]
Pipeline ng Pagsasanay at Alignment
Pre-training
Ang mga pangunahing modelo na Yi-6B at Yi-34B ay pre-trained sa isang bilinggwal na korpus na may dami na 3.1 trilyon na token. Ang mga datos ay dumadaan sa cascading pipeline ng filtering at deduplication: mga heuristic filter, mga trained na scorer (perplexity, quality, coherence, safety), clustering, at MinHash deduplication. Ang mga pinagkukunan ay Common Crawl, mga libro, at mga siyentipikong artikulo.[1]
Para sa Yi-1.5, isinagawa ang patuloy na pre-training (continued pre-training) sa karagdagang 500 bilyong token ng mataas na kalidad na korpus.[7]
Supervised Fine-Tuning (SFT)
Ang mga chat na variant ng unang henerasyon ay fine-tuned sa isang maliit ngunit maingat na sinuri na hanay — wala pang 10 libo na multi-turn na halimbawa, bawat isa ay mano-manong sinuri at ine-edit ng mga machine learning engineer. Para sa Yi-1.5, pinalaki ang dami ng SFT na datos sa 3 milyong halimbawa.[1][7]
Alignment sa Pamamagitan ng Reinforcement Learning
Para sa Yi-Lightning, inilalapat ang isang multi-stage na proseso ng alignment: SFT na sinusundan ng RLHF/DPO. Ang mga synthetic na datos ay ginagawa gamit ang Monte Carlo Tree Search (MCTS). Ang framework ng kaligtasan na RAISE ay nagpapatupad ng apat na antas na proteksyon: pag-filter ng datos ng pre-training, safety fine-tuning, kontrol ng input na prompt, at kontrol ng output na sagot.[8]
Pagpapalawak ng Konteksto
Ang pagpapalawak ng context window hanggang 200 libo na token ay isinagawa sa pamamagitan ng magaang na patuloy na pre-training sa 5 bilyong token (mga libro + synthetic na tanong-sagot) gamit ang teknik na RoPE ABF. Pagkatapos ng pagpino, ang katumpakan sa gawain ng Needle-in-a-Haystack (paghahanap ng target na fragment sa mahabang teksto) ay umabot sa 99.8%.[1][2]
Depth Upscaling
Ang Yi-9B ay nakuha sa pamamagitan ng pagdoble ng mga layer 12–28 ng pangunahing modelo na Yi-6B na sinusundan ng pre-training sa 800 bilyong token. Ang paraan ay nagbibigay ng pagtaas ng kapasidad ng modelo nang walang pagsasanay mula sa simula.[1]
Komposisyon ng Pamilya ng mga Modelo
Mga Pangunahing Modelo ng Wika
| Modelo | Mga Parameter | Uri | Konteksto | Petsa ng Paglabas | Lisensya | Tala |
|---|---|---|---|---|---|---|
| Yi-6B / Yi-34B | 6 bilyon / 34 bilyon | Base / Chat | 4K (pinalawak hanggang 32K) | Nobyembre 2023 | Apache 2.0 | Mga pangunahing modelo na sinanay mula sa simula |
| Yi-6B-200K / Yi-34B-200K | 6 bilyon / 34 bilyon | Base | 200K | Nobyembre 2023 | Apache 2.0 | Patuloy na pre-training sa mahahabang sequence |
| Yi-9B | 9 bilyon | Base | 4K (pinalawak hanggang 200K) | Marso 2024 | Apache 2.0 | Depth-upscale mula sa Yi-6B + 800 bilyong token |
| Yi-1.5-6B/9B/34B | 6 / 9 / 34 bilyon | Base / Chat | 4K / 16K / 32K | Mayo 2024 | Apache 2.0 | +500 bilyong token + 3 milyong SFT na halimbawa |
| Yi-Large | ~1 trilyon (MoE, ang mga aktibo ay hindi isinahayag) | LLM | Hindi isinahayag | Mayo 2024 | Sarado (API) | Inirekomenda bilang SOTA |
| Yi-Lightning | MoE (ang bilang ng mga eksperto ay hindi isinahayag) | LLM | 64K | Oktubre 2024 | API | Ika-6 na lugar sa LMSYS Chatbot Arena |
Mga pinagkukunan: arXiv:2403.04652; arXiv:2412.01253; GitHub 01-ai/Yi.[1][8][2]
Mga Espesyalisadong Modelo
| Modelo | Mga Parameter | Mga Modalidad | Konteksto | Petsa ng Paglabas | Tala |
|---|---|---|---|---|---|
| Yi-VL-6B / Yi-VL-34B | 6 / 34 bilyon | Teksto + larawan (448×448) | Karaniwang pangunahing modelo | Enero 2024 | ViT-encoder (CLIP ViT-H/14), tatlong yugto na pagsasanay |
| Yi-Coder-1.5B / Yi-Coder-9B | 1.5 / 9 bilyon | Teksto (code) | 128K | Setyembre 2024 | 52 na wika ng programming |
Mga pinagkukunan: arXiv:2403.04652; GitHub 01-ai/Yi.[1][2]
Mga Identifier ng API
Mga halimbawa sa platform ng 01.AI at mga pangatlong partido na provider: yi-large, yi-lightning, yi-34b-chat, 01-ai/Yi-1.5-34B-Chat (Hugging Face), yi-34b (Fireworks AI, Replicate).[6][10][11]
Ebalwasyon at mga Benchmark
Mga Resulta ng mga Pangunahing Modelo
Mga datos mula sa teknikal na ulat na arXiv:2403.04652 (mga kondisyon: 0-shot / 5-shot, depende sa benchmark):[1]
| Benchmark | Yi-6B | Yi-34B | Llama 2-34B | Llama 2-70B | Qwen-14B | GPT-3.5 |
|---|---|---|---|---|---|---|
| MMLU (5-shot) | 63.2 | 76.3 | 62.6 | 69.7 | 66.7 | — |
| BBH | 42.8 | 54.3 | 44.1 | — | 53.4 | — |
| C-Eval | 72.0 | 81.4 | — | 50.1 | 72.1 | 70.1 |
| CMMLU | 75.5 | 83.7 | — | 53.3 | 71.0 | 52.5 |
| GSM8K | 32.5 | 67.2 | 42.2 | 56.8 | 61.3 | 57.1 |
| HumanEval | 15.9 | 23.2 | 22.6 | 31.7 | 32.3 | 48.1 |
Pinagmulan: arXiv:2403.04652, mga talahanayan ng resulta.[1]
Ipinakita ng Yi-34B ang mga resultang higit sa Llama 2-70B (sa doble na mas maliit na sukat) sa karamihan ng mga benchmark at nangunguna sa mga bukas na modelo sa C-Eval at CMMLU sa oras ng paglabas.[1][12]
Mga Resulta ng Yi-Lightning
Mga datos mula sa teknikal na ulat na arXiv:2412.01253 (mga kondisyon: 0-shot, kung hindi tinukoy ang iba):[8]
| Benchmark | Yi-Lightning | Qwen2.5-72B-Instruct | Llama-3.1-70B |
|---|---|---|---|
| GPQA | 50.9 | 49.1 | 45.1 |
| MATH | 76.4 | 82.7 | 67.1 |
| HumanEval | 83.5 | 86.0 | 76.2 |
| WildBench | 65.1 | 59.9 | 49.0 |
| Arena-Hard | 91.8 | 90.5 | 74.0 |
Pinagmulan: arXiv:2412.01253.[8]
Mga Rating ng mga Gumagamit
Ang Yi-34B-Chat ay nagtamo ng ika-2 lugar sa AlpacaEval (94.08%, pagkatapos ng GPT-4 Turbo) noong Disyembre 2023 — Enero 2024, na may Elo rating na ~1110 sa LMSYS Chatbot Arena. Nanguna ang Yi-34B sa mga bukas na modelo sa Hugging Face Open LLM Leaderboard at C-Eval sa oras ng paglabas.[2][1]
Nagtamo ang Yi-Lightning ng ika-6 na pangkalahatang lugar sa LMSYS Chatbot Arena (score 1287), ika-2 lugar sa wikang Tsino, at ika-3–4 na lugar sa mga subcategory ng "matematika", "coding", "hard prompts", at "multi-turn" sa oras ng paglalathala ng ulat.[8]
Tala. Ang direktang paghahambing ng mga modelo mula sa iba't ibang paglabas at konfigurasyon ay nangangailangan ng magkaparehong mga kondisyon ng pagsubok (parehong mga bersyon ng benchmark, parehong mga parameter ng pagbuo). Ang mga subjective na rating sa mga crowdsourcing na platform ay nakadepende sa komposisyon ng mga kalahok at sa kasalukuyang hanay ng mga modelo sa sistema.[12]
Paggamit
Ang pamilya ng Yi ay ginagamit sa malawak na hanay ng mga gawain sa natural na pagpoproseso ng wika at multimodal na pagsusuri:[3][13]
- Mga chat-assistant at mga sistema ng diyalogo — batay sa mga chat na variant na Yi-34B-Chat at Yi-1.5.
- Pagbuo at pagsusuri ng code — sinusuportahan ng Yi-Coder ang 52 na wika ng programming.
- Pagsusuri ng mahahabang dokumento — mga variant na may konteksto na 200K para sa mga legal, teknikal, at analitikal na gawain.
- Multimodal na pagsusuri — paglalarawan ng mga larawan at visual na tanong-sagot sa pamamagitan ng Yi-VL.
- Mga corporate na ahente — mga RAG-sistema, paghahanap ng kaalaman, at pag-uuri ng datos sa pamamagitan ng platform ng 01.AI.
- Lokal na deployment — sa pamamagitan ng vLLM, llama.cpp, Hugging Face Transformers; ang mga quantized na bersyon (AWQ/GPTQ 4/8-bit) ay available para sa deployment sa consumer GPU (halimbawa, RTX 4090 para sa Yi-34B-4bit).
Ang mga API-variant (Yi-Large, Yi-Lightning) ay ginagamit para sa mga chatbot, multilingual na serbisyo, at low-cost inference. Ang halaga ng inference ng Yi-Lightning ay 14 sentimo bawat milyong token noong 2024.[8]
Mga Limitasyon at Bukas na Suliranin
- Mga Hallucination. Ang mga modelo ay natatamasa ng mga tipikal na pagkakamali sa katotohanan para sa LLM sa mga nabubuong sagot, lalo na sa kumplikadong pangangatwiran at mahahabang chain ng inference.[1]
- Matematika at code sa mga maagang bersyon. Ang mga pangunahing modelo na Yi-34B ay nagpapakita ng mas mahihinang resulta sa kumplikadong coding at matematika kumpara sa mga espesyalisadong frontier na modelo (halimbawa, MATH Yi-34B sa 4-shot — 14.4). Ang suliranin na ito ay bahagyang nalutas sa Yi-1.5 at Yi-Lightning.[1][8]
- Mahabang konteksto. Ang pagpapalawak hanggang 200K ay nangangailangan ng karagdagang pre-training at computational na mapagkukunan; posible ang kaunting pagbaba ng performance sa maikling konteksto.[1]
- Mga saradong modelo. Ang Yi-Large at Yi-Lightning ay hindi nagbibigay ng mga timbang para sa pag-download, na nagliligtas sa independyenteng pag-verify ng arkitektura at datos.[8]
- Pagkakaiba sa pagitan ng Arena at mga benchmark. Ipinakikita ng Yi-Lightning ang malakas na mga resulta sa mga rating ng mga gumagamit (Chatbot Arena), ngunit nahahuli sa ilang mga kakumpitensya sa mga static na akademikong benchmark — repleksyon ng pangkalahatang suliranin ng hindi pagtutugma ng mga sukatan.[8]
- Reproducibility. Hindi lahat ng mga detalye ng pagsasanay (eksaktong komposisyon ng dataset, distribusyon ng domain, hyperparameter) ay ganap na isinahayag.[13]
- Sensitivity sa prompt. Tulad ng ibang LLM, ang mga modelo ng Yi ay sensitibo sa pagbabalangkas ng prompt, na nakakaapekto sa katatagan ng mga output.[1]
Walang naitalang mga seryosong regression pagkatapos ng mga paglabas; napapansin ng komunidad ang katatagan ng mga quantized na bersyon.[2]
Mga Etikal at Regulatoryo na Aspekto
Sa Yi-Lightning, isinagawa ang framework ng kaligtasan na RAISE, na nagpapatupad ng apat na antas na proteksyon:[8]
- Pag-filter ng mapanganib na nilalaman, PII, at mga mapaminsalang materyales sa yugto ng pre-training.
- Safety fine-tuning na may mga halimbawa ng tamang paghawak ng mga sensitibong kahilingan.
- Kontrol ng input (pag-uuri ng prompt).
- Kontrol ng output (pag-filter ng mga sagot).
Ang lisensyang Apache 2.0 para sa mga bukas na modelo ay nagpapahintulot ng komersyal na paggamit; ang mga indibidwal na hosting ay maaaring magkaroon ng karagdagang mga kinakailangan. Ang mga modelo ay sumusunod sa mga regulatoryo na pamantayan ng Tsina sa larangan ng AI (sertipikasyon ng CAICT para sa mga solusyon sa enterprise).[1][3]
Mga Pananaw at Direksyon ng Pananaliksik
Ipinakikita ng serye ng Yi ang kahusayan ng diskarte na naglalagay ng kalidad ng datos nang mas mataas kaysa sa dami ng mga parameter, pati na rin ang magaang na scaling (continual pretraining, depth upscaling, MoE-optimization).[1]
Pagkatapos ng 2025, lumipat ang diin ng 01.AI sa mga aplikadong solusyon:[4]
- Mga multi-agent na sistema at enterprise na platform na WorldWise LLM Platform 2.5.
- Integrasyon ng mga pangatlong partido na modelo (kasama ang DeepSeek) sa mga corporate na workflow.
- Optimization ng inference (quantization, FP8) para sa pagbaba ng halaga ng deployment.
Ang mga bukas na modelo ay patuloy na ginagamit ng komunidad para sa pananaliksik, fine-tuning, at distillation.[6]
Mga Sanggunian
- Young A. et al. Yi: Open Foundation Models by 01.AI. arXiv:2403.04652, 2024. https://arxiv.org/abs/2403.04652
- 01.AI et al. Yi-Lightning Technical Report. arXiv:2412.01253, 2024. https://arxiv.org/abs/2412.01253
- Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
Mga Link
- https://github.com/01-ai/Yi — Opisyal na GitHub repository ng Yi
- https://github.com/01-ai/Yi-1.5 — Repository ng Yi-1.5
- https://www.01.ai/yi-models — Opisyal na pahina ng mga modelo ng Yi
- https://huggingface.co/01-ai — Organisasyon ng 01-ai sa Hugging Face
- https://en.wikipedia.org/wiki/01.AI — Artikulo ng Wikipedia tungkol sa kumpanyang 01.AI
Mga Tala
- ↑ 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 Young A. et al. Yi: Open Foundation Models by 01.AI. arXiv:2403.04652, 7 марта 2024. https://arxiv.org/abs/2403.04652
- ↑ 2.0 2.1 2.2 2.3 2.4 2.5 2.6 01-ai. GitHub-репозиторий Yi. https://github.com/01-ai/Yi
- ↑ 3.0 3.1 3.2 01.AI. Yi Foundation Models. https://www.01.ai/yi-models
- ↑ 4.0 4.1 4.2 Wikipedia. 01.AI. https://en.wikipedia.org/wiki/01.AI
- ↑ Bloomberg. Kai-Fu Lee's Open-Source 01.AI Bests Llama 2 According to Hugging Face. bloomberg.com, 5 ноября 2023. https://www.bloomberg.com/news/articles/2023-11-05/kai-fu-lee-s-open-source-01-ai-bests-llama-2-according-to-hugging-face
- ↑ 6.0 6.1 6.2 Hugging Face. Организация 01-ai. https://huggingface.co/01-ai
- ↑ 7.0 7.1 7.2 GitHub. 01-ai/Yi-1.5. https://github.com/01-ai/Yi-1.5
- ↑ 8.00 8.01 8.02 8.03 8.04 8.05 8.06 8.07 8.08 8.09 8.10 8.11 8.12 01.AI et al. Yi-Lightning Technical Report. arXiv:2412.01253, декабрь 2024. https://arxiv.org/abs/2412.01253
- ↑ 9.0 9.1 Vaswani, A. et al. (2017). Attention Is All You Need. NeurIPS. https://arxiv.org/abs/1706.03762
- ↑ Fireworks AI. Yi 34B API. https://fireworks.ai/models/yi-01-ai/yi-34b
- ↑ Replicate. 01-ai/yi-34b. https://replicate.com/01-ai/yi-34b
- ↑ 12.0 12.1 Open Laboratory. Yi. https://openlaboratory.ai/models/families/Yi
- ↑ 13.0 13.1 Lablab.ai. 01.AI's Yi Series Large Language Models. https://lablab.ai/tech/yi-llms