DBRX (language model) (HU)
DBRX — egy nyílt nagy nyelvi modell (LLM), amelyet a Databricks vállalat keretein belül működő Mosaic AI kutatócsapat fejlesztett ki. A modellt hivatalosan 2024. március 27-én adták ki, és nagy teljesítményű vállalati megoldásként pozícionálják[1].
A DBRX finomszerkezetű szakértők keveréke (MoE) architektúrára épül, és ötvözi a magas teljesítményt a tanítás és az inferencia hatékonyságával. A megjelenéskor a DBRX a legjobb eredményeket érte el az összes nyílt modell közül a legfontosabb benchmarkokon, megelőzve olyan modelleket, mint a LLaMA 2, a Mixtral és a Grok-1, valamint versenyképességet mutatott a GPT-3.5 Turbo szintű zárt modellekkel szemben[2].
Fejlesztés története
A DBRX megjelenése a Databricks azon stratégiájának folytatása volt, amelynek célja nyílt generatív modellek fejlesztése. 2023 júniusában a Databricks felvásárolta a MosaicML startupot, amely nagy modellek tanítására specializálódott, és ennek bázisán jött létre a Mosaic AI részleg[3].
A Mosaic AI csapata, amelyet Jonathan Frankle vezető neurálishálózat-építész irányított, hozzálátott egy új, nagyméretű LLM fejlesztéséhez azzal a céllal, hogy a legjobb tulajdonosi rendszerekkel összehasonlítható minőséget érjen el, de nyílt formátumban. A projekt a DBRX nevet kapta. A modell fejlesztése és előtanítása körülbelül 2,5 hónapig tartott, és a becslések szerint mintegy 10 millió dollárba került[3].
Architektúra
A DBRX egy csak dekódert (decoder-only) alkalmazó transformer modell, amely finomszerkezetű (fine-grained) szakértők keveréke (MoE) architektúrát valósít meg.
Az architektúra főbb jellemzői:
- Paraméterek teljes száma: 132 milliárd.
- Szakértők: A modell 16 kis, specializált részmodellből („szakértőből") áll.
- Aktiválási mechanizmus: Minden bemeneti tokenhez csak 4 szakértő aktiválódik a 16-ból. Ez azt jelenti, hogy az inferencia során csupán 36 milliárd paraméter aktív, ami nagy sebességet és hatékonyságot biztosít. Ez a séma 65-ször több lehetséges szakértőkombinációt eredményez a Mixtral modellhez képest (8 szakértő, 2 aktív)[1].
- Komponensek: Modern architekturális megoldásokat alkalmaznak, mint például a forgó pozicionális embedding (RoPE), gated linear units (GLU) és grouped query attention (GQA).
- Kontextushossz: 32 768 token.
Ez az architektúra lehetővé teszi, hogy a modell ötvözze a hatalmas paraméterkészlet előnyeit (tudás tárolásához) a kisebb modellek hatékonyságával (a következtetési sebességhez).
Tanítás
A DBRX előtanítása gondosan összeválogatott, 12 billió tokenből álló dataseten zajlott, amely szövegekből és kódból állt. Az adatok minősége kiemelt prioritás volt: a fejlesztők a Databricks felhőplatformját (Apache Spark, Databricks Notebooks, Unity Catalog) használták az adatok tisztítására, előkészítésére és auditálására[1].
A tanítás során curriculum learning módszert alkalmaztak, amelynek keretében a különböző szakaszokban változott az adattípusok aránya. Például a tanítás utolsó részét összetett feladatok adagolt bevezetésének szentelték, ami a fejlesztők szerint érzékelhető minőségjavulást hozott. A tanítás 3072 Nvidia H100 GPU-ból álló klaszteren zajlott.
Az előtanítást követően az alap modell további fine-tuningon (instruction tuning) esett át, hogy létrehozzák az interaktív DBRX Instruct verziót, amelyet a felhasználói utasítások végrehajtására optimalizáltak.
Teljesítmény
A megjelenéskor a DBRX új minőségi standardot állított fel a nyílt LLM-ek számára a benchmarkok széles spektrumán.
Összehasonlítás nyílt modellekkel
| Benchmark | Feladat | DBRX Instruct | Következő legjobb (Mixtral/Grok-1) |
|---|---|---|---|
| Hugging Face Open LLM Leaderboard (AVG) | Általános ismeretek | 74,5% | 72,7% (Mixtral Instruct) |
| HumanEval | Programozás | 70,1% | 63,2% (Grok-1) |
| GSM8K | Matematikai érvelés | 66,9% | 62,9% (Grok-1) |
| MMLU | Általános ismeretek | 73,7% | 71,5% (Mixtral Instruct) |
A DBRX az első helyet szerezte meg mind a Hugging Face Open LLM Leaderboard általános rangsorában, mind a Databricks LLM Gauntlet átfogó tesztjén, jelentős előnyt mutatva elődeihez képest[1].
Összehasonlítás zárt modellekkel
A DBRX Instruct felülmúlja a GPT-3.5 Turbo-t számos kulcsmutatón, köztük az MMLU-n (73,7% szemben 70,0%-kal) és a HumanEvalon (70,1% szemben 48,1%-kal). Egyes benchmarkokon (például MTBench) a válaszok minőségét tekintve a modell közelít a Gemini 1.0 Pro szintjéhez és a GPT-4 korai verzióihoz[1].
A tanítás és az inferencia hatékonysága
- Tanítási hatékonyság: A MoE architektúra alkalmazása lehetővé tette a FLOPS-ban mért költségek 2-4-szeres csökkentését a hasonló minőségű sűrű modellekhez képest.
- Inferencia-hatékonyság: Azáltal, hogy csak 36 milliárd paraméter aktiválódik, a DBRX 2-3-szor nagyobb áteresztőképességet (következtetési sebességet) biztosít az egyenértékű méretű sűrű modellekhez képest (például LLaMA2-70B)[1].
Licencelés és elérhetőség
A DBRX terjesztése a kifejezetten erre a célra kidolgozott Databricks Open Model License licenc alatt történik. Ez lehetővé teszi a szabad felhasználást és módosítást, beleértve a kereskedelmi alkalmazást is, de tartalmaz bizonyos korlátozásokat. Különösen a LLaMA 2 licenchez hasonlóan előírja, hogy külön engedélyt kell kérni a Databrickstől, ha a DBRX-alapú szolgáltatásokat havonta több mint 700 millió aktív felhasználó veszi igénybe.
A modell (alap és Instruct verzió) előtanított súlyai letölthetők a Hugging Face tárolóján keresztül[4].
Irodalom
- Mosaic Research Team. (2024). Introducing DBRX: A New State‑of‑the‑Art Open LLM. Databricks Blog.
- Databricks. (2024). Databricks Open Model License (DBRX). Online specification.
- Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Lepikhin, D.; et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
- Ainslie, J.; et al. (2023). Grouped‑Query Attention: Efficient Training of Generalized Multi‑Query Transformers. arXiv:2305.13245.
- Su, J.; et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
- Dao, T. (2023). FlashAttention‑2: Faster Attention with Better Parallelism and Work Partitioning. arXiv:2307.08691.
- Cai, W.; et al. (2024). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
- Chen, Y.; et al. (2024). Scaling Laws for Fine‑Grained Mixture of Experts. arXiv:2402.07871.
- Kundu, A.; et al. (2024). Strategic Data Ordering: Enhancing Large Language Model Training via Curriculum Learning. arXiv:2405.07490.
Jegyzetek
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 1.6 «Introducing DBRX: A New State-of-the-Art Open LLM». Databricks Blog. [1]
- ↑ «Databricks' open-source DBRX LLM beats Llama 2, Mixtral, and Grok». InfoWorld. [2]
- ↑ 3.0 3.1 «Databricks spent $10M on new DBRX generative AI model». TechCrunch. [3]
- ↑ «databricks/dbrx-base». Hugging Face. [4]