IBM Granite (language model) (TR)
IBM Granite — IBM tarafından kurumsal ortamlarda kullanılmak üzere geliştirilen büyük dil modelleri (LLM) serisidir. Granite modelleri, verilen bağlama göre metin üretebilen, yalnızca decoder mimarisine sahip otoregressif transformer'lardır[1].
Aile, 7 Eylül 2023 tarihinde IBM watsonx.ai bulut platformunun lansmanı kapsamında resmi olarak tanıtıldı[2]. IBM, Granite'ı işletmeler için açık, yüksek performanslı ve güvenilir çözümler olarak konumlandırmakta; eğitim verilerinin şeffaflığına, risk kontrolüne ve ticari kullanıma izin veren lisanslama politikasına vurgu yapmaktadır[3].
Geliştirme Tarihi
Granite model ailesi, IBM'in işletmelere kendi generatif modellerini ortaklara ait modellerle birlikte sunma stratejisinin bir parçası haline geldi.
- Eylül 2023: İlk modellerin watsonx.ai platformunda resmi olarak duyurulması ve başlatılması. İlk sürümler olan Granite.13b.instruct ve Granite.13b.chat, yaklaşık 13 milyar parametreye sahipti ve temel dil işleme görevlerine yönelik olarak tasarlandı[2].
- Mayıs 2024: IBM, birden fazla Granite Code modelini (3 ila 34 milyar parametre) Apache 2.0 lisansı altında açık kaynak olarak yayımladığını duyurdu. Model ağırlıkları Hugging Face platformunda yayımlandı; bu adım, açık yapay zeka ekosistemine destek açısından önemli bir gelişme oldu[4].
- Sonbahar 2024: IBM, daha küçük boyutlu modeller (2 ve 8 milyar parametre) ve yeni özellikler içeren Granite 3.0 güncellemesini yayımladı; bu, ailenin genişletilmesi yönündeki kararlılığı teyit etti[5].
Mimari ve Eğitim
Mimari
IBM Granite modelleri, GPT modellerine benzer şekilde transformer decoder (decoder-only) mimarisi üzerine inşa edilmiştir. Temel Granite.13b modeli, multi-query attention mekanizması kullanmakta ve 8000 token'a kadar bağlam penceresi sunmaktadır[6]. Modeller self-supervised learning yöntemiyle eğitilmektedir.
Eğitim Verileri ve AI Governance
Granite'ın temel özelliklerinden biri, kurumsal ihtiyaçlar gözetilerek seçilmiş özgün, küratörlü bir veri korpusunun kullanılmasıdır. Filtrelenmemiş web örnekleri üzerinde eğitilen pek çok LLM'den farklı olarak Granite, aşağıdaki alanları kapsayan yüksek kaliteli (enterprise-quality) verilerle eğitilmiştir[6]:
- Akademik ve bilimsel veriler: bilimsel literatür, teknik yayınlar.
- Programlama kodu: çok sayıda dilde yazılmış kod kümeleri.
- Hukuk: mahkeme kararları, kamuya açık raporlar.
- Finans: şirketlerin finansal raporları.
- İnternet: filtrelemeden geçirilmiş genel nitelikli yapılandırılmamış metinler.
IBM, geliştirme sürecinin katı AI Governance (etik ve veri yönetimi) ilkelerine uygun şekilde yürütüldüğünü vurgulamaktadır. Her veri bölümü, kurumsal politikalara uygunluk açısından doğrulama sürecinden geçirildi. İstenmeyen içeriklerin kaldırılması amacıyla dahili «HAP» (Hate and Profanity — Nefret ve Müstehcenlik) dedektörü ile otomatik web kaynağı engel listeleri kullanıldı[1]. IBM, kaynakların ayrıntılı listesini içeren kapsamlı bir teknik rapor yayımladı; bu, büyük teknoloji şirketleri arasında nadir rastlanan bir adım olup yüksek düzeyde şeffaflık sağlamaktadır.
Granite Model Ailesi
IBM Granite ailesi, çeşitli iş görevlerine yönelik birkaç model kategorisini kapsamaktadır:
- Dil Modelleri (Granite Language Models): Metin üretme, özetleme, sınıflandırma ve benzeri metin işleme görevleri için temel ve talimat bazlı fine-tuning uygulanmış modeller.
- Kod Modelleri (Granite Code Models): 100'den fazla programlama dilinde eğitilmiş, kod tamamlama, üretme ve düzeltme için özelleştirilmiş LLM'ler. 3 ila 34 milyar parametre aralığında mevcuttur[4].
- Görme Modelleri (Granite Vision Models): Görüntü ve belge analizi, metin tanıma ve içerik anlama için geliştirilmiş sinir ağları.
- Konuşma Modelleri (Granite Speech Models): Konuşma tanıma ve çeviri için kompakt modeller.
- Zaman Serisi Modelleri (Granite for Time Series): Zaman serilerine dayalı tahmin için özelleştirilmiş modeller.
- Jeo-uzamsal Model (Granite for Geospatial): Uydu görüntülerinin ve diğer coğrafi verilerin analizi için NASA iş birliğiyle geliştirildi.
- Embedding Modelleri (Granite Embedding Models): Anlamsal arama ve RAG sistemi oluşturma görevleri için modeller.
- Granite Guardian: İstenmeyen sorguların filtrelenmesi ve içerik izleme amacıyla tasarlanmış, güvenliğe yönelik özel bir modül.
Açık Kaynak ve Lisanslama
IBM, Granite ailesinin açıklığını ön plana çıkarmakta ve onu kapalı, tescilli LLM'lere şeffaf bir alternatif olarak konumlandırmaktadır. Mayıs 2024'te şirket, Granite Code modellerini Apache 2.0 lisansı altında açık topluluğa sundu; bu lisans, söz konusu modellerin özgürce kullanılmasına, değiştirilmesine ve dağıtılmasına olanak tanımaktadır[4].
Eğitim verileri hakkındaki ayrıntılı bilgilerin yayımlanmasıyla birlikte bu adım, IBM'in araştırma topluluğu tarafından yüksek biçimde değerlendirilmesini sağladı. 2024 yılında model, Stanford Üniversitesi'nin Temel Model Şeffaflık Endeksinde lider konumlar arasına girdi[3].
Uygulama Alanları
Granite modelleri, IBM watsonx bulut platformuna entegre edilmiş olup çeşitli kurumsal senaryolarda kullanılmaktadır.
- Spor Analitiği (US Open): ABD Tenis Birliği (USTA) ile iş birliği kapsamında IBM, Granite'ı US Open turnuvasındaki her maçın ardından otomatik maç raporu ve sesli yorum üretmek amacıyla kullanmaktadır. Çözüm, maç bitiminden yalnızca birkaç dakika içinde kapsamlı bir metin özeti oluşturmaktadır[7].
- Programcılara Destek: Granite Code modelleri, örneğin COBOL dilinde yazılmış eski kodları IBM Z için modern mikro hizmetlere otomatik olarak dönüştürebilen araç ailesini oluşturan IBM watsonx Code Assistantın temelini oluşturmaktadır[4].
- Sektörel Yapay Zeka Uygulamaları: Lockheed Martin, Granite modellerini ulusal güvenlik görevleri için kendi AI Factory platformuna entegre etti. ESPN, fantezi spor alanında kişiselleştirilmiş yorum üretimi amacıyla Granite'ı kullanmaktadır[3].
Kaynakça
- Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
- Awasthy, P. et al. (2025). Granite Embedding Models. arXiv:2502.20204.
- Dao, T. et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
- Ding, Y. et al. (2024). LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens. arXiv:2402.13753.
- Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Granite Vision Team (2025). Granite Vision: A Lightweight, Open‑Source Multimodal Model for Enterprise Intelligence. arXiv:2502.09927.
- Mishra, M. et al. (2024). Granite Code Models: A Family of Open Foundation Models for Code Intelligence. arXiv:2405.04324.
- Padhi, I. et al. (2024). Granite Guardian: Risk Detection for Safe and Responsible Use of LLMs. arXiv:2412.07724.
- Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of Large Language Models. arXiv:2309.00071.
- Stallone, M. et al. (2024). Scaling Granite Code Models to 128K Context. arXiv:2407.13739.
Notlar
- ↑ 1.0 1.1 «Building AI for business: IBM's Granite foundation models». IBM Blog. [1]
- ↑ 2.0 2.1 Lardinois, Frederic (7 сентября 2023). «IBM rolls out new generative AI features and models». TechCrunch. [2]
- ↑ 3.0 3.1 3.2 «Granite». IBM. [3]
- ↑ 4.0 4.1 4.2 4.3 «IBM's Granite code model family is going open source». IBM Research Blog. [4]
- ↑ «Granite 3.3 Language Models - a ibm-granite Collection». Hugging Face. [5]
- ↑ 6.0 6.1 «Granite Foundation Models: Technical Specifications». IBM. [6]
- ↑ «IBM and the USTA Serve Up New and Enhanced Generative AI Features for 2024 US Open Digital Platforms». IBM Newsroom. [7]