Perplexity (metric) (TR)

From Systems analysis wiki
Jump to navigation Jump to search

Perplexity (İng. Perplexity, PPL), bilgi teorisi ve makine öğrenmesinde bir dil modelinin metin örneğini tahmin ederken hissettiği belirsizliğin ya da "şaşkınlığın" bir ölçüsüdür. Düşük perplexity, modelin olasılık dağılımının test verileriyle iyi örtüştüğünü gösterirken, yüksek perplexity modelin diziyi kötü tahmin ettiği anlamına gelir[1].

Biçimsel olarak bir olasılık dağılımının perplexity değeri, o dağılımın entropisinin üssü olarak tanımlanır. Ayrık bir dağılım için p(x) değeri 2H(p)'ye eşittir; burada H(p) entropi anlamına gelir[2]. Sezgisel olarak perplexity, modelin her adımda aralarından seçim yaptığı "etkin" seçenek sayısı olarak düşünülebilir. Perplexity 100 ise bu, modelin belirsizliğinin 100 eşit olasılıklı sonuçtan birini seçmeye eşdeğer olduğu anlamına gelir[3].

Bu terim ilk kez 1977 yılında, Frederick Jelinek önderliğindeki IBM araştırmacıları tarafından istatistiksel konuşma tanıma bağlamında görevin "zorluğunu" nicel olarak ifade etmek amacıyla kullanılmıştır[4].

Perplexity - Dil Modellerinde Perplexity

Doğal dil işleme (NLP) alanında perplexity, dil modellerinin kalitesini değerlendirmek için standart bir içsel (intrinsic) ölçüt haline gelmiştir. Modelin bir test veri kümesindeki sözcük veya token dizisini ne kadar iyi tahmin ettiğini ölçer.

Biçimsel Tanım

W=w1w2wN test külliyatı ve q dil modeli için perplexity, test külliyatının sözcük sayısına göre normalleştirilmiş ters ortalama geometrik olasılığı olarak hesaplanır: PP(W,q)=(i=1N1q(wiw1,,wi1))1/N

Bu formül, çapraz entropinin ya da ortalama logaritmik kaybın (negative log-likelihood) üssüne eşdeğerdir: PP(W,q)=exp(1Ni=1Nlogq(wiконтекст))

Perplexity'nin minimize edilmesi, modelin test verilerindeki olabilirliğinin maksimize edilmesine eşdeğerdir. Dolayısıyla daha düşük perplexity değerine sahip bir model istatistiksel olarak daha doğru kabul edilir[5].

Tarihsel Kullanım ve Modern LLM'ler

Tarihsel olarak perplexity, istatistiksel n-gram modellerinin değerlendirilmesinde yaygın biçimde kullanılmıştır. Örneğin Wall Street Journal külliyatı için tekli gram (unigram) modeli (yalnızca sözcük sıklıklarını dikkate alan) yaklaşık 962 perplexity değerine ulaşırken, üçlü gram (trigram) modeli (önceki iki sözcüğün bağlamını dikkate alan) yaklaşık 109 değerine ulaşmaktadır[6]. Bu keskin düşüş, modelin dil örüntülerini ne kadar daha iyi yakaladığını göstermektedir.

Büyük dil modellerinin (LLM) gelişimiyle birlikte perplexity, temel bir referans ölçütü olma özelliğini korumuştur. Araştırmacılar, modelin "akıcılığının" bir göstergesi olarak standart test kümelerindeki (örn. WikiText) perplexity değerlerini raporlamaktadır. Nitekim OpenAI'nin GPT-2 makalesinde, yaklaşık 117 milyon parametreli modelin WikiText-103 külliyatında yaklaşık 37 perplexity değerine ulaştığı belirtilmektedir[7]. Perplexity'nin düşmesi genellikle model kalitesinin artmasıyla ilişkilidir; bu nedenle ölçüt, eğitim ve optimizasyon süreçlerinde ilerlemenin pratik bir göstergesi işlevi görmektedir.

Ölçütün Sınırlamaları ve Yorumlanması

Düşük perplexity, verilerin modele göre yüksek olabilirliğini işaret etse de bu göstergenin bir dizi önemli sınırlaması bulunmakta ve üretilen metnin gerçek kalitesiyle her zaman örtüşmemektedir.

  • Düşük perplexity ≠ yüksek kalite. Perplexity, modelin tahminlerindeki güveni ölçer; doğruluğu değil. Bir model, anlamsız ancak istatistiksel olarak olası bir metin üretirken (örneğin çok sık geçen sözcük ve ifadeleri tekrarlayarak) güvenle yanılıyor olabilir[3].
  • Verilere ve tokenizasyona duyarlılık. Perplexity, farklı mimari, sözcük dağarcığı veya tokenizasyon yöntemine sahip modelleri doğrudan karşılaştırmak için uygun değildir. Örneğin bir karakter tabanlı modelin perplexity değeri sayısal olarak sözcük tabanlı bir modelin değerinden düşük olabilir; ancak bu, söz konusu modelin dil görevlerini daha iyi çözdüğü anlamına gelmez[3].
  • Anlambilimi ve uzun bağlamı değerlendirme yetersizliği. Perplexity, bir sonraki token'ı tahmin etmeyi değerlendiren yerel bir ölçüttür. Modelin uzun mesafelerdeki bağımlılıkları ve anlamsal bağlamı kavrama becerisiyle zayıf bir ilişkisi vardır. 2023 tarihli bir araştırma (Hu ve diğerleri), LLM'lerin uzun metinleri (100 bin token'a kadar) anlama becerisinin perplexity ölçütüne neredeyse hiç yansımadığını ortaya koymuştur[8].
  • Manipülasyon olasılığı. Bu ölçüt "aldatılabilir". Aşırı öğrenmiş bir model, "ezberledici" veriler üzerinde yapay olarak düşük perplexity gösterecektir. Araştırmalar (Wang ve diğerleri, 2022) ayrıca metin parçalarının tekrarlanmasının ya da cümle sonuna nokta konulmamasının bile gerçek metin kalitesini etkilemeksizin perplexity'yi orantısız biçimde düşürüp yükseltebileceğini göstermiştir[9].

Sonuç: Günümüzde Perplexity'nin Rolü

Sayılan sınırlamalar göz önünde bulundurulduğunda, günümüz pratiğinde perplexity bir dil modelinin kalitesinin yardımcı, ön göstergesi olarak değerlendirilmektedir. Belirli bir uygulama görevine bağlı olmadığından ve hesaplanması kolay olduğundan modellerin hızlı değerlendirilmesi ve hata ayıklanması için değerli bir araç olmayı sürdürmektedir[3].

Bununla birlikte, LLM'lerin eksiksiz biçimde değerlendirilmesi için yalnızca perplexity yeterli değildir. Günümüzde perplexity, aşağıdaki gibi belirli görevlere bağlı dışsal (extrinsic) ölçütlerle mutlaka desteklenmektedir:

  • Soru yanıtlama doğruluğu;
  • İnsan değerlendirmesi (human evaluation);
  • Makine çevirisi ve özetleme için BLEU/ROUGE.

Bu yöntemlerle birlikte kullanıldığında perplexity önemli rolünü sürdürmektedir — modelin nesnel "şaşkınlık" ölçüsü olarak işlev görür; ancak sonuçları her zaman belirtilen sınırlamalar gözetilerek yorumlanır[3].

Dış bağlantılar

  • Habr'da "Dil Modellerinde Perplexity" makalesi
  • Hugging Face'in perplexity hesaplamasına ilişkin belgeleri

Kaynakça

  • Jelinek, F., Bahl, L. R., & Mercer, R. L. (1977). Perplexity — a Measure of the Difficulty of Speech Recognition Tasks. JASA:62(S1):S63.
  • Jurafsky, D., & Martin, J. H. (2021). Speech and Language Processing (3. baskı, Bölüm 3: N-gram Language Models). PDF.
  • Radford, A. et al. (2019). Language Models are Unsupervised Multitask Learners. OpenAI white paper.
  • Brown, T. B. et al. (2020). Language Models are Few-Shot Learners. arXiv:2005.14165.
  • Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
  • Wang, C. et al. (2022). Perplexity by PLM Is Unreliable for Evaluating Text Quality. arXiv:2210.05892.
  • Meister, C., & Cotterell, R. (2021). Language Model Evaluation Beyond Perplexity. arXiv:2106.00085.
  • Hu, Y. et al. (2024). Can Perplexity Reflect Large Language Model's Ability in Long Text Understanding?. arXiv:2405.06105.
  • Lazaridou, A. et al. (2021). Mind the Gap: Assessing Temporal Generalization in Neural Language Models. NeurIPS 2021.

Notlar

  1. «Перплексия». Википедия. [1]
  2. «Perplexity». Wikipedia. [2]
  3. 3.0 3.1 3.2 3.3 3.4 Morgan, Abby. «Perplexity for LLM Evaluation». Comet AI Blog, 21 Nov 2024. [3]
  4. «README.md · evaluate-measurement/perplexity». Hugging Face. [4]
  5. Jurafsky, Dan, and James H. Martin. Speech and Language Processing, 3rd ed., Chapter 3: N-gram Language Models, draft (2021). [5]
  6. Jurafsky, Dan, and James H. Martin. Speech and Language Processing, 3rd ed., Chapter 3: N-gram Language Models, draft (2021). [6]
  7. «Perplexity number of wikitext-103 on gpt-2 don't match the paper». GitHub, huggingface/transformers, Issue #483. [7]
  8. Hu, H., et al. «Can Perplexity Reflect Large Language Model's Ability in Long Text Understanding?». arXiv:2405.06105 [cs.CL], 10 мая 2024 г. [8]
  9. Wang, C., et al. «Perplexity by PLM Is Unreliable for Evaluating Text Quality». arXiv:2210.05892 [cs.CL], 12 окт. 2022 г. [9]