Self-consistency prompting (TR)
Öz-tutarlı kod çözme (İng. Self-Consistency Prompting, SC) — prompt mühendisliğinde büyük dil modellerinin (LLM) aritmetik ve mantık bulmacaları gibi çok adımlı akıl yürütme gerektiren görevlerdeki doğruluğunu ve güvenilirliğini artırmaya yönelik bir kod çözme yöntemi veya stratejisidir[1]. Yöntem, 2022 yılında Google Research araştırmacıları tarafından "düşünce zinciri" (Chain-of-Thought, CoT) tekniğinin geliştirilmiş bir versiyonu olarak önerilmiştir.
Temel fikir, tek bir "açgözlü" çıkarımla yetinmek yerine aynı soru için birden fazla farklı akıl yürütme varyantı üretmek ve ardından bu varyantlar arasında en sık karşılaşılan nihai yanıtı seçmektir. Yaklaşım sezgisel bir ilkeye dayanmaktadır: model farklı yollarla akıl yürüterek defalarca aynı sonuca ulaşıyorsa, bu sonucun doğru olma olasılığı yüksektir[1].
Bağlam ve Ön Koşullar
Self-Consistency yöntemi, Chain-of-Thought (CoT) tekniğinin doğrudan bir uzantısıdır. Wei ve ark. (2022) tarafından önerilen CoT tekniği, modeli çözüm adımlarını açıkça yazmaya teşvik ederek LLM'lerin karmaşık görevleri çözme yeteneğini önemli ölçüde geliştirmiştir[2]. Ancak CoT'nin temel uygulamasında, her adımda en olası bir sonraki token'ın seçildiği "açgözlü kod çözme" (greedy decoding) kullanılmaktadır. Bu bir kısıtlama yaratır: model erken bir aşamada hata yaparsa bu yanlış yoldan sapıp hatayı düzeltemez. Self-Consistency tam olarak bu sorunu çözmek için önerilmiştir[1].
Çalışma Mekanizması
Self-Consistency algoritması, deterministik açgözlü yaklaşımın yerini "örnekleme ve ardından birleştirme" prosedürüyle alır ve aşağıdaki adımlardan oluşur[1]:
- Birden fazla akıl yürütme yolu oluşturma: Model, tek bir yanıt yerine aynı sorgu için düşünce zinciri yöntemini kullanarak birden fazla kez (örneğin 40 defaya kadar) çözüm üretir. Çeşitli akıl yürütme yolları elde etmek için sıcaklık örneklemesi (sıcaklık parametresi > 0) gibi stokastik kod çözme yöntemleri uygulanır.
- Birleştirme ve yanıt seçimi: Üretilen tüm akıl yürütme zincirlerinden yalnızca nihai yanıtlar (örneğin sayısal değerler) çıkarılır. Ardından bu yanıtlar arasında en sık karşılaşılan seçilir. Bu yanıt nihai sonuç olarak sunulur.
Bu yaklaşım, aynı modelin birden fazla çıkarımının güvenilirliği artırmak ve rastgele hataları düzeltmek amacıyla kullanıldığı "öz-topluluk" (self-ensemble) ilkesini taklit eder[3].
Etkinlik ve Sonuçlar
Orijinal araştırmada Self-Consistency, özellikle aritmetik ve mantıksal akıl yürütme gerektiren görevlerde bir dizi popüler benchmark üzerinde önemli doğruluk artışı sergilemiştir.
- Matematik problemleri benchmark'ı GSM8K üzerinde PaLM-540B modelinin doğruluğu %56,6'dan (CoT ile) %74,4e (Self-Consistency ile) yükselmiş; bu da %17,8lik bir artışa karşılık gelmiştir.
- SVAMP ve AQuA gibi diğer aritmetik görevlerde artış sırasıyla +%11,0 ve +%12,2 olmuştur.
- StrategyQA gibi mantık ve sağduyu gerektiren görevlerde iyileşme +%6,4 olarak gerçekleşmiştir[1].
Self-Consistency'nin uygulanması, GPT-3 175B ve PaLM 540B gibi büyük modeller kullanıldığında pek çok benchmark'ta yeni performans rekorları (state-of-the-art) elde edilmesini sağlamıştır[1].
Avantajlar ve Kısıtlamalar
Avantajlar
- Doğruluk artışı: Karmaşık çok adımlı akıl yürütme gerektiren görevlerde sonuçları önemli ölçüde iyileştirir.
- Güvenilirlik: Yöntem, tek bir akıl yürütme zincirinde ortaya çıkabilecek hatalara karşı daha dirençlidir.
- Uygulama basitliği: Modelin ek eğitim almasını veya mimari değişiklik yapılmasını gerektirmez. Yöntem, mevcut bir modelin etrafına basit bir "sarmalayıcı" olarak uygulanabilir.
Kısıtlamalar
- Yüksek hesaplama maliyeti: Temel dezavantaj, tek bir sorgu için birden fazla kez (örneğin 10, 20 veya 40 kez) yanıt üretme zorunluluğudur; bu durum çıkarım maliyetini ve süresini orantılı biçimde artırır.
- Sınırlı uygulanabilirlik: Standart yöntem, çoğunlukla oylama yapmanın kolay olduğu, net tanımlı yanıt formatına sahip görevler (örneğin sayı, "evet/hayır", listeden seçenek) için en etkilidir. Yanıtların doğaları gereği özgün olduğu açık uçlu üretim görevleri (makale yazma, özetleme) için uygun değildir.
- Sistematik hata riski: Model sistematik olarak yanlış akıl yürütmeler üretip bunlar tesadüfen aynı yanlış yanıtta birleşiyorsa, Self-Consistency hatayı düzeltmekle kalmaz, ona olan güveni de pekiştirir.
Yöntemin Gelişimi: Universal Self-Consistency
Temel yöntemin serbest biçimli yanıt gerektiren görevlerdeki yetersizliği sonraki araştırmalarda ele alınmıştır. 2023 yılının sonunda Google DeepMind'dan bir araştırmacı grubu Universal Self-Consistency (USC) yaklaşımını önermiştir[4].
USC'de nihai yanıtlar üzerinde basit oylama yapmak yerine, birleştirme için LLM'nin kendisi "yargıç" olarak kullanılır. Model birkaç tam çözüm varyantı üretir, ardından bunlar arasından "en tutarlı" veya "en kaliteli" olanı seçmesini isteyen yeni bir prompt alır. Bu yaklaşım, öz-tutarlılık ilkelerinin açık ve yaratıcı yanıt formatına sahip görevlere uygulanmasını mümkün kılar[5].
Dış bağlantılar
- Self-Consistency Improves Chain of Thought Reasoning in Language Models — Google Research'ün orijinal bilimsel makalesi.
- Self-Consistency — Prompt Engineering Guide'daki kılavuz.
Kaynakça
- Wang, X. et al. (2022). Self-Consistency Improves Chain of Thought Reasoning in Language Models. arXiv:2203.11171.
- Wei, J. et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. arXiv:2201.11903.
- Aggarwal, P. et al. (2023). Let's Sample Step by Step: Adaptive-Consistency for Efficient Reasoning and Coding with LLMs. arXiv:2305.11860.
- Chen, X. et al. (2023). Universal Self-Consistency with Large Language Models. arXiv:2311.17311.
- Knappe, T. et al. (2024). Semantic Self-Consistency: Enhancing Language Model Reasoning via Semantic Weighting. arXiv:2410.07839.
- Liang, X. et al. (2024). Internal Consistency and Self-Feedback in Large Language Models: A Survey. arXiv:2407.14507.
- Li, T. et al. (2024). Improving Faithfulness of Large Language Models in Summarization via Sliding Generation and Self-Consistency. arXiv:2407.21443.
- Byerly, A.; Khashabi, D. (2024). How Effective Is Self-Consistency for Long-Context Problems?. arXiv:2411.01101.
- Novikova, J. et al. (2025). Consistency in Language Models: Current Landscape, Challenges, and Future Directions. arXiv:2505.00268.
- Admoni, S. et al. (2025). Towards Large Language Models with Self-Consistent Natural Language Explanations. arXiv:2506.07523.
Notlar
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 Wang, X., Wei, J., Schuurmans, D., et al. (2022). «Self-Consistency Improves Chain of Thought Reasoning in Language Models». arXiv. [1]
- ↑ Wei, J., Wang, X., Schuurmans, D., et al. (2022). «Chain-of-Thought Prompting Elicits Reasoning in Large Language Models». NeurIPS 2022.
- ↑ «Self-Consistency Improves Chain of Thought Reasoning in Language Models - Summary». Portkey. [2]
- ↑ Chen, X., et al. (2023). «Universal Self-Consistency with Large Language Models». arXiv. [3]
- ↑ «Universal Self-Consistency with Large Language Models». Google DeepMind Publications. [4]