$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Büyük Dil Modelleri, karar verme 1,2, metinüretimi 3, metinçevirisi 4, müşteri duygusuanalizi 5, soruyanıtlama 6 ve klinik raporlar oluşturma gibi çeşitli görevleri desteklemek için olağanüstü bir yankı sunar. Son zamanlarda, uygulamaların LLM'leri kullanarak sosyal açıdan dezavantajlı bireylere veya gruplara zarar vereniçerik ürettiği birkaç durum olmuştur 8,9,10. Bu tür boş tepkilerin temel nedeni, bu modellerin ırk, cinsiyet, sosyoekonomik sınıf ve benzeri faktörlerle ilişkili toplumsal önyargıları barındıran veri setleri üzerinde eğitilmiş olmasıdır. Ama sağlık hizmeti yapay zeka sisteminde "önyargı" ve "adalet" derken kastettiğiniz şey öznel ve bağlama bağlı olabilir. Araştırmacılar, LLM'lerde sosyal önyargıları azaltmak için önemli çabalargöstermiştir 11,12; ancak daha fazla iyileştirme gerekmektedir. Araştırmacılar, çeşitli uygulamalarda ön işleme, işleme içinde, sonra-işleme veya bunların kombinasyonları olarak sınıflandırılabilecek birden fazla önyargı azaltma stratejisi önermiştir. Bu kategorilendirme, azaltma önleminin hangi aşamada alındığına dayanır. Bu protokol, LLM'lerin altı varyantında sosyal önyargıyı ele almak ve hafifletmek için üç stratejiyi birleştirir ve dört sosyal önyargı boyutunda önyargı azaltmayı araştırır: Cinsiyet, Meslek, Tırk ve Din. İlk olarak, LLM'lerin çıkarımlar üretmesini sağlamak için veri artırma tekniği kullanılarak bir çıkarım veri seti geliştirilir. İkinci olarak, LLM'lerden stereotipik yanıtlar almak için on iki tür prompt tasarlanmıştır. Üçüncü olarak, Llama-2-7B13, Mistral-7B14 ve Dolly-7B15, cinsiyet, ırk, meslek ve din gibi dört sosyal kategoride tarafsız cümleler içeren bir veri setinde ince ayar edilmiştir; böylece Llama-2-7Bİnce Ayarlanmış, Mistral-7Bİnce Ayarlanmış ve Dolly-7Bİnce Ayarlanmıştırsırasıyla bu konuda bulundu. Son olarak, ince ayarlanmış LLM'lerin adil yanıtlar verme etkinliğini araştırmaları için çıkarımlar yapılır.
Aşağıdaki araştırma sorularını formüle ettik ve bu makalede ele aldık. Her formüle edilen araştırma sorusu (RQ) için bir null hipotez (H0) ve alternatif bir hipotez (H1) çerçevelendi.
RQ1: Çıkarım veri seti ve temel yönlendirme teknikleri, LLM'lerdeki toplumsal önyargıları değerlendirmede etkili mi? Null hipotezi (H01): Çıkarım veri setinden elde edilen önyargı puanları, temel promptlarla birleştirildiğinde, LLM'lerin temel önyargı puanlarından istatistiksel olarak ayırt edilemezdir. Alternatif hipotez (H11): Temel promptlarla yapılan çıkarım veri setinden elde edilen önyargı puanları, LLM'lerin temel önyargı puanlarından istatistiksel olarak anlamlı olarak farklıdır. Hipotezi test etmek için, StereoSet16'nın modifiye edilmesi ve her LLM'nin temel yönlendirme teknikleriyle değerlendirilmesi yoluyla NeutralSet adlı bir veri seti oluşturuldu; böylece stereotipik olmayan yanıtlar üretme yeteneği değerlendirildi. Ayarlarımızda altı temel prompt dahil ediyoruz -- Standard (LLM'ye çıkarım yapmasını sağlamak için sıfır atış isteği), Düşünce Zinciri (CoT, LLM'den adım adım düşünerek çıkarım yapmasını istemek için tasarlanmıştır), System1 (LLM'nin hızlı düşünmesini sağlayan bir prompt), System2 (LLM'nin yavaş ve düşünceli düşünmesini sağlayan bir prompt), Human Persona 1 (HP1, LLM'nin karar verirken hızlı düşünen bir insan kimliğini benimsemesini sağlamak için tasarlanmıştır), ve İnsan Persona 2 (HP2, LLM'nin insan kimliğini benimsemesini sağlamak için tasarlanmıştır; bu kişiler yavaş ve düşünceli düşünerek cevap vermektedir).
RQ2: Yönelme yönlendirme teknikleri, LLM'lerde toplumsal önyargıları ortaya çıkarmada ve azaltmada etkili mi? Sıfır hipotezi (H0₂): Tarafsız yönlendirme teknikleri, LLM'lerde toplumsal önyargıları ortaya çıkarma ve azaltmada etkili değildir. Alternatif hipotez (H12): LLM'lerde önyargı yönlendirme teknikleri kullanıldığında ölçülen önyargı puanları önemli ölçüde azalır. Temel promptların tarafsız varyantlarının, sosyal ayrımcılıktan bağımsız adil metin üretimi sağlamak için üç açık kaynaklı LLM üzerindeki etkisini araştırıyoruz.
RQ3: LLM'lerin ince ayarlarıyla toplumsal önyargılar daha da azaltılabilir mi? Null hipotezi (H03): LLM'lerin ince ayarlanması, toplumsal önyargıları yalnızca yönlendirme teknikleriyle elde edilen azaltmaların ötesine kadar azaltmaz. Alternatif hipotez (H13): LLM'lerin ince ayarlanması, sadece yönlendirme teknikleriyle elde edilen azaltmaların ötesinde toplumsal önyargıları daha da azaltır. Bu soruyu yanıtlamak için, veriseti 17'yi değiştirip LLM'leri ince ayar ederek ince ayarın stereotip yanıtlarını azaltmadaki etkisini daha iyi değerlendiriyoruz.
Şekil 1, prompt varyasyonu ve LLM ince ayarının cinsiyet tarafsız tahmin edilen sonuç üzerindeki etkisini göstermektedir. Çalışmamızın yeniliği, manuel veri seti kürasyonu, birden fazla ayrım yönlendirme stratejisi ve tek bir protokol altında ince ayarlama yoluyla toplumsal önyargı tanımlama ve azaltma için bir LLM'yi analiz ederek tıbbi görüntüleme ve EHR bakımı gibi hassas gerçek dünya uygulamalarıyla ilgili olarak ortaya çıkıyor. LLM'lerde önyargı literatürünü dört perspektife ayırdık: önyargı ve bilişsel çağrışımlar için veri setleri; önyargı tespit ve değerlendirme çerçeveleri; önyargı azaltma yaklaşımları; ve uzmanlaşmış alanlarda önyargı.
Araştırmacılar, LLM'lerde önyargı değerlendirmesi ve anlamsal ilişki analizini mümkün kılmak için sürekli veri setleri üretmektedir. Örneğin, bilişsel psikoloji ve dilbilimde, serbest çağrışımlar kavramsal bilginin organizasyonunda her zaman anahtardır. Aynı ilişkiyi LLM'lerin gizli dağılımında simüle eden Abramski ve ark.18, LLM World of Words (LWOW) adlı bir veri seti oluşturmuşlardır. LWOW İngilizce serbest ilişkilendirme normları veri seti, üç LLM'den milyonlarca yanıttan oluşmaktadır: Mistral-7B14, Llama-3.1-8B19 ve Claude-3-5-haiku-latest20. Small World of Words (SWOW)21'den ilham almıştır; bu, insan İngilizcesi serbest çağrışım normlarının en büyük veri seti olup, çeşitli psikolojik ve dilbilimsel araştırmalarda yaygın olarak kullanılmıştır. Ayrıca, LWOW her biri bir kelimeyi temsil eden düğümlerden oluşan bilişsel bir ağ kurmaya yardımcı olur; düğümler ise ağda birbirine daha yakın olan anlamsal olarak benzer kelimelere karşılık gelir. Bu, yapay bilişsel ağdaki kelimeler arasındaki mesafeyi temel bir metrik olarak tahmin ederek LLM'lerin çıktılarındaki önyargıyı değerlendirmeye yardımcı olur. Özel LLM'lerin kullanımında en büyük engellerden biri, iç donanımlarının erişilememesidir. Bu modellerde önyargıyı ele almak için önemli çabalar yapılmış olsa da, hizalama veri setleri hâlâ nadirdir. Bu endişeyi gidermek için, LLM'lerde cinsiyet önyargısını azaltmak amacıyla Zhang ve ark.22 tarafından GenderAlign adlı bir veri seti önerilmiştir. UnStereoEval23 adlı bir kıyaslama veri seti olarak, mesleklerde ve duygularda stereotipik cinsiyet önyargısını araştırmak için önerilmiştir. Bulguları, 28 farklı LLM'de düşük bir adalet seviyesini ortaya koymaktadır. Bartl veLeavy 24, stereotipik atıfta bulunan cümlelerin nötr eşdeğerleriyle değiştirildiği ve üç dil modelinin (GPT-225, PHI-1.526 ve RoBERTa27) ince ayarlandığı Tiny Heap adlı bir veri seti geliştirmiştir. Bulgularında, modellerin cinsiyet-stereotipik eğilimlerinde önemli bir azalma gözlemlenmiştir.
LLM'lerdeki önyargıları belirlemek ve hafifletmek için birkaç çok katmanlı çerçeve önerilmiştir. Raza ve ark.28'de, veri seti oluşturma, model geliştirme, önyargı azaltma ve değerlendirme olmak üzere dört katmandan oluşan bir çerçeve olan NBIAS önerilmiştir. Çerçeve içindeki veri seti, sağlık hizmetleri, sosyal medya ve istihdam portalları dahil olmak üzere çeşitli alanlardan oluşturulmuştur. Modellerinin etkinliğini, adil olarak başlangıç seviyesini (BERT29) %1 ila %8 oranında geride bırakarak sergiliyorlar. Bir diğer benzer çerçeve olan GenderCARE30'da, LLMS'de cinsiyet önyargısını hafifletmeye yönelik bir strateji önerilmektedir. Kapsamlı deneysel kurulumlarında, on iki farklı LLM'de cinsiyet önyargısını ortalama %35 azalttılar. BiasAlet31 adlı bir çerçeve, LLM'ler tarafından oluşturulan açık metinde sosyal önyargıyı otomatik olarak tespit eder. Bazı sınırlamalar vardır: birincisi, LLM'nin açık metin üretiminde önyargıyı değerlendirmek için bir kıyaslama bulunamadığı için çalışma, SBIC32 adlı eski veri seti üzerine inşa edilmektedir; bu da örtük önyargının önemi ile veri setinin kendisi arasındaki ayrımı zorlaştırır. İnsan tarafından üretilen verilerdeki önyargı, bu veriler üzerinde eğitilen modellere de dahil edilebilir. Bu tür modellerin kullanımı, yüksek riskli işlerde tartışmalıdır ve bu projelerin sonuçları dezavantajlı grupları olumsuz etkileyebilir. Bunu ele almak için, BiasBuster33 adlı bir çerçeve, LLM'lerde bilişsel önyargıyı tespit etmek, değerlendirmek ve azaltmak için tasarlanmıştır. Buna bağlı olarak, başkabir çalışma 34'te araştırmacılar, LLM'nin düşünceli ve yavaş düşünmesine olanak tanıyan Sistem 2 istimleri aracılığıyla adil, mantıklı ve kritik metin üretmek için etkileşimli bir çerçeve önermektedir; bu metin kendi kendine geliştirilen ve ima edici önerileri tamamlamaktadır. Ancak, çerçeve LLM'lerin gizli alanındaki görevlerle sınırlıdır. Dong ve ark.35 , on açık kaynaklı LLM'de cinsiyet önyargısını azaltmak ve değerlendirmek için dolaylı araştırma kullanan bir çerçeve geliştirmiştir. Sorgulama yöntemlerinde, doğrudan stereotipik atıfta bulunmadan dolaylı cinsiyet önyargısını ortaya çıkarırlar.
Lin ve ark.36 , hem kapalı uçlu (GPT-3.5-turbo ve GPT-437) hem de açık uçlu modeller (Llama-2-7B13, Mistral-7B14, Vicuna29) için LLM'lerin metin üretimindeki siyasi önyargıyı araştırmaktadır. Model tarafından oluşturulan metnin sol mu sağa eğilimli medya yanlılığını tetikleyip üretmediğini belirlediler. Ayrıca, modeli ince ayar ederek ve metin üretimi sırasında ek tarafsız yönlendirmeler sağlayarak bir azaltma stratejisi geliştirdiler. Yanlılık azaltma tekniği uygulandıktan sonra, model nötr metin üretme eğilimindedir; Sol ya da sağ eğilimli medya bunu etkilemez. Buna uygun olarak, Raj ve ark.17 , psikolojideki temas hipotezine dayanan, farklı sosyal grupların ideolojilerini kavrayan hızlı üretim ve üç açık kaynaklı LLM'nin metin üretiminde önyargıyı azaltmayı içeren bir çözüm olan Sosyal Temas Çıkarma (SCD) adlı bir tarafsız çözüm önermiştir. Bununla paralel olarak, Kamruzzaman ve Kim38 , beş LLM'de (GPT-3.5, GPT-437, Llama-2-7B13, Mistral-7B14 ve Gemini-1.039) on iki önyargı boyutunda Sistem 1 ve Sistem 2 düşünce zinciri yönlendirmesini kullanan bir sosyal tarafsızlık tekniği önermiştir. Burada, System 1 promptu LLM'nin hızlı yanıt vermesini sağlarken, System 2 isteği onu daha düşünceli ve bilinçli cevaplara yönlendirmek için tasarlanmıştır. LLM'lerdeki önyargıyı azaltmak için prompt mühendisliği kullanan çeşitli çalışmalar yapılmış olsa da, LLM'lerin çıktısı üzerindeki prompt varyasyonun etkisini neredeyse hiç kimse incelememiştir. Bu sorunu ele almak için Hida ve ark.40 , on iki açık kaynaklı LLM'nin çıktılarının varyasyon yaratmaya duyarlılığını incelemiş ve bunların görev performansı ile önyargı takasları üzerindeki etkilerini analiz etmiştir. Bulguları, tarafsız sonuçların prompta duyarlı olduğunu ortaya koyuyor; Modellerin çıktısındaki daha az önyargı, görev performansının düşmesine yol açar. Kamboj ve ark.41 , T5 modelinin bağlamsallaştırılmış gömülmelerinde cinsiyet önyargısını azaltmak için bir post-işlem yaklaşımı önermiştir (Text-To-Text-Transfer-Transformer model42). Oba ve ark.43 , LLM'lere önyargılı üretimlerini bastırmaları için manuel olarak oluşturulmuş metin önsözleri sağlar.
Sağlık hizmetlerinde onlarca yıldır tanı hatası kaynağı olan bilişsel önyargılar, klinik karar alma süreçlerinde büyük dil modellerine (LLM) kazıma ve güçlendirilme riskiyle karşı karşıyadır. Bu riskle mücadele etmek için Mahajan ve ark.44 , bu teknolojilerin uygulanması için azaltma stratejilerinin üç tema üzerine odaklanması gerektiğini önermektedir: birincisi, kendini değerlendirme (çıktıların yinelemeli yeniden değerlendirilmesi), ikincisi, bağlamsal akıl yürütme (tam hasta geçmişi ve kanıta dayalı yönergeleri içermek) ve son olarak, şeffaf akıl yürütme izleri (denetime sunulan akıl yürütme süreçlerinin açıklamaları). LLM'ler, her yerde bulunan yetenekleriyle artık programlama kodu üretmek için de yaygın olarak kullanılmaktadır. Bu nedenle, oluşturulan kodda herhangi bir sosyal önyargının olumsuz etkilerini araştırmak için araştırmacı önemli bir endişedir. Böyle bir yanlılık tespit edilirse, ilgili azaltma teknikleri geliştirilmelidir. Aynı yönde, Huang ve ark.45 sosyal önyargı değerlendirme ve azaltma tekniği önermiş ve bunu yaygın olarak kullanılan beş LLM'de test etmiştir. Son zamanlarda, LLM mimarilerinde ve insan gibi gelen yanıtlar üretme yeteneklerinde büyük ilerlemeler gördük. LLM'lerin karar alma süreçlerinde insanlar için vekil olarak hizmet edip edemeyeceği hâlâ az araştırılmış ve daha fazla araştırma gerektirmektedir. Bu doğrultusunda, LLM'lerin anket anketinde insan benzeri yanıtlar verebilme yeteneğini incelemek için Tjuatja ve ark.46 tarafından bir çerçeve ve veri seti hazırlanmıştır.
Bu ilerlemelere rağmen, üç araştırma boşluğu devam etmektedir. İlk olarak, önceki araştırmalar genellikle dar bir önyargı türüne (örneğin, cinsiyet veya politik) veya belirli alanlara (örneğin, belirli bir konu) odaklanır. İkinci olarak, prompt mühendisliği yaygın olsa da, sistematik prompt varyasyonun LLM çıktısı üzerindeki etkilerini inceleyen çok az çalışma vardır. Üçüncü olarak, sınırlı araştırmalar, sağlık gibi kritik alanlarla ilgili açık kaynak LLM'lerin zorlu kaynak kısıtlı ince ayar ayarlarında önyargıyı ele alır. Bu boşlukları gidermek için, çeşitli model mimarilerinde stereotipik önyargıyı ölçmeye yardımcı olabilecek tek bir önyargı azaltma ve değerlendirme protokolü sunulur; hesaplama kısıtlamaları altında ince ayar içerir ve model kararlarının önyargı metriklerine karşı sağlamlığını değerlendirir.