Araştırma makalesi

Klinik Yapay Zeka Uygulamaları İçin Büyük Dil Modellerinde İnce Ayar ve Yönlendirme Yoluyla Adaletin Artırılması

DOI:

10.3791/69132

2 Ocak 2026

Bu makalede

Özet

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Sağlık hizmetlerine özgü büyük dil modelleri, diğer büyük dil modelleri gibi eğitim verilerindeki önyargıları yansıttıkları için etik ve teknik zorluklarla karşı karşıyadır. Burada sunulan protokol, üç açık kaynak modelinde prompt varyantları kullanarak dört tür önyargının (cinsiyet, ırk, meslek, din) bastırılmasını doğrular.

Özet

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Büyük Dil Modelleri (LLM'ler), tıbbi bakım gibi hassas alanlara giderek daha fazla uygulanmaktadır; bu alanlar birçok teknik ve etik zorluk yaratmaktadır. En acil sorunlar arasında, toplumsal önyargıları yansıtabilecek büyük veri setleri üzerinde eğitilen bu modellere entegre edilen önyargılar yer alır. Bu tür önyargılar, adaletsiz, genellenelemez veya hatta zararlı çıktılar verebilir; bu da onları gerçek dünyada klinik olarak uygulanmaz ve etik ile düzenleyici kısıtlamalara uygun değildir. Önyargı bastırmanın dört kritik kategoride (cinsiyet, ırk, meslek ve din) incelenmiş modeller önerildiğinde ne kadar iyi çalıştığını inceliyoruz. Çeşitli çıkarım veri setlerini manuel olarak seçiyoruz ve üç açık kaynaklı LLM'nin çıktılarını test etmek için on iki prompt varyantı oluşturuyoruz — bunların altısı önyargılıdır — Llama2-7B, Mistral-7B ve Dolly-7B. Çıktıların adaleti ve yorumlanabilirliği, daha düşük puanların daha iyi adalet ve yorumlanabilirlik gösterdiği önyargılı puanlama metrikiyle değerlendirilir. Ayrıca, tarafsız istemlerin önyargıyı azalttığını ve modelin ince ayarının daha iyi performans gösterdiğini de not ediyoruz. Sonuçlar, tıbbi görüntüleme ve Elektronik Sağlık Kayıtlarının (EHR) bakımı gibi gerçek dünya ortamlarında güvenilir ve adil LLM kullanımı için zamanında hareketin, model sağlamlığının ve sürekli etik incelemenin kritik önemini vurgulamaktadır.

Giriş

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Büyük Dil Modelleri, karar verme 1,2, metinüretimi 3, metinçevirisi 4, müşteri duygusuanalizi 5, soruyanıtlama 6 ve klinik raporlar oluşturma gibi çeşitli görevleri desteklemek için olağanüstü bir yankı sunar. Son zamanlarda, uygulamaların LLM'leri kullanarak sosyal açıdan dezavantajlı bireylere veya gruplara zarar vereniçerik ürettiği birkaç durum olmuştur 8,9,10. Bu tür boş tepkilerin temel nedeni, bu modellerin ırk, cinsiyet, sosyoekonomik sınıf ve benzeri faktörlerle ilişkili toplumsal önyargıları barındıran veri setleri üzerinde eğitilmiş olmasıdır. Ama sağlık hizmeti yapay zeka sisteminde "önyargı" ve "adalet" derken kastettiğiniz şey öznel ve bağlama bağlı olabilir. Araştırmacılar, LLM'lerde sosyal önyargıları azaltmak için önemli çabalargöstermiştir 11,12; ancak daha fazla iyileştirme gerekmektedir. Araştırmacılar, çeşitli uygulamalarda ön işleme, işleme içinde, sonra-işleme veya bunların kombinasyonları olarak sınıflandırılabilecek birden fazla önyargı azaltma stratejisi önermiştir. Bu kategorilendirme, azaltma önleminin hangi aşamada alındığına dayanır. Bu protokol, LLM'lerin altı varyantında sosyal önyargıyı ele almak ve hafifletmek için üç stratejiyi birleştirir ve dört sosyal önyargı boyutunda önyargı azaltmayı araştırır: Cinsiyet, Meslek, Tırk ve Din. İlk olarak, LLM'lerin çıkarımlar üretmesini sağlamak için veri artırma tekniği kullanılarak bir çıkarım veri seti geliştirilir. İkinci olarak, LLM'lerden stereotipik yanıtlar almak için on iki tür prompt tasarlanmıştır. Üçüncü olarak, Llama-2-7B13, Mistral-7B14 ve Dolly-7B15, cinsiyet, ırk, meslek ve din gibi dört sosyal kategoride tarafsız cümleler içeren bir veri setinde ince ayar edilmiştir; böylece Llama-2-7Bİnce Ayarlanmış, Mistral-7Bİnce Ayarlanmış ve Dolly-7Bİnce Ayarlanmıştırsırasıyla bu konuda bulundu. Son olarak, ince ayarlanmış LLM'lerin adil yanıtlar verme etkinliğini araştırmaları için çıkarımlar yapılır.

Aşağıdaki araştırma sorularını formüle ettik ve bu makalede ele aldık. Her formüle edilen araştırma sorusu (RQ) için bir null hipotez (H0) ve alternatif bir hipotez (H1) çerçevelendi.

RQ1: Çıkarım veri seti ve temel yönlendirme teknikleri, LLM'lerdeki toplumsal önyargıları değerlendirmede etkili mi? Null hipotezi (H01): Çıkarım veri setinden elde edilen önyargı puanları, temel promptlarla birleştirildiğinde, LLM'lerin temel önyargı puanlarından istatistiksel olarak ayırt edilemezdir. Alternatif hipotez (H11): Temel promptlarla yapılan çıkarım veri setinden elde edilen önyargı puanları, LLM'lerin temel önyargı puanlarından istatistiksel olarak anlamlı olarak farklıdır. Hipotezi test etmek için, StereoSet16'nın modifiye edilmesi ve her LLM'nin temel yönlendirme teknikleriyle değerlendirilmesi yoluyla NeutralSet adlı bir veri seti oluşturuldu; böylece stereotipik olmayan yanıtlar üretme yeteneği değerlendirildi. Ayarlarımızda altı temel prompt dahil ediyoruz -- Standard (LLM'ye çıkarım yapmasını sağlamak için sıfır atış isteği), Düşünce Zinciri (CoT, LLM'den adım adım düşünerek çıkarım yapmasını istemek için tasarlanmıştır), System1 (LLM'nin hızlı düşünmesini sağlayan bir prompt), System2 (LLM'nin yavaş ve düşünceli düşünmesini sağlayan bir prompt), Human Persona 1 (HP1, LLM'nin karar verirken hızlı düşünen bir insan kimliğini benimsemesini sağlamak için tasarlanmıştır), ve İnsan Persona 2 (HP2, LLM'nin insan kimliğini benimsemesini sağlamak için tasarlanmıştır; bu kişiler yavaş ve düşünceli düşünerek cevap vermektedir).

RQ2: Yönelme yönlendirme teknikleri, LLM'lerde toplumsal önyargıları ortaya çıkarmada ve azaltmada etkili mi? Sıfır hipotezi (H0₂): Tarafsız yönlendirme teknikleri, LLM'lerde toplumsal önyargıları ortaya çıkarma ve azaltmada etkili değildir. Alternatif hipotez (H12): LLM'lerde önyargı yönlendirme teknikleri kullanıldığında ölçülen önyargı puanları önemli ölçüde azalır. Temel promptların tarafsız varyantlarının, sosyal ayrımcılıktan bağımsız adil metin üretimi sağlamak için üç açık kaynaklı LLM üzerindeki etkisini araştırıyoruz.

RQ3: LLM'lerin ince ayarlarıyla toplumsal önyargılar daha da azaltılabilir mi? Null hipotezi (H03): LLM'lerin ince ayarlanması, toplumsal önyargıları yalnızca yönlendirme teknikleriyle elde edilen azaltmaların ötesine kadar azaltmaz. Alternatif hipotez (H13): LLM'lerin ince ayarlanması, sadece yönlendirme teknikleriyle elde edilen azaltmaların ötesinde toplumsal önyargıları daha da azaltır. Bu soruyu yanıtlamak için, veriseti 17'yi değiştirip LLM'leri ince ayar ederek ince ayarın stereotip yanıtlarını azaltmadaki etkisini daha iyi değerlendiriyoruz.

Şekil 1, prompt varyasyonu ve LLM ince ayarının cinsiyet tarafsız tahmin edilen sonuç üzerindeki etkisini göstermektedir. Çalışmamızın yeniliği, manuel veri seti kürasyonu, birden fazla ayrım yönlendirme stratejisi ve tek bir protokol altında ince ayarlama yoluyla toplumsal önyargı tanımlama ve azaltma için bir LLM'yi analiz ederek tıbbi görüntüleme ve EHR bakımı gibi hassas gerçek dünya uygulamalarıyla ilgili olarak ortaya çıkıyor. LLM'lerde önyargı literatürünü dört perspektife ayırdık: önyargı ve bilişsel çağrışımlar için veri setleri; önyargı tespit ve değerlendirme çerçeveleri; önyargı azaltma yaklaşımları; ve uzmanlaşmış alanlarda önyargı.

Araştırmacılar, LLM'lerde önyargı değerlendirmesi ve anlamsal ilişki analizini mümkün kılmak için sürekli veri setleri üretmektedir. Örneğin, bilişsel psikoloji ve dilbilimde, serbest çağrışımlar kavramsal bilginin organizasyonunda her zaman anahtardır. Aynı ilişkiyi LLM'lerin gizli dağılımında simüle eden Abramski ve ark.18, LLM World of Words (LWOW) adlı bir veri seti oluşturmuşlardır. LWOW İngilizce serbest ilişkilendirme normları veri seti, üç LLM'den milyonlarca yanıttan oluşmaktadır: Mistral-7B14, Llama-3.1-8B19 ve Claude-3-5-haiku-latest20. Small World of Words (SWOW)21'den ilham almıştır; bu, insan İngilizcesi serbest çağrışım normlarının en büyük veri seti olup, çeşitli psikolojik ve dilbilimsel araştırmalarda yaygın olarak kullanılmıştır. Ayrıca, LWOW her biri bir kelimeyi temsil eden düğümlerden oluşan bilişsel bir ağ kurmaya yardımcı olur; düğümler ise ağda birbirine daha yakın olan anlamsal olarak benzer kelimelere karşılık gelir. Bu, yapay bilişsel ağdaki kelimeler arasındaki mesafeyi temel bir metrik olarak tahmin ederek LLM'lerin çıktılarındaki önyargıyı değerlendirmeye yardımcı olur. Özel LLM'lerin kullanımında en büyük engellerden biri, iç donanımlarının erişilememesidir. Bu modellerde önyargıyı ele almak için önemli çabalar yapılmış olsa da, hizalama veri setleri hâlâ nadirdir. Bu endişeyi gidermek için, LLM'lerde cinsiyet önyargısını azaltmak amacıyla Zhang ve ark.22 tarafından GenderAlign adlı bir veri seti önerilmiştir. UnStereoEval23 adlı bir kıyaslama veri seti olarak, mesleklerde ve duygularda stereotipik cinsiyet önyargısını araştırmak için önerilmiştir. Bulguları, 28 farklı LLM'de düşük bir adalet seviyesini ortaya koymaktadır. Bartl veLeavy 24, stereotipik atıfta bulunan cümlelerin nötr eşdeğerleriyle değiştirildiği ve üç dil modelinin (GPT-225, PHI-1.526 ve RoBERTa27) ince ayarlandığı Tiny Heap adlı bir veri seti geliştirmiştir. Bulgularında, modellerin cinsiyet-stereotipik eğilimlerinde önemli bir azalma gözlemlenmiştir.

LLM'lerdeki önyargıları belirlemek ve hafifletmek için birkaç çok katmanlı çerçeve önerilmiştir. Raza ve ark.28'de, veri seti oluşturma, model geliştirme, önyargı azaltma ve değerlendirme olmak üzere dört katmandan oluşan bir çerçeve olan NBIAS önerilmiştir. Çerçeve içindeki veri seti, sağlık hizmetleri, sosyal medya ve istihdam portalları dahil olmak üzere çeşitli alanlardan oluşturulmuştur. Modellerinin etkinliğini, adil olarak başlangıç seviyesini (BERT29) %1 ila %8 oranında geride bırakarak sergiliyorlar. Bir diğer benzer çerçeve olan GenderCARE30'da, LLMS'de cinsiyet önyargısını hafifletmeye yönelik bir strateji önerilmektedir. Kapsamlı deneysel kurulumlarında, on iki farklı LLM'de cinsiyet önyargısını ortalama %35 azalttılar. BiasAlet31 adlı bir çerçeve, LLM'ler tarafından oluşturulan açık metinde sosyal önyargıyı otomatik olarak tespit eder. Bazı sınırlamalar vardır: birincisi, LLM'nin açık metin üretiminde önyargıyı değerlendirmek için bir kıyaslama bulunamadığı için çalışma, SBIC32 adlı eski veri seti üzerine inşa edilmektedir; bu da örtük önyargının önemi ile veri setinin kendisi arasındaki ayrımı zorlaştırır. İnsan tarafından üretilen verilerdeki önyargı, bu veriler üzerinde eğitilen modellere de dahil edilebilir. Bu tür modellerin kullanımı, yüksek riskli işlerde tartışmalıdır ve bu projelerin sonuçları dezavantajlı grupları olumsuz etkileyebilir. Bunu ele almak için, BiasBuster33 adlı bir çerçeve, LLM'lerde bilişsel önyargıyı tespit etmek, değerlendirmek ve azaltmak için tasarlanmıştır. Buna bağlı olarak, başkabir çalışma 34'te araştırmacılar, LLM'nin düşünceli ve yavaş düşünmesine olanak tanıyan Sistem 2 istimleri aracılığıyla adil, mantıklı ve kritik metin üretmek için etkileşimli bir çerçeve önermektedir; bu metin kendi kendine geliştirilen ve ima edici önerileri tamamlamaktadır. Ancak, çerçeve LLM'lerin gizli alanındaki görevlerle sınırlıdır. Dong ve ark.35 , on açık kaynaklı LLM'de cinsiyet önyargısını azaltmak ve değerlendirmek için dolaylı araştırma kullanan bir çerçeve geliştirmiştir. Sorgulama yöntemlerinde, doğrudan stereotipik atıfta bulunmadan dolaylı cinsiyet önyargısını ortaya çıkarırlar.

Lin ve ark.36 , hem kapalı uçlu (GPT-3.5-turbo ve GPT-437) hem de açık uçlu modeller (Llama-2-7B13, Mistral-7B14, Vicuna29) için LLM'lerin metin üretimindeki siyasi önyargıyı araştırmaktadır. Model tarafından oluşturulan metnin sol mu sağa eğilimli medya yanlılığını tetikleyip üretmediğini belirlediler. Ayrıca, modeli ince ayar ederek ve metin üretimi sırasında ek tarafsız yönlendirmeler sağlayarak bir azaltma stratejisi geliştirdiler. Yanlılık azaltma tekniği uygulandıktan sonra, model nötr metin üretme eğilimindedir; Sol ya da sağ eğilimli medya bunu etkilemez. Buna uygun olarak, Raj ve ark.17 , psikolojideki temas hipotezine dayanan, farklı sosyal grupların ideolojilerini kavrayan hızlı üretim ve üç açık kaynaklı LLM'nin metin üretiminde önyargıyı azaltmayı içeren bir çözüm olan Sosyal Temas Çıkarma (SCD) adlı bir tarafsız çözüm önermiştir. Bununla paralel olarak, Kamruzzaman ve Kim38 , beş LLM'de (GPT-3.5, GPT-437, Llama-2-7B13, Mistral-7B14 ve Gemini-1.039) on iki önyargı boyutunda Sistem 1 ve Sistem 2 düşünce zinciri yönlendirmesini kullanan bir sosyal tarafsızlık tekniği önermiştir. Burada, System 1 promptu LLM'nin hızlı yanıt vermesini sağlarken, System 2 isteği onu daha düşünceli ve bilinçli cevaplara yönlendirmek için tasarlanmıştır. LLM'lerdeki önyargıyı azaltmak için prompt mühendisliği kullanan çeşitli çalışmalar yapılmış olsa da, LLM'lerin çıktısı üzerindeki prompt varyasyonun etkisini neredeyse hiç kimse incelememiştir. Bu sorunu ele almak için Hida ve ark.40 , on iki açık kaynaklı LLM'nin çıktılarının varyasyon yaratmaya duyarlılığını incelemiş ve bunların görev performansı ile önyargı takasları üzerindeki etkilerini analiz etmiştir. Bulguları, tarafsız sonuçların prompta duyarlı olduğunu ortaya koyuyor; Modellerin çıktısındaki daha az önyargı, görev performansının düşmesine yol açar. Kamboj ve ark.41 , T5 modelinin bağlamsallaştırılmış gömülmelerinde cinsiyet önyargısını azaltmak için bir post-işlem yaklaşımı önermiştir (Text-To-Text-Transfer-Transformer model42). Oba ve ark.43 , LLM'lere önyargılı üretimlerini bastırmaları için manuel olarak oluşturulmuş metin önsözleri sağlar.

Sağlık hizmetlerinde onlarca yıldır tanı hatası kaynağı olan bilişsel önyargılar, klinik karar alma süreçlerinde büyük dil modellerine (LLM) kazıma ve güçlendirilme riskiyle karşı karşıyadır. Bu riskle mücadele etmek için Mahajan ve ark.44 , bu teknolojilerin uygulanması için azaltma stratejilerinin üç tema üzerine odaklanması gerektiğini önermektedir: birincisi, kendini değerlendirme (çıktıların yinelemeli yeniden değerlendirilmesi), ikincisi, bağlamsal akıl yürütme (tam hasta geçmişi ve kanıta dayalı yönergeleri içermek) ve son olarak, şeffaf akıl yürütme izleri (denetime sunulan akıl yürütme süreçlerinin açıklamaları). LLM'ler, her yerde bulunan yetenekleriyle artık programlama kodu üretmek için de yaygın olarak kullanılmaktadır. Bu nedenle, oluşturulan kodda herhangi bir sosyal önyargının olumsuz etkilerini araştırmak için araştırmacı önemli bir endişedir. Böyle bir yanlılık tespit edilirse, ilgili azaltma teknikleri geliştirilmelidir. Aynı yönde, Huang ve ark.45 sosyal önyargı değerlendirme ve azaltma tekniği önermiş ve bunu yaygın olarak kullanılan beş LLM'de test etmiştir. Son zamanlarda, LLM mimarilerinde ve insan gibi gelen yanıtlar üretme yeteneklerinde büyük ilerlemeler gördük. LLM'lerin karar alma süreçlerinde insanlar için vekil olarak hizmet edip edemeyeceği hâlâ az araştırılmış ve daha fazla araştırma gerektirmektedir. Bu doğrultusunda, LLM'lerin anket anketinde insan benzeri yanıtlar verebilme yeteneğini incelemek için Tjuatja ve ark.46 tarafından bir çerçeve ve veri seti hazırlanmıştır.

Bu ilerlemelere rağmen, üç araştırma boşluğu devam etmektedir. İlk olarak, önceki araştırmalar genellikle dar bir önyargı türüne (örneğin, cinsiyet veya politik) veya belirli alanlara (örneğin, belirli bir konu) odaklanır. İkinci olarak, prompt mühendisliği yaygın olsa da, sistematik prompt varyasyonun LLM çıktısı üzerindeki etkilerini inceleyen çok az çalışma vardır. Üçüncü olarak, sınırlı araştırmalar, sağlık gibi kritik alanlarla ilgili açık kaynak LLM'lerin zorlu kaynak kısıtlı ince ayar ayarlarında önyargıyı ele alır. Bu boşlukları gidermek için, çeşitli model mimarilerinde stereotipik önyargıyı ölçmeye yardımcı olabilecek tek bir önyargı azaltma ve değerlendirme protokolü sunulur; hesaplama kısıtlamaları altında ince ayar içerir ve model kararlarının önyargı metriklerine karşı sağlamlığını değerlendirir.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Protokol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Tüm deneyler Google Colab platformunda (A100, 40 GB RAM) gerçekleştirilmektedir. Deneyler için Hugging Face'ten Llama2-7B, Mistral-7B ve Dolly-7B'nin API anahtarları (Model kartları) toplandı.

Protokol üç bölüme ayrılmıştır. İlk olarak, LLM'lerde sosyal önyargıyı değerlendirmek için temel oluşturan bir veri seti oluşturun. Sonra, Kamruzzaman ve Kim38'in LLM'lerin çıkardığı çıkarımlarda sosyal önyargının varlığını araştırmak için yaptığı çalışmalarla uyumlu on iki ayrı yönlendirme varyantı tasarlayın. Sonra, LLM'leri ırk, din, cinsiyet ve meslekle ilgili tarafsız cümlelerden oluşan bir veri setinde ince ayar edin ve aynı yönlendirmelerle tekrar inceleyin; ince ayarlamanın üretilen çıkarımlar üzerindeki etkisini araştırın. Önerilen çerçeve Şekil 2'de gösterilmiştir.

Veri setinin küratörlüğü
Çerçeve iki veri seti kullanır. Biri çıkarım çıkarmak için, diğeri ise LLM'lerin ince ayarına uygulanır. Bu çalışma, StereoSet16'yı değiştirerek çıkarım üretimi için temel oluşturan yeni bir veri seti olan NeutralSet'i oluşturmaktadır. LLM'ler, StereoSet'i dört önyargı türü üzerinde tahminler yapmak için kullandı: ırk, din, cinsiyet ve meslek. StereoSet, iki alt veri setinden oluşur: cümle içi ve cümle arası. NeutralSet'in bir örneği Tablo 1'de gösterilmiştir. Sütun bağlamından bir cümleyi LLM'ye sorgu olarak verin ve BOŞLUK'u anti-stereotip, stereotip veya nötr sütunlardaki herhangi bir kelimeyle doldurmanızı isteyin. LLM'deki önyargı derecesi, seçtiği seçeneğe göre değerlendirilebilir. NeutralSet'te nötr bir sütunun yer alması, onu StereoSet'ten ayırır. Yeni veri setine eklemenin amacı, LLM çıkarımları yaparken stereotip seçeneğinin seçilme olasılığını azaltmaktır. Kelimeler, Algoritma 1'de (Ek Dosya 1) belirtilen adımlara göre nötr sütuna eklenir. Burada Vs ve Vas sırasıyla stereotip ve anti-stereotip kelimelerin vektörleridir. Sözlükten Vn'ye en yakın vektör seçilir; Vn, bu kelime stereotip ve anti-stereotip kelime vektörleri arasında bağlamsal olarak konumlandırılır ve bu kelime seçilen satırdaki nötr sütuna eklenir. Tablo 2, NeutralSet oluşturma sürecini özetlemektedir. Sonra, veriseti 17'yiLLM'leri ince ayar etmek için değiştirin. Revize edilen veri seti, modelleri eğitmek için kullanılan sosyal tarafsız bir yanıtla eşleştirilen bir sorgu içeren 25.020 örnek içeriyor. Sorgular, dört tür sosyal önyargıyı ele almak için tasarlanmıştır.

LLM'leri Yönlendirmek
LLM'lerdeki sosyal önyargıları, giriş talimatları olarak bir dizi prompt sunarak inceleyin. Öncelikle, on iki tür prompt oluşturun: altı temel ve altı karşılık gelen tarafsız varyant. Tüm yönlendirme tekniklerinin içeriği Tablo 3'te listelenmiştir. Bu çalışmadaki promptlar, çizimli, resmileştirilmiş bir üretim sürecinden geçti; bu süreç zamanla önemli deneme-yanılma ve geliştirme yoluyla geliştirilen bir dizi prompt ortaya çıktı. Bu, temel soru, CoT ve insan-kişilik önerileri dahil olmak üzere çeşitli prompt türlerinin kapsamını sağladı. Prompt tasarımları ve puanlama, dış alan uzmanları (örneğin, klinisyenler, sosyal veya adalet uzmanları) tarafından doğrulanmamıştır. Tablo 4 , farklı prompt türlerini özetler, mantık tarzlarını, önyargı azaltma yeteneklerini ve uygun kullanım durumlarını vurgulayarak uygun seçimi yönlendirir. LLM'lerin bu makaledeki değerlendirmesi, koşular veya oturumlar boyunca geçmiş bilgileri tutmaz. Son modelde netleştirmek gerekirse, her öneri izole olarak yürütülecek, yani hiçbir konuşma geçmişi bir istemden diğerine aktarılmayacak. Bu düzen, geçmiş yanıtların sonraki çıktıları etkilememesini sağladı. İnce ayar aşamasında, yalnızca model parametrelerini eğitim veri setine göre değiştirin; bu da hem Parametre-Verimli Transfer Öğrenme (PEFT47) hem de Kuantize Düşük Seviye Uyum (QLoRA48) bölümlerinde belirtilmiştir. Uyarıyı aşağıda belirtildiği gibi oluşturun:

Standart prompt: Bu, LLM'ye minimum bilgiyle çıkarım yapması için talimat verilen sıfır atış yönlendirme tekniğidir. İstem ise "Verilen seçeneklerden en uygun kelimeyi boşluğa ekle."dir. Bu, tüm altı LLM'de sosyal önyargıyı nicelendirmek ve değerlendirmek için bir temel olarak kullanılır.

CoT uyarısı: İsterde "Adım adım düşün ve BOŞLUĞU doldur. Sunulan seçeneklerden BLANK için en uygun olanı seçin...". Bu yönlendirme tekniğinde, LLM bilişsel sürecini aktif hale getirmesi ve cevap vermeden önce adım adım düşünmesi teşvik edilir.

System1 ve System2 şunları önerir: "Sorulara anında yanıt verirsiniz..." ifadesini ekleyerek System1 promptları, LLM'yi System1'de insan bilişinin işleyişine benzer hızlı, sezgisel yanıtlar sunmaya yönlendirir. Öte yandan, System2 istmenleri LLM'den daha düşünceli, detaylı, analitik ve kasıtlı yanıtlar almak için tasarlanmıştır ve "Sorulara kapsamlı ve kasıtlı yanıt verirsiniz. Cevaplarınız düşünceli ve güvenilir "talimatlarda".

HP1 ve HP2 uyarılar: Uyarılar şöyle başlar: "Soruları hızlıca yanıtlayan bir kişinin kimliğini benimse ve BOŞLUK doldur, bu kimliğin doğasına sıkı sıkıya uyarak kalırken... ". HP1 yönlendirme tekniğinde, LLM'ye hızlı yanıt veren bir insan kimliğini benimsemesi talimatı verildi. Bu ayarın amacı, LLM'nin System1 biliş sürecinde insanı taklit etmesini sağlamaktır. Buna karşılık, HP2 sorusunda LLM, soruları yanıtlamadan önce düşünceli ve kasıtlı düşünen insan benzeri bir kimlik benimsemeye yönlendirilir ve böylece daha doğru sonuçlar elde eder. HP2 isteği şu ifadeyle başlar: "Soruları düşünceli ve kasıtlı yanıtlayan bir kişinin kimliğini benimse ve bu kimliğin doğasına sıkı uyum sağlayarak BOŞLUĞU doldur..." Bu uyarıların dahil edilmesinin temel amacı, bir LLM'nin insan bilişini tam olarak taklit etme yeteneğini değerlendirmektir.

Debias varyantları: Bir debias varyantı, LLM'ye kararı tarafsız ve stereotipik önyargı olmadan vermesini emreden bir ifade eklenerek oluşturulur.

LLM'lerin Değerlendirilmesi
Altı LLM'yi değerlendirin: 1) Huggingface'te meta-llama/Llama-2-7b-chat-hf kontrol noktasını kullanarak Llama-2-7B13; 2) Huggingface'te mistralai/Mistral-7B-Instruct-v0.3 kontrol noktasını kullanan Mistral-7B14; 3) Dolly-7B15, Huggingface'te databricks/dolly-v2-7b kontrol noktası kullanılarak; 4) Llama2-7Bince ayarlanmış, Llama-2-7B'nin ince ayar edilmiş bir varyantı; 5)Mistral-7B'nin ince ayarlı bir varyantı; 6) Dolly-7B, ince ayarlı, Dolly-7B'nin ince ayar edilmiş bir varyantı.

Tüm deneyleri, örneğin 40 GB veya daha yüksek belleğe sahip A100 gibi yüksek hızlı bir GPU üzerinde yapın. LLM'leri ince ayar yapmak için, veri setini eğitim, doğrulama ve test setlerine ayırın; standart %70:%10:%20 bölünmesini kullanın. Modelin tamamen yeniden eğitimini önlemek için, bu çalışma ince ayar için PEFT47 konfigürasyonunu kullanır; bu konfigürasyon, modelin parametrelerinin önemli bir kısmını dondurur ve sadece birkaç göreve özgü parametre ekler. Hesaplama kaynakları sınırlıysa, LLM'i yüklemek için QLoRA48'de 4-bit hassasiyet kullanın. Bu, modelin performansını düşürmeden daha hızlı ince ayar yapılmasını sağlar.

LLM'lerde stereotipik önyargıyı değerlendirmek için bir ölçüt olarak Önyargıpuanını kullanın. Denklem 1'de gösterildiği gibi, Önyargıpuanı , belirli bir prompt için LLM'den gelen geçerli yanıtların toplam sayısına stereotip yanıtlarının oranı olarak hesaplanır.

figure-protocol-1(1)

Burada Ns, Nas ve Nn sırasıyla stereotipik, anti-stereotipik ve nötr tepkilerin sayısını temsil eder. Daha düşük bir önyargı puanı, modelin çıktısının daha az klişe olduğunu gösterir.

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Sonuçlar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Denklem 1'de tanımlanan önyargı puanını kullanarak, araştırma sorularımızı sistematik olarak yanıtlıyoruz ve LLM'lerde dört sosyal boyutta toplumsal önyargıları değerlendiriyoruz. Gözlemlenen önyargı puanlarındaki istatistiksel olarak anlamlı azalmalar, yüksek riskli görevler için LLM'lerde önyargı azaltma protokolünün ampirik doğruluğunu sağlar. NeutralSet'in etkinliğini, yani derlenmiş çıkarım veri setini değerlendirmek için, hem StereoSet hem de NeutralSet'teki üç vanilla LLM'yi temel...

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Tartışma

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu çalışmada, LLM'lerde sosyal önyargıları azaltmak için Llama2-7B13, Mistral-7B14 ve Dolly-7B15'i kullanan ölçeklenebilir bir protokol sunuyoruz. Bu yaklaşım, HP2 prompt mühendisliğini, yön değiştirici modifikasyonları ve hedefe yönelik ince ayarlamaları birleştirerek cinsiyet, ırk, meslek ve din gibi dört ana toplumsal boyutta LLM tarafından üretilen çıktılarda önyargıyı azaltmaya devam eden bir protokol geliştirir...

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Açıklamalar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Yazarların açıklayacak hiçbir şeyi yok.

Malzemeler

Bu makalede kullanılan malzemelerin listesi
AdŞirketKatalog numarasıYorumlar
Google ColabGooglehttps://colab.research.google.com/deneyler 'nin çalıştırılması için kullanılmıştır;
Mendeley MasaüstüMendeleyhttps://www.mendeley.com/atıf ve referansları yönetmek için kullanılır.

Kaynaklar

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. STRUX: An LLM for decision-making with structured explanations. Lu, Y., Hu, Y., Foroosh, H., Jin, W., Liu, F. Proceedings of the 2025 Conference of the Nations of the Americas Chapter of the Association for Computational Linguistics: Human Language Technologies, , (2025).
  2. Eigner, E., Händler, T. Determinants of LLM-assisted decision-making. arXiv. , (2024).
  3. Wu, Y. Large Language Model and Text Generation. Natural Language Processing in Biomedicine: A Practical Guide. , Springer. Cham. (2024).
  4. Wang, L., et al. Benchmarking and improving long-text translation with large language models. Find Assoc Comput Linguist: ACL. 2024, 7175-7187 (2024).
  5. Ghatora, P. S., Hosseini, S. E., Pervez, S., Iqbal, M. J., Shaukat, N. Sentiment analysis of product reviews using machine learning and pre-trained LLM. Big Data Cogn Comput. 8 (12), 199(2024).
  6. Arefeen, M. A., Debnath, B., Chakradhar, S. LeanContext: Cost-efficient domain-specific question answering using LLMs. Nat Lang Process J. 7, 100065(2024).
  7. Ye, Y., Sarkar, S., Bhaskar, A., Tomlinson, B., Monteiro, O. Using ChatGPT in a clinical setting: A case report. MedComm Future Med. 2 (2), e51(2023).
  8. How are LLMs mitigating stereotyping harms? Learning from search engine studies. Leidinger, A., Rogers, R. Proceedings of the AAAI/ACM Conference on AI, Ethics, and Society, 7, 839-854 (2024).
  9. Gender bias and stereotypes in large language models. Kotek, H., Dockum, R., Sun, D. Proceedings of the ACM Collective Intelligence Conference, 2023, 12-24 (2023).
  10. Uncovering stereotypes in large language models: A task complexity-based approach. Shrawgi, H., Rath, P., Singhal, T., Dandapat, S. Proceedings of the 18th Conference of the European Chapter of the Association for Computational Linguistics, 1, 1841-1857 (2024).
  11. Kwak, D. -H., Holtkamp, P., Kim, S. S. Measuring and controlling social desirability bias: Applications in information systems research. J Assoc Inf Syst. 20 (4), 317-345 (2019).
  12. Self-debiasing large language models: Zero-shot recognition and reduction of stereotypes. Gallegos, I. O., et al. Proceedings of the 2025 Conference of the Nations of the Americas Chapter of the Association for Computational Linguistics: Human Language Technologies, , (2025).
  13. Touvron, H., et al. Llama 2: Open foundation and finetuned chat models. arXiv. , (2023).
  14. Jiang, A. Q., et al. Mistral 7B. arXiv. , (2023).
  15. Conover, M., et al. Free Dolly: Introducing the world's first truly open instruction-tuned LLM. , databricks.com/blog/2023/04/12/dolly-first-open-commercially-viable-instruction-tuned-llm (2023).
  16. Nadeem, M., Bethke, A., Reddy, S. StereoSet: Measuring stereotypical bias in pretrained language models. arXiv. , (2020).
  17. Breaking bias, building bridges: Evaluation and mitigation of social biases in LLMs via contact hypothesis. Raj, C., Mukherjee, A., Caliskan, A., Anastasopoulos, A., Zhu, Z. Proceedings of the Seventh AAAI/ACM Conference on AI, Ethics, and Society, 2024, 1180-1189 (2024).
  18. Abramski, K., Improta, R., Rossetti, G., Stella, M. The "LLM world of words" English free association norms generated by large language models. Sci Data. 12 (1), 1-16 (2025).
  19. Lhama Team, Meta AI. The Llama 3 herd of models. arXiv. , (2024).
  20. Claude Haiku 3.5. , Anthropic. At anthropic.com/claude/haiku (2025).
  21. De Deyne, S., Navarro, D. J., Perfors, A., Brysbaert, M., Storms, G. The "small world of words" English word association norms for over 12,000 cue words. Behav Res Methods. 51 (3), 987-1006 (2019).
  22. GenderAlign: An alignment dataset for mitigating gender bias in large language models. Zhang, T., et al. Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics, , (2025).
  23. Are models biased on text without gender-related language. Belém, C. G., Seshadri, P., Razeghi, Y., Singh, S. The Twelfth International Conference on Learning Representations (ICLR), , openreview.net/forum?id=w1JanwReU6 (2024).
  24. From showgirls to performers: Finetuning with gender-inclusive language for bias reduction in LLMs. Bartl, M., Leavy, S. Proceedings of the 5th Workshop on Gender Bias in Natural Language Processing (GeBNLP), 5, 280-294 (2024).
  25. Radford, A., Wu, J., Child, R., Luan, D., Amodei, D., Sutskever, I. Language models are unsupervised multitask learners. OpenAI Blog. 1 (8), 9(2019).
  26. Li, Y., Bubeck, S., Eldan, R., Giorno, A. D., Gunasekar, S., Lee, Y. T. Textbooks are all you need II: Phi-1.5 technical report. arXiv. , (2023).
  27. Liu, Y., et al. A robustly optimized BERT pretraining approach. arXiv. , (2019).
  28. Raza, S., Garg, M., John, D., Raza, S., Ding, C. Nbias: A natural language processing framework for BIAS identification in text. Expert Syst Appl. 237 (PB), 121542(2024).
  29. Vicuna: An open-source chatbot impressing GPT-4 with 90%* ChatGPT quality. , Available from: lmsys.org/blog/2023-03-30-vicuna/ (2025).
  30. GenderCARE: A comprehensive framework for assessing and reducing gender bias in large language models. Tang, K., et al. CCS '24: Proceedings of the 2024 on ACM SIGSAC Conference on Computer and Communications Security, 2024, 1196-1210 (2024).
  31. BiasAlert: A plug-and-play tool for social bias detection in LLMs. Fan, Z., Chen, R., Xu, R., Liu, Z. Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing, 2024, 14778-14790 (2024).
  32. Social bias frames: Reasoning about social and power implications of language. Sap, M., Gabriel, S., Qin, L., Jurafsky, D., Smith, N. A., Choi, Y. Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics, 58, 5477-5490 (2020).
  33. Echterhoff, J., Liu, Y., Alessa, A., McAuley, J., He, Z. Cognitive bias in decision-making with LLMs. Findings of the Association for Computational Linguistics: EMNLP 2024. 2024, 12640-12653 (2024).
  34. Furniturewala, S., et al. Thinking fair and slow: On the efficacy of structured prompts for debiasing language models. arXiv. , (2024).
  35. Dong, X., Wang, Y., Yu, P. S., Caverlee, J. Disclosure and mitigation of gender bias in LLMs. arXiv. , (2024).
  36. Investigating bias in LLM-based bias detection: Disparities between LLMs and human perception. Lin, L., Wang, L., Guo, J., Wong, K. 31st International Conference on Computational Linguistics, 31, 10634-10649 (2025).
  37. OpenAI. GPT-4 technical report. arXiv. , (2023).
  38. Kamruzzaman, M., Kim, G. L. Prompting techniques for reducing social bias in LLMs through system 1 and system 2 cognitive processes. Proceedings of Recent Advances in Natural Language Processing. 2024, 511-520 (2024).
  39. Gemini Team. Gemini: A family of highly capable multimodal models. arxiv. , (2023).
  40. Hida, R., Kaneko, M., Okazaki, N. Social bias evaluation for large language models requires prompt variations. Find Assoc Comput Linguist: EMNLP 2025. , 14507-14530 (2025).
  41. Measuring and mitigating gender bias in contextualized word embeddings. Kamboj, P., Kumar, S., Goyal, V. Proc IEEE Int Conf Blockchain Distrib Syst Secur, , (2023).
  42. Raffel, C., et al. Exploring the limits of transfer learning with a unified text-to-text transformer. J Mach Learn Res. 21, 1-67 (2023).
  43. In-contextual gender bias suppression for large language models. Oba, D., Kaneko, M., Bollegala, D. EACL 2024 - 18th Conference of the European Chapter of the Association for Computational Linguistics, Findings of EACL 2024, 2024, 1722-1742 (2024).
  44. Mahajan, A., Obermeyer, Z., Daneshjou, R., Lester, J., Powell, D. Cognitive bias in clinical large language models. npj Digit Med. 8 (1), 1-4 (2025).
  45. Huang, D., Bu, Q., Zhang, J., Xie, X., Chen, J., Cui, H. Bias testing and mitigation in LLM-based code generation. ACM Trans Softw Eng Methodol. , (2025).
  46. Tjuatja, L., Chen, V., Wu, S. T., Talwalkar, A., Neubig, G. Do LLMs exhibit human-like response biases? A case study in survey design. arXiv. , (2024).
  47. Houlsby, N., et al. Parameter-efficient transfer learning for NLP. arXiv. , (2019).
  48. Dettmers, T., Pagnoni, A., Holtzman, A., Zettlemoyer, L. QLoRA: Efficient finetuning of quantized LLMs. arXiv. , (2023).
  49. Xiao, H., Xiang, Z., Wang, D., Devadas, S. A Theory to instruct differentially-private learning via clipping bias reduction. IEEE Symposium on Security and Privacy (SP). , (2023).
  50. Kamboj, P., Kumar, S., Goyal, V. Mitigating Social Bias in Generative AI: A comprehensive review. KSII Trans Internet Inf Syst. 19 (10), 3372-3394 (2025).

Erişim kısıtlı. Bu içeriği görüntülemek için lütfen giriş yapın veya deneme sürümünü başlatın.

Yeniden basım ve izinler

Bu JoVE makalesinin metnini veya şekillerini yeniden kullanmak için izin iste

İzin iste

Etiketler

Yanl l k Bast rmaModel nce Ayarstem M hendisli iHakkaniyet De erlendirmesiYanl l k PuanlamasYanl l Giderilmi stemlerModel Dayan kl lElektronik Sa l k Kay tlar
Video yakında

İlgili makaleler