$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Bu çalışmada, web tabanlı klinik uygulama rehberi—JLCS Akciğer Kanseri Hastaları ve Aileleri Rehberi—referans bilgi kaynağı olarak kullanan, rehber tabanlı bir RAG sohbet botunun faydasını inceledik. Sohbet botu, rehberin web yapısını kullanarak rehber içeriğine dayalı yanıtlar üretti ve sayfaları kullanıcı sorgularına benzerliklerine göre geri aldı. Bu yaklaşım, benzerlik temelli geri alım ile rehber tabanlı yanıt üretiminin güvenilir ve verimli tıbbi bilgi teslimatını destekleyebileceğini gösterdi. Son çalışmalar, özellikle halüsinasyonlar ve yanıt güvenilirliği konularında LLM tabanlı tıbbi sohbet botlarının potansiyelini ve sınırlamalarınıortaya koymuştur 12,13,14. Genel chatbotçerçevelerine odaklanan önceki çalışmaların aksine, mevcut protokol hasta rehberi içeriğini URL seviyesinde elde eden ve tanımlanabilir referans bilgilerine dayalı yanıtlar üreten tekrarlanabilir rehber tabanlı bir RAG yaklaşımını sergiler. Bu çalışma, tamamen doğrulanmış bir klinik sohbet botu sistemi yerine, kanser bilgisinin aktarımı için şeffaf bir protokol sunmaktadır.
Sistemimiz tüm rehber koleksiyonunda yapay zekayı eğitmek yerine, referans bilgisi olarak yalnızca her kullanıcı sorgusuna en ilgili CQ'ları seçti (Şekil 1). Soru metni ile her CQ arasındaki alaka, programlama dili tabanlı kosinüs benzerlik hesaplamaları kullanılarak TF–IDF vektör temsilleriyle nicel olarak değerlendirildi. Bu benzerlik puanlarına dayanarak, CQ'lar alaka sırasına göre azalan sırayla sıralanmış ve seçilmiş, böylece yönerge içinden uygun bilgi kaynaklarının öznel yargıya dayanmadan sistematik olarak çıkarılmasını mümkün kılmıştır (Tablo 1). Ayrıca, alınan CQ metinlerinin birleştirilmesi ve bunları ZE'ye toplu olarak sunması, yanıt üretimi için tutarlı bir kanıt temelinin korunmasına yardımcı oldu ve böylece oluşturulan yanıtların doğruluğunu ve bağlamsal tutarlılığını artırdı. RAG sistemlerinde, doğru bilginin üretimi kritik olarak doğru ve uygun referans kaynaklarına bağlıdır14. Bu tasarım, sistemin tek bir Sıkı Cevap ile yeterince kapsayamayan bilgileri telafi etmesini sağladı ve daha kapsamlı ve klinik olarak makul cevaplar alınmasına katkıda bulundu. Ayrıca, RAG güncel CQ içeriğinin esnek bir şekilde geri alınmasını sağlar ve kanıta dayalı tıbbi uygulamalar için oldukça uygundur10,11. Kılavuz tabanlı RAG yaklaşımları daha öncetanımlanmış olsa da 11,18, mevcut protokol, hasta odaklı bir rehberin mevcut CQ tabanlı web yapısını birincil başvuru çerçevesi olarak kullanmasında farklılık gösterir. Bu tasarım, manuel bilgi tabanı oluşturma veya model yeniden eğitimi olmadan uygulanabilecek şeffaf ve tekrarlanabilir bir iş akışı sağlar.
Önemli olarak, sohbet botu yanıtlarını referans verilen kılavuzun kapsamıyla sınırladı. Sorular rehber içeriğinin dışına çıktığında, sistem açıkça cevap üretmekten kaçınarak desteklenmeyen yanıtların riskini azalttı. Kontrol referans seçiminde kosinüs benzerliğinin kullanılması, üretilen yanıtların güvenliğini ve güvenilirliğini daha da artırmıştır (Tablo 2). Kılavuz kapsamı dışındaki sorular için de referans sayfaları alındı (Tablo 3). Kosinüs benzerlik değerleri, kapsam dışı sorulara (0.20–0.65) göre (0.20–0.65) kapsam dışı sorulara (0.20–0.31; veri gösterilmemiştir) daha yüksekti, ancak içerik klinik olarak alakalı olmasa bile bazı kılavuz sayfalarına düşük benzerlik puanları atandı. Bunun nedeni, kosinüs benzerliğinin yalnızca sorgu ile kılavuz metni arasındaki anahtar kelime eşleşmesine dayanarak hesaplanmasıdır. Önemli olarak, bu düşük alakalı referanslar uygunsuz yanıtlara yol açmadı, çünkü chatbot yeterli referans bilgisi bulunmadığında yanıt üretmekten kaçındı. Tanımlanmış test koşullarında manuel inceleme sırasında herhangi bir halüsinasyon tespit edilmedi. 0.2 kosinüs benzerlik eşiği, geri alma hassasiyeti ve özgüllüğü dengelemek için ön testlerde ampirik olarak seçildi. Bu eşik mevcut test koşullarında etkili olsa da, eşik hassasiyetinin sistematik değerlendirmesi bu protokol çalışmasının kapsamının dışındaydı. Gelecekteki çalışmalar, daha büyük kıyaslama veri setleri ve nicel arama metrikleri kullanarak alternatif eşik ayarlarının etkilerini araştırmalıdır. Gözlemlenen davranış, RAG tabanlı çıktı kontrolünün tıbbi yapay zeka uygulamalarında faydalı olabileceğini gösteriyor. Ancak mevcut değerlendirme, kapsam içi ve kapsam dışı sınırlı sayıda soruya dayanıyordu ve esas olarak önerilen iş akışının kavram kanıtı olarak değerlendirilmişti. Bu nedenle, bulgular klinik doğruluk, güvenlik veya genellenebilirliğin kapsamlı bir doğrulaması olarak yorumlanmamalıdır.
Bu çalışmanın birkaç teknik sınırlaması vardır. Japon morfolojik analizörü ve yanıt üretimi için GPT-3.5-turbo-16k (LLM) kullandık. LLM, sistem geliştirme döneminde yaygın ve kararlı bir model olduğu ve önerilen iş akışının tekrarlanabilir uygulanmasını mümkün kıldığı için seçildi. Morfolojik analizörler ve LLM'lerin kendine özgü özellikleri vardır; Bu nedenle, model veya kütüphane seçimi hem bilgi çıkarımın doğruluğunu hem de üretilen yanıtların içeriğinietkiler 22,23. Daha yeni modeller (örneğin, GPT-4 veya GPT-5 sınıfı LLM'ler) performansı ve haricigeçerliliği iyileştirebilse de, alternatif modellerin değerlendirilmesi mevcut protokol çalışmasının kapsamının dışındaydı. Daha yeni LLM'ler daha iyi akıl yürütme yeteneği, talimat takip etme ve yanıt kalitesi sunabilir; ancak bu çalışmanın birincil amacı, farklı LLM'lerin performansını karşılaştırmak yerine kılavuz tabanlı bir RAG çerçevesinin uygulanabilirliğini değerlendirmekti. Bu bileşenlerin daha fazla optimize edilmesi, daha verimli ve doğru yanıt üretimini mümkün kılabilir ve bu bulguların genellenebilirliğini değerlendirmek için farklı model konfigürasyonları kullanılarak doğrulama gereklidir. Ayrıca, mevcut protokol Japonca bir kılavuz ve Japonca morfolojik analiz kullanılarak geliştirilmiştir. TF–IDF vektörizasyonu, kosinüs benzerliği ve RAG temelli arama çerçevesi prensipte dil bağımsız olsa da, diğer dillerde uygulama dil özel metin işleme araçları ve doğrulama gerektirir. Bu çalışma tek bir kılavuzla sınırlı olmasına ve farklı rehber yapılarının doğrudan karşılaştırılmasına izin vermemesine rağmen, CQ düzeyindeki organizasyon rehber içeriğinin sistematik olarak çıkarılmasını kolaylaştırdı ve rehber tabanlı RAG sohbet botu için referans bilgisinin oluşturulmasını destekledi. Özellikle, rehberin web yapısı—her CQ'nun benzersiz bir URL ile ilişkilendirilmesi—referans içeriğinin URL düzeyinde verimli kazıma ve organizasyonunu mümkün kılan önemli pratik bir rol oynamıştır. PDF tabanlı belgeler veya CQ seviyesinde URL'leri olmayan web siteleri dahil olmak üzere farklı formatlara sahip yönergeler, alternatif segmentasyon ve geri alma stratejileri gerektirebilir. Bu nedenle, mevcut iş akışının diğer rehber yapıları ve tıbbi uzmanlıklara genellenebilirliği henüz belirlenmemiştir. Gelecekteki çalışmalar, bu yaklaşımın birden fazla hastalık, rehber formatları ve bilgi kaynakları üzerinde uygulanabilirliğini değerlendirmelidir.
Bu çalışmanın bulguları, rehber referanslı yapay zeka sistemlerinin tasarımı için pratik rehberlik sağlar ve web tabanlı klinik kılavuzlara referans veren bir rehber tabanlı RAG sohbet botunun kanserle ilgili tıbbi bilgilerin iletilmesi için bir araç potansiyeli olduğunu göstermektedir. Ancak bu çalışma, kılavuz alımı, yanıt oluşturma ve yanıt kısıtlama mekanizmalarının teknik fizibilitesini göstermeyi amaçlayan bir kavram kanıtı değerlendirmesini teşkil etmekte olup, tıbbi bilgi sisteminin resmi klinik doğrulaması olarak yorumlanmamalıdır. Klinik etkinliği, güvenliği ve kullanıcı sonuçları değerlendirilmedi ve gelecekteki çalışmalarla belirlenmemiştir. Etik ve kullanıcı güvenliği açısından, kılavuz destekli bilgilere verilen yanıtların sınırlandırılması, desteklenmeyen veya halüsinasyon edilmiş yanıtların riskini azaltabilir. Ancak, aşırı reddetme davranışı kullanıcı memnuniyetini ve algılanan faydalılığı da azaltabilir. Bu nedenle gelecekteki çalışmalar, güvenlik ile kullanılabilirlik arasındaki dengeyi değerlendirir ve yanlış bilgilere karşı uygun korumaları korumalıdır. Web tabanlı rehberlerin bilgi yapısını kullanarak ve kullanıcı sorularına odak cevaplar sunarak, bu sistem tıbbi bilgi sunumunda yapay zekanın gelecekteki uygulamaları için faydalı bir model olabilir.