Method Article

Etki alanına özgü yanıt verme hızını artırmak için vektör yerleştirmeleri aracılığıyla büyük dil modellerini artırma

DOI:

10.3791/66796

December 6th, 2024

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu protokolde, temel büyük dil modeli yanıt kalitesi, bir vektör yerleştirme mekanizması aracılığıyla hakemli, alana özgü bilimsel makalelerle artırma yoluyla iyileştirilir. Ayrıca, büyük dil modelleri arasında performans karşılaştırmasına yardımcı olmak için kod sağlanır.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Büyük dil modelleri (LLM'ler), bir kullanıcı sorgusuyla ilgili bilgi oluşturmak için popüler bir kaynak olarak ortaya çıkmıştır. Bu tür modeller, kapsamlı, statik bir metinsel veri külliyatı kullanılarak kaynak yoğun bir eğitim süreci yoluyla oluşturulur. Bu statik yapı, hızla değişen bilgi, özel bilgi ve hassas verilere sahip etki alanlarında benimseme sınırlamalarına neden olur. Bu çalışmada, vakıf modelleri olarak bilinen genel amaçlı LLM'leri, güncel, hakemli bilimsel makaleleri dahil etmek için gömme tabanlı bir yaklaşım kullanılarak alana özgü bilgilerle artırmak için yöntemler özetlenmiştir. Bu, şeffaflığı, kullanıcı gizliliğini ve kontrolünü ve tekrarlanabilirliği en üst düzeye çıkarmak için Llama-Index gibi açık kaynaklı araçlar ve Llama-2 gibi halka açık modeller aracılığıyla elde edilir. Bilimsel makaleler örnek bir kullanım durumu olarak kullanılsa da, bu yaklaşım herhangi bir metin veri kaynağına genişletilebilir. Ek olarak, bu geliştirmeyi takiben model performansını değerlendirme yöntemleri tartışılmaktadır. Bu yöntemler, eğitim külliyatındaki bilgilerin kapsamlılığından bağımsız olarak, son derece uzmanlaşmış alanlar için LLM sistemlerinin hızlı bir şekilde geliştirilmesini sağlar.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

OpenAI'nin ChatGPT'si veya Meta AI'nin Llama'sı gibi büyük dil modelleri (LLM'ler), bir kullanıcı istemiyle ilgili metin oluşturmak için hızla popüler bir kaynak haline geldi. Başlangıçta bir dizideki bir sonraki sözcüksel öğeleri tahmin etmek için işlev gören bu modeller, bağlamı anlamak, klinik bilgileri kodlamak ve çeşitli görevlerde yüksek performans göstermek için gelişmiştir 1,2,3,4. Dil modelleri bu tür yeteneklerden ve mevcut popülerlik düzeylerinden onlarca yıl öncesine dayansada5, derin öğrenme ve bilgi işlem yeteneklerindeki son gelişmeler, önceden eğitilmiş, yüksek kaliteli ticari LLM'leri web tabanlı teknolojiler ve uygulama programı arayüzleri (API'ler) aracılığıyla kullanıcılara geniş çapta kullanılabilir hale getirmiştir6. Ancak, LLM'leri bu biçimde tüketmenin birkaç önemli sınırlaması vardır.

Zorluk 1: Statik eğitim külliyatı
LLM'ler muazzam (örneğin, Llama 27 durumunda iki trilyon jeton) ancak statik bir metin verisi kütlesi üzerinde eğitilir. Bu, hızlı gelişme gösteren veya değişen literatürle ilgili doğru yanıtlar üretmede bir zorluk teşkil etmektedir. Bu statik yaklaşımda, LLM'lerin en son verilere ayak uydurmak için sık sık yeniden eğitim alması gerekir ve bu ne pratik ne de ölçeklenebilirdir. Ayrıca, eğitim verilerinde bulunmayan bilgilere dayalı yanıtlar gerektiren yönlendirmeler, yararlı metin üretimini engelleyebilir veya halüsinasyonlara yol açabilir8. Halüsinasyon örnekleri veya gerçek uydurma örnekleri, özellikle bilgilerin doğruluğunun kritik olduğu ortamlarda, LLM'lerin güvenilirliği hakkında önemli endişelere yol açmaktadır9.

Zorluk 2: Etki alanı özgüllüğü eksikliği
Önceden eğitilmiş modeller genellikle genel kullanım için oluşturulurken, kullanıcılar belirli bir etki alanındaki performans için özel olarak optimize edilmiş bir modele ihtiyaç duyabilir. Ek olarak, bir modeli de novo eğitmek veya önemli ince ayarlar yapmak için gereken hesaplama kaynakları ve veriler birçok kullanıcı için engelleyicidir.

Zorluk 3: Gizlilik eksikliği
Hassas verileri veya özel bilgileri içeren uygulamaları takip eden kullanıcılar, verilerin nasıl saklanabileceği veya kullanılabileceği konusunda bilgi sahibi olmadıkları için belirli LLM hizmetlerini kullanmak istemeyebilir veya kullanamayabilirler.

Zorluk 4: Garantili istikrar eksikliği
Tescilli LLM'lere sahip hizmetler, herhangi bir zamanda mevcut modelleri değiştirebilir veya davranışı değiştirebilir, bu da kararlılığı bu hizmetlere dayanan uygulamaların uygulanması için bir endişe haline getirir.

Geri alma ile artırılmış nesil (RAG), özellikle modelin eğitim külliyatı dışındaki bilgilerle ilgili sorgularda LLM performansını iyileştirmek için geliştirilmiş bir tekniktir10,11. Bu sistemler, bir kullanıcı sorgusuna yanıt oluştururken dikkate alınması gereken bağlamsal bilgileri dahil ederek LLM'leri artırır. Son zamanlarda yapılan çeşitli çalışmalar, RAG sistemlerinin uygulamalarını ve potansiyel avantajlarını tanımlamıştır 12,13,14.

Bu çalışmada özetlenen yöntemin amacı, böyle bir sistemin inşasını göstermek ve araştırmacıların alana özgü, artırılmış LLM'ler üzerinde hızlı bir şekilde deney yapmaları için bir çerçeve sağlamaktır. Bu yöntem, bir LLM'yi harici bir metin tabanlı veri kaynağıyla artırmak isteyen kullanıcılar için geçerlidir. Özellikle, bu protokolün kapsayıcı bir amacı, dil modelleme alanında önemli bir teknik uzmanlığa ihtiyaç duymadan çeşitli pratik LLM ve RAG deneylerine genişletilebilen adım adım kod sağlamaktır, ancak bu yaklaşımı değişiklik yapmadan uygulamak için Python'un çalışma bilgisi gereklidir. Çözümlerin kullanıcı kontrolünü, şeffaflığını, taşınabilirliğini ve satın alınabilirliğini en üst düzeye çıkarmak için açık kaynaklı, halka açık araçlar kullanılır. Önerilen sistem, daha önce belirtilen sorunları aşağıdaki şekillerde ele almaktadır:

Çözüm 1 ve 2: Statik eğitim derlemi ve alan özgüllüğü eksikliği
Sağlanan metodoloji, orijinal eğitim verilerinde yer almayan alana özgü bilgileri sağlamak için yerleştirmeleri kullanan bir RAG yaklaşımından yararlanır. Yüksek düzeyde, katıştırma modelleri, metni veya diğer verileri bir vektör veya tek boyutlu sayı dizisi olarak bir gösterime dönüştürür. Bu teknik, metinde yer alan anlamsal bilgileri yoğun, sayısal bir forma dönüştürdüğü için faydalıdır. Bir kullanıcı sorgusunu aynı gömme alanına yansıtarak, kullanıcı sorgusu ile metin belgelerinin bölümleri arasındaki mesafeyi15 ve dolayısıyla yaklaşık anlamsal benzerliği hesaplamak için çeşitli algoritmalar kullanılabilir. Bu nedenle, ayrı bölümlere ayrılmış belgelerden bu tür vektörlerin bir veritabanını oluşturmak, bir kullanıcı sorgusuyla en alakalı metin için önemli sayıda belge üzerinde arama yapmayı kolaylaştırabilir (Şekil 1). Bu yaklaşım herhangi bir metin belgesine genişletilebilir. LLM'leri artırmak için çevrimiçi arama yetenekleri gibi diğer yaklaşımlar uygulanmaya başlanırken, bu yaklaşım kullanıcıların kullanım durumları için yeterince yüksek kalitede olduğu düşünülen kaynakları seçmelerine olanak tanır.

2. Çözüm: Gizlilik eksikliği
Bu uygulamada, barındırma için güvenli bir bulut ortamı kullanıldı ve kullanıcı istemleri, oluşturulan yanıtlar veya bu ekosistemden ayrılan diğer veriler yoktu. Bununla birlikte, tüm kodlar, başka bir bulut sağlayıcısının veya yerel donanımın değiştirilebilmesini sağlamak için platformdan bağımsız bir şekilde yazılmıştır.

3. Çözüm: Garantili stabilite eksikliği
Bu yaklaşım, açık kaynak kitaplıklarını kullanır ve LLM'leri genel kullanıma açık ağırlıklarla artırmaya odaklanarak gerekirse daha yüksek derecede şeffaflık, kararlılık ve sürüm oluşturma sağlar.

Önerdiğimiz sistemin tam bir şeması Şekil 2'de gösterilmiştir ve bu veya benzer bir sistemin çoğaltılmasına ilişkin ayrıntılı talimatlar protokol bölümünde özetlenmiştir. İnce ayar veya büyütme yoluyla model davranışını değiştirirken göz önünde bulundurulması gereken ek bir husus da performansın değerlendirilmesidir. Dil üreten modellerde, birçok geleneksel makine öğrenimi metriği uygulanamadığından bu benzersiz bir zorluk sunar. Çeşitli tekniklermevcut olmasına rağmen16, bu çalışmada, doğruluğu değerlendirmek ve artırma öncesi ve sonrası performansı karşılaştırmanın yanı sıra popüler alternatif LLM'lerle karşılaştırmak için uzmanlar tarafından yazılan çoktan seçmeli sorular (MCQ'lar) kullanılmıştır.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu yazıda gösterilen kullanım örneğinde, vektör deposu Chicago Konsensüs Çalışma Grubu17'den yayınlanan yönergeler kullanılarak oluşturulmuştur. Bu uzman grubu, periton kanserlerinin yönetimi için kılavuzlar geliştirmek üzere kurulmuştur. Konu alanı, araştırmacıların klinik uzmanlık alanı içinde olduğu için seçilmiştir. Makale setine Cancer ve Annals of Surgical Oncology dahil olmak üzere çevrimiçi dergi havuzlarından erişildi. Kaynak belgelerden gömmeler oluşturmak için Pekin Yapay Zeka Akademisi (BAAI, https://www.baai.ac.cn/english.html) tarafından oluşturulan kompakt (33,4 milyon parametreli) bir gömme modeli olan bge-small-en kullanıldı. Elde edilen veritabanı daha sonra Llama 2 ve Open-AI temel modelleri7'yi artırmak için kullanıldı. Okuyucunun rahatlığı için kod GitHub (https://github.com/AnaiLab/AugmentedLLM) aracılığıyla kullanıma sunulmuştur. Tekrarlanabilirliği sağlamak için, sağlanan gereksinimler listesinde kullanılan kitaplıkların aynı sürümlerinin yanı sıra aynı Python sürümünün kullanılması önerilir. Aşağıdaki yöntemlerde kullanılan araçlarla ilgili kurulum veya belgelerle ilgili ek ayrıntılar, Python (https://www.python.org), git (https://git-scm.com), Llama-Index (https://llamaindex.ai) ve Chroma (https://trychroma.com) sağlayıcılarının resmi web sitelerinde bulunabilir.

1. Önkoşullar: Kodu gözden geçirin ve gerekli kitaplıkları yükleyin

  1. git, python ve pip öğelerinin yüklü olduğunu doğrulayın.
    1. Bir terminalde, yüklemeyi doğrulamak için aşağıdaki komutları çalıştırın:
      git --versiyon
      python3 --versiyon
      pip3 --versiyon
  2. Kodu kontrol edin ve gereksinimleri yükleyin.
    1. Bir terminalde aşağıdaki komutları çalıştırın:
      git klon https://github.com/AnaiLab/AugmentedLLM.git
      cd ./AugmentedLLM/

      pip3 install -r requirements.txt

2. Llama-Index ile bir vektör veritabanının oluşturulması

  1. RTF dosya biçimlerini dönüştürün (yalnızca dosyalar RTF biçimindeyse gereklidir).
    1. Aşağıdaki komutları yazarak aşağıdaki koddaki dosya yollarını, dönüştürülecek RTF makalelerinin konumu ve düz metin dosyalarının yazılacağı konum ile değiştirerek config.py başlıklı dosyayı düzenleyiniz. Dosyayı kaydedin.
      rtf_file_dir = './articles_rtf/'
      converted_file_dir = './articles_converted/'
    2. Bir terminalde, aynı dizinde, aşağıdaki komutu çalıştırarak RTF dosyalarının düz metin sürümlerini oluşturmak için kodu yürütün:
      python3 ./convert_rtf.py
  2. Vektör veritabanını oluşturun ve kaydedin.
    1. Aşağıdaki değişkenin değerini, LLM'nin artırılacağı belgeleri içeren klasörün dosya yolu ile değiştirerek config.py dosyasını düzenleyin; Dosyayı kaydedin.
      article_dir = './makaleler/'
    2. Bir terminalde, aynı dizinde, veritabanını oluşturmak ve kalıcı hale getirmek için aşağıdaki komutla kodu yürütün. Veritabanının artık vector_db klasörüne kaydedildiğini doğrulayın.
      python3 ./build_index.py

3. Bölüm 2'de oluşturulan vektör veritabanı ile bir Lama modelinin büyütülmesi

  1. Özel LLM'yi Yerel Olarak Örnekleyin (isteğe bağlı)
    NOT: Bu adımın gerçekleştirilmesi yalnızca varsayılan Llama-2-7B'den farklı bir model kullanmak istiyorsanız gereklidir. Varsayılan modeli kullanmak istiyorsanız, adım 3.2'ye geçin.
    1. (Özel bir LLM kullanarak) Aşağıdaki kod satırlarında None yerine llm parametresi olarak yapıcıda bir lama indeksi LLM nesnesini düzenleyerek ve run_augmented_llm.py düzenleyerek ve ileterek artırılacak bir LLM belirtin.
      augmentedLLM = AugmentedLLM(vector_store, llm=Yok)
  2. Sorgu artırılmış LLM
    1. Terminalde aşağıdaki komutu çalıştırın:
      python3 ./run_augmented_llm.py
    2. El yazmaları kümesindeki verilerle zenginleştirilmiş bir yanıt almak için kullanıcı sorguları çalıştırın (Şekil 3 ve Şekil 4). İşiniz bittiğinde çıkmak için CTRL + C tuşlarına basın.

4. Alternatif LLM'lerin programatik karşılaştırması

  1. MCQ'lar oluşturun.
    1. Örneklerin formatını not alarak dosyayı questions.py düzenleyin. Benzer bir biçime uygun sorular ekleyin. Dosyayı kaydedin.
  2. API aracılığıyla GPT-3.5, GPT-4, OpenChat veya diğer karşılaştırıcı modellere bağlanın.
    1. Amaç her iki sağlayıcının modelleriyle kıyaslama yapmaksa, OpenAI veya Huggingface için API anahtarını ekleyerek config.py dosyasını düzenleyin. Dosyayı kaydedin.
      huggingface_key = ''
      openai_key = ''
    2. compare_llms.py dosyasını düzenleyin ve karşılaştırılacak modellerin açıklamasını kaldırarak (bu satırın dilendiği '# ' karakterlerini silerek) test edilecek model kümesini seçin.
      NOT: Bazı karşılaştırıcılar, adım 4.2.1'de ayarlandığı gibi bir API anahtarı gerektirir. Ek olarak, istenirse LLM çıktısının saklandığı yeri değiştirmek için output_dir parametresini düzenleyin; aksi takdirde, bir varsayılan kullanılacaktır.
      output_dir = './llm_responses/'
    3. Bir terminalde, kodu aşağıdaki komutla yürütün. Yürütmeden sonra, not verme veya başka bir inceleme için adım 4.2.2'de belirtilen klasördeki model yanıtlarını görüntüleyin.
      python3 ./compare_llms.py
  3. (İsteğe bağlı) MCQ yanıtlarının otomatik olarak derecelendirilmesiyle denemeler yapın. Örnek kod, LLM çıktısını beklenen bir biçime kısıtlamak için LMQL kitaplığını kullanır.
    1. Dosyayı automated_comparison.py açın ve adım 4.2.2'ye benzer şekilde, dahil edilecek modellerin açıklamasını kaldırın, output_dir değişkenini düzenleyin veya başka bir şekilde özelleştirin. Model çıktısının yine de benzer şekilde kaydedileceğini unutmayın. Dosyayı kaydedin.
    2. Bir terminalde aşağıdaki komutu çalıştırarak adım 4.3.1'deki kodu çalıştırın:
      python3 ./automated_comparison.py

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Chicago Konsensüs Çalışma Grubu yönetim yönergelerinden 22 yayından oluşan bir set, temel Llama-7b model17'yi artırmak için kullanıldı. Belgeler, Llama-2-7b-CCWG-Embed oluşturmak için Llama-Index aracı kullanılarak bir vektör indeksine dönüştürüldü. GPT-3.5 ve GPT-4 gibi popüler OpenAI modelleri de GPT-XX-CCWG-Embed modelleri üretmek için benzer şekilde artırıldı. Çeşitli peritoneal yüzey malignitelerinin yönetimi ile ilgili bilgileri değerlendirmek için toplam 20 çoktan seçmeli soru (MCQ) geliştirilmiştir. MCQ'lar, bir cerrahi onkoloji uzmanından beklenen bilgi düzeyinde test etmek için kurul onaylı bir cerrahi onkolog tarafından oluşturulmuştur. Llama-2-7b-CCWG-Embed, artırılmış OpenAI modellerinde olduğu gibi temel modelden önemli ölçüde daha iyi performans gösterdi (bkz. Tablo 1). Bu, bu yöntem için olumlu bir sonuç olarak kabul edilir, çünkü model performansı taban çizgisine kıyasla büyütme ile iyileştirilmiştir.

figure-results-1
Şekil 1: Akademik makalelerden vektör veritabanı oluşturma şeması. Bu rakamın daha büyük bir sürümünü görüntülemek için lütfen buraya tıklayın.

figure-results-2
Şekil 2: Artırılmış LLM için genel sistem şeması. Bu rakamın daha büyük bir sürümünü görüntülemek için lütfen buraya tıklayın.

figure-results-3
Şekil 3: Linux terminalinde çalışan artırılmış Llama-2 modeli. Bu rakamın daha büyük bir sürümünü görüntülemek için lütfen buraya tıklayın.

figure-results-4
Şekil 4: Artırılmış Llama-2 modelinden sorgu sonucu. Bu rakamın daha büyük bir sürümünü görüntülemek için lütfen buraya tıklayın.

LLMPuan (% doğru)
lama-2-7b-sohbet-hf65%
Lama-2-7b-CCWG-Gömme75%
Açık sohbet-3.5-01061865%
Mistral-7B-v0.11970%
GPT-3.5 (İngilizce)75%
GPT-3.5-CCWG-Yerleştirme85%
GPT-4 (İngilizce)85%
GPT-4-CCWG-Yerleştirme90%

Tablo 1: Peritoneal malignite yönetimi ile ilgili 20 sorudan oluşan bir sette çeşitli LLM'lerin puanları (yüzde doğru).

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Burada sağlanan yöntemler, de novo eğitime veya kapsamlı ince ayara ihtiyaç duymadan LLM'lerin alana özgü uygulamalarının araştırılmasını kolaylaştırmayı amaçlamaktadır. LLM'ler önemli bir araştırma ilgi alanı haline geldikçe, bilgi tabanlarını artırmaya ve yanıtların doğruluğunu artırmaya yönelik yaklaşımlar giderek daha önemli hale gelecektir 18,19,20,21. Sağlanan sonuçlarda gösterildiği gibi, özetlenen protokol, büyütme olmadan aynı LLM'ye kıyasla alana özgü sorularda performansta iyileşme sunar ve OpenAI GPT modelleri gibi daha karmaşık modellerin performansına yaklaşır. LLM'ler yanıtlar oluşturmak için muazzam hesaplama kaynakları gerektirebileceğinden22,23, daha basit bir modelin artırılması, kaynak kısıtlı kullanım durumlarında uygulama için bir yol sağlayabilir. Ayrıca RAG sistemi, OpenAI tarafından sağlananlar gibi yüksek karmaşıklıktaki modelleri artırırken de faydalar sağladı. Sunulan sonuçlar periton kanseri yönetimine özgü olmakla birlikte, hem alan hem de ölçek veri kaynaklarının çeşitliliğine sahip REG sistemleri üzerinde son çalışmalar üretilmiştir ve bu da bu tür sistemlerin geniş uygulanabilirliğini göstermektedir 21,24,25,26. Bununla birlikte, yanıtların kalitesi, artırma için kullanılan metin verileriyle yakından ilişkili olduğundan, kullanıcıların kendi etki alanları ve arzu ettikleri uygulama için hangi kaynakların en uygun olduğunu dikkatlice düşünmeleri çok önemlidir. Bu düşünce, LLM ile ilgili çalışmaların özel bir odak noktası olan sağlık hizmetleri gibi alanlarda özellikle önemlidir. Teşhis27,28 için LLM kullanımı, klinik araştırma eşleştirme29,30 ve çok sayıda başka uygulama araştırılmaktadır ve bilinmeyen eğitim külliyatına güvenmek yerine doğrulanmış, güvenilir metin kaynakları gerektirmektedir.

Performans, periton kanserleri ve klinik yönetimleri konusunda bir uzman tarafından yazılan MCQ'ların doğru yüzdesi ile ölçüldü. Yanıtlar, insan incelemesine göre doğru veya yanlış olarak sınıflandırıldı; bununla birlikte, araştırmacılar için tekrarlayan görevleri en aza indirmek için, LLM'ler arasında daha otomatik performans karşılaştırmasına yaklaşmaya başlamak için temel kod sağlanır.

Bu protokolün önemli bir avantajı, çeşitli LLM'lere programlı olarak erişmek için sağlanan koddur. Önceden, MCQ'ların performansını değerlendirmek için gerekli teknik yeteneklere sahip olmayan kullanıcılar, web tabanlı bir arayüz aracılığıyla tekrarlayan manuel testlere güvenebilirdi. Sağlanan kod, kodun nasıl yürütüleceğine ilişkin örneklerle birlikte birkaç popüler LLM ile arayüz oluşturmak için temel sınıflar sağlar. Bu araçları sağlamanın amacı, daha fazla araştırmacının çeşitli LLM'lerde bir istemde bir istemde verilen yanıtları değerlendiren iş akışlarını otomatikleştirmeye doğru ilerlemesine izin vermek ve karşılaştırmalı çalışmalar yürütme becerisini geliştirmektir.

Ayrıca, özetlenen yöntemler esnekliği ve genişletilebilirliği vurgulamak için tasarlanmıştır. Kod olduğu gibi kullanılabilse de, farklı LLM'lerin kullanımı ve büyütme veya karşılaştırma için modellerin gömülmesi gibi belirli kullanım durumlarına göre daha fazla uyarlama amacıyla yazılmıştır. LLM ortamı hızla geliştikçe, bu genişletilebilirlik, farklı alanlardaki kullanıcıların çeşitli ihtiyaçlarını karşılamak için giderek daha önemli hale gelecektir. Ek olarak, Llama-Index kitaplığı, gösterilen yöntemlerde kullanılmayan ve kullanıcılara benzer sistemler oluştururken ek seçenekler sunabilen önemli sayıda özellik sağlar. Bunlar Llama-Index resmi belgelerinde bulunabilir.

Okuyucular ayrıca kullanım durumları için en uygun değerlendirme yöntemlerini de dikkatlice düşünmelidir. MCQ'lar, kolayca ölçülebilir doğaları nedeniyle LLM karşılaştırmaları için popülerlik kazanmış olsa da31,32, bunları üretken sistemler için kapsamlı bir performans ölçütü olarak kabul ederken dikkatli olunmalıdır. Son literatür, nitel yaklaşımlar, insan incelemesi, Stanford Dil Modellerinin Bütünsel Değerlendirmesi (HELM)33 ve İki Dilli Değerlendirme Yedeği (BLEU), Genel Dil Anlama Değerlendirmesi (GLUE), ROUGE, şaşkınlık ve F1 puanı 34,35,36,37,38,39 gibi standart doğal dil işleme metrikleri dahil olmak üzere çok çeşitli değerlendirmeler uygulamıştır.

Burada sağlanan bu yöntemlerde sınırlamalar vardır. Örneğin, bu alanın hızla gelişen doğası ve çeşitli kullanım durumlarının ne kadar çeşitli olabileceği göz önüne alındığında, önde gelen birkaç LLM sağlayıcısı için arayüzler uygulanmış olsa da, bu uygulama kapsamlı olmayabilir. Ancak kod, daha önce tartışıldığı gibi bu akılda tutularak tasarlanmıştır. Ek olarak, otomatik not vermeye geçiş için temel kod sağlanmış olsa da, yanıtları derecelendirmek için HELM veya BLEU gibi alternatif araçların kullanımına yönelik genişleme için yer vardır. Ayrıca, Dil modeli sorgu dili (LMQL) gibi önceden tanımlanmış dilbilgisine göre çıktıyı kısıtlamak için ek araçların kullanımı, bu çalışmayı genişletmek ve karşılaştırmalı LLM çalışmalarının otomasyonunu artırmak için kullanılabilir. Ek olarak, çok çeşitli potansiyel kullanım durumları göz önüne alındığında, herhangi bir performans ödünleşimini karakterize etmek için RAG sistemlerinin genel, alan dışı performans üzerindeki etkisine ilişkin daha fazla çalışma yapılması gerekmektedir. Son olarak, LLM yanıtlarının güvenilirliğini ve değerlendirilmesini geliştirmek için ek yöntemler araştırılmaya devam edilmelidir.

Teknik nedenlerden dolayı python 3.10 veya daha yenisinin gerekli olduğunu unutmayın. Kabuk istemleri bash, zsh veya diğer UNIX benzeri terminaller için yazılır. Komutlar yürütülebilir (protokolde 'komutu çalıştırma' olarak adlandırılır) sadece metni ve ardından return tuşunu yazarak yürütülebilir. Protokoldeki her adım için, bir kullanıcı, iş akışının arkasındaki mekaniği daha kapsamlı bir şekilde anlamak için yürütülmekte olan dosyadaki kodu incelemek isteyebilir.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Yazarların beyan edebilecekleri herhangi bir çıkar çatışması yoktur.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Bu çalışma, başta lama-index (https://www.llamaindex.ai/), ChromaDB (https://www.trychroma.com/) ve LMQL (https://lmql.ai/) olmak üzere çeşitli açık kaynaklı kütüphaneler tarafından kolaylaştırılmıştır.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
pip3 sürüm 22.0.2 
Python sürüm 3.10.12

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Singhal, K., et al. Large language models encode clinical knowledge. Nature. 620 (7972), 172-180 (2023).
  2. Gilson, A., et al. How does ChatGPT perform on the United States medical licensing examination? The implications of large language models for medical education and knowledge assessment. JMIR Med Educ. 9 (1), e45312(2023).
  3. Guerra, G. A., et al. GPT-4 artificial intelligence model outperforms ChatGPT, medical students, and neurosurgery residents on neurosurgery written board-like questions. World Neurosurg. 179, e160-e165 (2023).
  4. Terwiesch, C. Would Chat GPT3 get a Wharton MBA? A prediction based on its performance in the Operations Management course. , https://mackinstitute.wharton.upenn.edu/wp-content/uploads/2023/01/Christian-Terwiesch-Chat-GTP.pdf (2023).
  5. Weizenbaum, J. ELIZA-a computer program for the study of natural language communication between man and machine. Communications of the ACM. 9 (1), 36-45 (1966).
  6. Wu, T., et al. A brief overview of ChatGPT: The history, status quo and potential future development. IEEE/CAA Journal of Automatica Sinica. 10 (5), 1122-1136 (2023).
  7. Touvron, H., et al. Llama 2: Open foundation and fine-tuned chat models. arXiv [cs.CL]. , http://arxiv.org/abs/2307.09288 (2023).
  8. Huang, L., et al. A survey on hallucination in large language models: Principles, taxonomy, challenges, and open questions. arXiv [cs.CL]. , http://arxiv.org/abs/2311.05232 (2023).
  9. Thirunavukarasu, A. J., et al. Large language models in medicine. Nature Med. 29 (8), 1930-1940 (2023).
  10. Lewis, P., et al. Retrieval-augmented generation for knowledge-intensive NLP tasks. arXiv [cs.CL]. , http://arxiv.org/abs/2005.11401 (2020).
  11. Li, J., Yuan, Y., Zhang, Z. Enhancing LLM factual accuracy with RAG to counter hallucinations: A case study on domain-specific queries in private knowledge-bases. arXiv [cs.CL]. , http://arxiv.org/abs/2403.10446 (2024).
  12. Zhang, P., Xiao, S., Liu, Z., Dou, Z., Nie, J. -Y. Retrieve anything to augment large language models. arXiv [cs.IR]. , http://arxiv.org/abs/2310.07554 (2023).
  13. Ling, C., et al. Domain specialization as the key to make large language models disruptive: A comprehensive survey. arXiv [cs.CL]. , http://arxiv.org/abs/2305.18703 (2023).
  14. Ram, O., et al. In-Context retrieval-augmented language models. Trans Assoc Comput Linguist. 11, 1316-1331 (2023).
  15. Cormode, G. Sequence distance embeddings. , The University of Warwick. https://wrap.warwick.ac.uk/61310/7/WRAP_THESIS_Cormode_2003.pdf (2003).
  16. Guo, Z., et al. Evaluating large language models: A comprehensive survey. arXiv [cs.CL]. , http://arxiv.org/abs/2310.19736 (2023).
  17. Chicago Consensus Working Group. The Chicago Consensus Guidelines for peritoneal surface malignancies: Introduction. Cancer. 126 (11), 2510-2512 (2020).
  18. Wang, G., et al. OpenChat: Advancing open-source language models with mixed-quality data. arXiv [cs.CL]. , http://arxiv.org/abs/2309.11235 (2023).
  19. Jiang, A. Q., et al. Mistral 7B. arXiv [cs.CL]. , http://arxiv.org/abs/2310.06825 (2023).
  20. Megahed, F. M., et al. AI and the future of work in statistical quality control: Insights from a first attempt to augmenting ChatGPT with an SQC knowledge base (ChatSQC). arXiv [cs.HC]. , http://arxiv.org/abs/2308.13550 (2023).
  21. Wang, Y., Ma, X., Chen, W. Augmenting black-box LLMs with medical textbooks for clinical question answering. arXiv [cs.CL]. , http://arxiv.org/abs/2309.02233 (2023).
  22. Dodge, J., et al. Measuring the carbon intensity of AI in cloud instances. FACCT 2022. , (2022).
  23. Samsi, S., et al. From words to watts: Benchmarking the energy costs of large language model inference. arXiv [cs.CL]. , http://arxiv.org/abs/2310.03003 (2023).
  24. Khene, Z. -E., Bigot, P., Mathieu, R., Rouprêt, M., Bensalah, K. Development of a personalized chat model based on the European association of urology oncology guidelines: Harnessing the power of generative artificial intelligence in clinical practice. Eur Urol Oncol. 7 (1), 160-162 (2024).
  25. Kresevic, S., et al. Optimization of hepatological clinical guidelines interpretation by large language models: a retrieval augmented generation-based framework. NPJ Digit Med. 7 (1), 102(2024).
  26. Ge, J., et al. Development of a liver disease-specific large language model chat interface using retrieval augmented generation. medRxiv. , (2023).
  27. Rule-augmented artificial intelligence-empowered systems for medical diagnosis using large language models. Panagoulias, D. P., et al. 2023 IEEE 35th International Conference on Tools with Artificial Intelligence (ICTAI), , 70-77 (2023).
  28. Panagoulias, D. P., et al. Augmenting large language models with rules for enhanced domain-specific interactions: The case of medical diagnosis. Electronics. 13 (2), 320(2024).
  29. Jin, Q., et al. Matching patients to clinical trials with large language models. arXiv [cs.CL]. , http://arxiv.org/abs/2307.15051 (2023).
  30. Gupta, S. K., et al. PRISM: Patient records interpretation for semantic clinical trial matching using large language models. arXiv [cs.CL]. , http://arxiv.org/abs/2404.15549 (2024).
  31. Hendrycks, D., et al. Measuring massive multitask language understanding. arXiv [cs.CY]. , http://arxiv.org/abs/2009.03300 (2020).
  32. Lin, S., Hilton, J., Evans, O. TruthfulQA: Measuring how models mimic human falsehoods. arXiv [cs.CL]. , http://arxiv.org/abs/2109.07958 (2021).
  33. Bommasani, R., Liang, P., Lee, T. Holistic evaluation of language models. Ann N Y Acad Sci. 1525 (1), 140-146 (2023).
  34. Banerjee, D., Singh, P., Avadhanam, A., Srivastava, S. Benchmarking LLM powered Chatbots: Methods and Metrics. arXiv [cs.CL]. , http://arxiv.org/abs/2308.04624 (2023).
  35. Papineni, K., Roukos, S., Ward, T., Zhu, W. -J. Bleu. Proceedings of the 40th Annual Meeting on Association for Computational Linguistics - ACL '02. , (2001).
  36. Wang, A., Singh, A., Michael, J., Hill, F., Levy, O., Bowman, S. R. Glue: A multi-task benchmark and analysis platform for natural language understanding. , http://arxiv.org/abs/1804.07461 (2019).
  37. Johnson, D., et al. Assessing the accuracy and reliability of AI-generated medical responses: An evaluation of the chat-GPT model. Res Sq. , (2023).
  38. Lin, C. -Y. ROUGE: A package for automatic evaluation of summaries. Text Summarization Branches Out. , 74-81 (2004).
  39. Chen, S., et al. Evaluating the ChatGPT family of models for biomedical reasoning and classification. J Am Med Inform Assoc. 31 (4), 940-948 (2024).

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Large Language ModelsVector EmbeddingsDomain Specific AugmentationLlama IndexScientific ManuscriptsModel BenchmarkingOpen Source ToolsVector DatabaseModel EvaluationFoundation Models

Related Articles