6 december 2024
In dit protocol wordt de responskwaliteit van het grote taalmodel van de stichting verbeterd via uitbreiding met peer-reviewed, domeinspecifieke wetenschappelijke artikelen via een vectorinbeddingsmechanisme. Daarnaast wordt code verstrekt om te helpen bij het vergelijken van prestaties tussen grote taalmodellen.
Ons onderzoek richt zich op een breed scala aan machine learning en grote taalmodeltoepassingen in de kankerzorg. Dit omvat zowel het verbeteren van de directe patiëntenzorg als het aanpakken van operationele uitdagingen zoals planning en documentatie. Uiteindelijk proberen we de vraag te beantwoorden: hoe kunnen deze technologieën de gezondheidszorg beter maken voor patiënten, zorgverleners en onderzoekers?
Grote taalmodellen zijn al begonnen met het transformeren van het onderzoekslandschap. Taken die voorheen onbetaalbaar waren, zijn nu voor veel meer onderzoekers toegankelijk geworden, waardoor veel nieuwe onderzoekslijnen met ongestructureerde gegevens mogelijk zijn. Een grote uitdaging is het snel veranderende landschap van grote taalmodeltools en infrastructuur.
Veel clinici en onderzoekers hebben misschien ideeën voor toepassingen, maar beschikken momenteel niet over de contextuele of technische kennis die nodig is voor implementatie, of over een doordachte afweging van afwegingen van verschillende benaderingen. Installeer om te beginnen Git, python en PIP op de computer en voer de opdrachten uit in een terminal om de installatie te verifiëren. Voer vervolgens de git-kloonopdracht uit om de repository te downloaden en de benodigde vereisten te installeren.
Als u een vectordatabase wilt maken, bewerkt u de configuratie. py bestand, waarbij de waarde van de volgende variabele wordt vervangen door het bestandspad naar de map met de documenten die zullen worden gebruikt om het grote taalmodel uit te breiden. Sla het bijgewerkte bestand vervolgens op in de map met artikelen.
Voer vervolgens in een terminal in dezelfde map de code uit met de Python 3 build index-opdracht om de database te maken en te behouden. Controleer of de database nu is opgeslagen in de vectordatabasemap. Als u een query wilt uitvoeren op de augmented LLM, voert u de Python 3 run augmented llm uit.
py commando in de terminal. Test gebruikersquery's om antwoorden te ontvangen die worden aangevuld met de gegevens uit de documentenset. Druk vervolgens op control plus C om af te sluiten als u klaar bent.
Bewerk de bestandsvragen voor het maken van meerkeuzevragen. PY, let op het formaat van de voorbeelden. Voeg vragen toe met een vergelijkbare indeling en sla het bestand op.
Om de configuratie te bewerken. pi-bestand, voeg de API-sleutel toe voor open AI of knuffelend gezicht. Als het doel is om te benchmarken met modellen van een van beide providers.
Sla nu het bestand op. Bewerk vervolgens de vergelijk llms. py bestand, en kies de set modellen om tegen te testen.
Na het ontkoppelen van commentaar de modellen om mee te vergelijken. Voer ten slotte in een terminal de code uit met de opdracht vergelijk llms en bekijk na uitvoering de modelantwoorden in de opgegeven map voor beoordeling of andere beoordeling. Van de geteste MCQ's presteerde het insluitmodel aanzienlijk beter dan het basismodel, net als de uitgebreide open AI-modellen.
Dit protocol verbetert de kwaliteit van antwoorden van grote taalmodellen door peer-reviewed wetenschappelijke artikelen te integreren via een vector-embeddingmechanisme. Daarnaast wordt er code geleverd voor het vergelijken van de prestaties van verschillende grote taalmodellen.
De integratie van vectorembeddings met grote taalmodellen (LLM's) stelt biopharma R&D-teams in staat om actuele, domeinspecifieke wetenschappelijke literatuur snel in AI-gestuurde workflows op te nemen. Deze aanpak pakt het probleem van statische modelcorpora aan in snel evoluerende biomedische vakgebieden, wat leidt tot meer responsieve en contextbewuste besluitvorming in de ontdekkingsfase. Augmentatie op basis van embeddings verbetert het voorspellende vertrouwen en de operationele wendbaarheid binnen de onderzoeksportefeuille.
Embedding-augmented LLM's passen binnen het continuüm van ontdekking tot prekliniek door dynamische literatuurinterrogatie, benchmarking en kennissynthese mogelijk te maken bij elk omslagpunt.