December 6th, 2024
In dit protocol wordt de responskwaliteit van het grote taalmodel van de stichting verbeterd via uitbreiding met peer-reviewed, domeinspecifieke wetenschappelijke artikelen via een vectorinbeddingsmechanisme. Daarnaast wordt code verstrekt om te helpen bij het vergelijken van prestaties tussen grote taalmodellen.
Ons onderzoek richt zich op een breed scala aan machine learning en grote taalmodeltoepassingen in de kankerzorg. Dit omvat zowel het verbeteren van de directe patiëntenzorg als het aanpakken van operationele uitdagingen zoals planning en documentatie. Uiteindelijk proberen we de vraag te beantwoorden: hoe kunnen deze technologieën de gezondheidszorg beter maken voor patiënten, zorgverleners en onderzoekers?
Grote taalmodellen zijn al begonnen met het transformeren van het onderzoekslandschap. Taken die voorheen onbetaalbaar waren, zijn nu voor veel meer onderzoekers toegankelijk geworden, waardoor veel nieuwe onderzoekslijnen met ongestructureerde gegevens mogelijk zijn. Een grote uitdaging is het snel veranderende landschap van grote taalmodeltools en infrastructuur.
Veel clinici en onderzoekers hebben misschien ideeën voor toepassingen, maar beschikken momenteel niet over de contextuele of technische kennis die nodig is voor implementatie, of over een doordachte afweging van afwegingen van verschillende benaderingen. Installeer om te beginnen Git, python en PIP op de computer en voer de opdrachten uit in een terminal om de installatie te verifiëren. Voer vervolgens de git-kloonopdracht uit om de repository te downloaden en de benodigde vereisten te installeren.
Als u een vectordatabase wilt maken, bewerkt u de configuratie. py bestand, waarbij de waarde van de volgende variabele wordt vervangen door het bestandspad naar de map met de documenten die zullen worden gebruikt om het grote taalmodel uit te breiden. Sla het bijgewerkte bestand vervolgens op in de map met artikelen.
Voer vervolgens in een terminal in dezelfde map de code uit met de Python 3 build index-opdracht om de database te maken en te behouden. Controleer of de database nu is opgeslagen in de vectordatabasemap. Als u een query wilt uitvoeren op de augmented LLM, voert u de Python 3 run augmented llm uit.
py commando in de terminal. Test gebruikersquery's om antwoorden te ontvangen die worden aangevuld met de gegevens uit de documentenset. Druk vervolgens op control plus C om af te sluiten als u klaar bent.
Bewerk de bestandsvragen voor het maken van meerkeuzevragen. PY, let op het formaat van de voorbeelden. Voeg vragen toe met een vergelijkbare indeling en sla het bestand op.
Om de configuratie te bewerken. pi-bestand, voeg de API-sleutel toe voor open AI of knuffelend gezicht. Als het doel is om te benchmarken met modellen van een van beide providers.
Sla nu het bestand op. Bewerk vervolgens de vergelijk llms. py bestand, en kies de set modellen om tegen te testen.
Na het ontkoppelen van commentaar de modellen om mee te vergelijken. Voer ten slotte in een terminal de code uit met de opdracht vergelijk llms en bekijk na uitvoering de modelantwoorden in de opgegeven map voor beoordeling of andere beoordeling. Van de geteste MCQ's presteerde het insluitmodel aanzienlijk beter dan het basismodel, net als de uitgebreide open AI-modellen.
Dit protocol verbetert de kwaliteit van antwoorden van grote taalmodellen door middel van het integreren van peer-reviewed wetenschappelijke artikelen via een vector-embedding mechanisme. Het biedt ook code voor prestatie-vergelijking tussen verschillende grote taalmodellen.
Integrating vector embeddings with large language models (LLMs) enables biopharma R&D teams to rapidly incorporate up-to-date, domain-specific scientific literature into AI-driven workflows. This approach addresses the challenge of static model corpora in fast-evolving biomedical fields, supporting more responsive and context-aware discovery-stage decision making. Embedding-based augmentation enhances predictive confidence and operational agility across the research portfolio.
Embedding-augmented LLMs fit within the discovery-to-preclinical continuum by enabling dynamic literature interrogation, benchmarking, and knowledge synthesis at each inflection point.