6 dicembre 2024
In questo protocollo, la qualità della risposta del modello linguistico di base di grandi dimensioni viene migliorata tramite l'aumento con articoli scientifici specifici del dominio sottoposti a revisione paritaria attraverso un meccanismo di incorporamento vettoriale. Inoltre, viene fornito codice per facilitare il confronto delle prestazioni tra modelli linguistici di grandi dimensioni.
La nostra ricerca si concentra su un'ampia varietà di applicazioni di apprendimento automatico e di modelli linguistici di grandi dimensioni nella cura del cancro. Ciò include sia il miglioramento dell'assistenza diretta ai pazienti che la risoluzione di sfide operative come la pianificazione e la documentazione. In definitiva, stiamo cercando di rispondere alla domanda: in che modo queste tecnologie possono migliorare l'assistenza sanitaria per pazienti, fornitori e ricercatori?
I modelli linguistici di grandi dimensioni hanno già iniziato a trasformare il panorama della ricerca. Le attività di elaborazione del linguaggio naturale, precedentemente proibitive, sono diventate accessibili a molti più ricercatori, consentendo molte nuove linee di ricerca che coinvolgono dati non strutturati. Una delle sfide principali è rappresentata dal panorama in rapida evoluzione degli strumenti e delle infrastrutture per i modelli linguistici di grandi dimensioni.
Molti medici e ricercatori possono avere idee per le applicazioni, ma attualmente non hanno le conoscenze contestuali o tecniche necessarie per l'implementazione, o una considerazione ponderata dei compromessi dei diversi approcci. Per iniziare installa Git, python e PIP sul computer ed esegui i comandi in un terminale per verificare l'installazione. Quindi esegui il comando git clone per scaricare il repository e installare i requisiti necessari.
Per creare un database vettoriale, modificare la configurazione. py, sostituendo il valore della variabile seguente con il percorso del file della cartella contenente i documenti che verranno utilizzati per aumentare il modello linguistico di grandi dimensioni. Quindi salva il file aggiornato nella directory degli articoli.
Successivamente, in un terminale nella stessa directory, eseguire il codice con il comando Python 3 build index per creare e rendere persistente il database. Verificare se il database è ora salvato nella cartella del database vettoriale. Per interrogare l'LLM aumentato, eseguire l'esecuzione di Python 3 llm aumentato.
py nel terminale. Testare le query degli utenti per ricevere risposte che vengono aumentate dai dati del set di documenti. Quindi premere il controllo più C per uscire al termine.
Per creare domande a scelta multipla, modifica le domande del file. py, prendendo nota del formato degli esempi. Aggiungi domande seguendo un formato simile e salva il file.
Per modificare la configurazione. pi, aggiungi la chiave API per aprire l'intelligenza artificiale o abbracciare il viso. Se l'obiettivo è quello di confrontare i modelli di entrambi i fornitori.
Ora salva il file. Quindi modifica gli llm di confronto. py e scegliere l'insieme di modelli con cui eseguire il test.
Dopo aver decommentato i modelli con cui confrontare. Infine, in un terminale, esegui il codice con il comando compare llms e dopo l'esecuzione Visualizza le risposte del modello nella cartella specificata per la valutazione o un'altra revisione. Tra gli MCQ testati, il modello embed ha ottenuto risultati significativamente migliori rispetto a quello base, così come i modelli di intelligenza artificiale aperta aumentata.
Questo protocollo migliora la qualità delle risposte dei modelli linguistici di grandi dimensioni integrando articoli scientifici sottoposti a revisione paritaria attraverso un meccanismo di incorporamento vettoriale. Fornisce inoltre codice per il confronto delle prestazioni tra diversi modelli linguistici di grandi dimensioni.
L'integrazione degli embedding vettoriali con modelli linguistici di grandi dimensioni (LLM) consente alla biopharma R&D consente ai team di integrare rapidamente letteratura scientifica aggiornata e specifica per dominio in flussi di lavoro guidati dall'intelligenza artificiale. Questo approccio affronta la sfida rappresentata dai corpora statici dei modelli in ambiti biomedici in rapida evoluzione, favorendo decisioni più reattive e consapevoli del contesto nelle fasi iniziali della scoperta. L'ampliamento basato su embedding migliora la sicurezza predittiva e l'agilità operativa lungo l'intero portafoglio di ricerca.
Gli LLM potenziati da incorporamento si inseriscono nel continuum dalla scoperta alla fase preclinica, consentendo un'interrogazione dinamica della letteratura, un confronto attraverso standard di riferimento e una sintesi delle conoscenze in ogni punto di svolta.