2 janvier 2011
Visuel Analytics (VA) est une nouvelle approche d'analyse des données de manière interactive. Dans cette vidéo, nous abordons le problème de surcharge de données provoquée par haut-débit les expériences biologiques, et de proposer VA comme une solution à ces problèmes. La vidéo démontre l'analyse au sein et entre les ensembles de données immunologiques utilisant un outil appelé VA Tableau.
Faciliter l'analyse de données immunologiques à l'aide de techniques d'analyse visuelle. Alors que la capacité à collecter et stocker des données a progressé rapidement, la capacité à les traiter et à les analyser, par comparaison, a peu évolué. En conséquence, de grands ensembles de données existent souvent dans les laboratoires biomédicaux sans être analysés de manière efficace ou efficiente.
Avec cela, des informations potentiellement riches et puissantes sont perdues dans l'abîme des systèmes de stockage. L'analyse visuelle, ou VA, s'est imposée comme une nouvelle méthode d'analyse de grands ensembles de données complexes. Les techniques de VA reposent sur des visualisations qui permettent aux analystes d'utiliser leur intelligence visuelle pour repérer des motifs dans les données, tels que des tendances générales ou des valeurs aberrantes.
Ces visualisations rapides permettent une formation rapide d'hypothèses lors de l'exploration des données. La souplesse des outils d'analyse visuelle permet à l'analyste de zoomer, d'approfondir et d'établir des liens entre plusieurs ensembles de données tout en explorant leurs relations. Grâce à l'application de l'analyse visuelle à des sources de données intégrées, l'utilisateur peut révéler des découvertes nouvelles et importantes.
L'analyse par ascendant est une approche de l'analyse visuelle (VA) dans laquelle un expert en outil d'analyse visuelle et un expert technique, également appelé expert du domaine, collaborent de sorte que l'expert du domaine pose des questions biologiquement pertinentes sur les données. L'expert en outil d'analyse visuelle crée alors des visualisations qui peuvent aider à révéler des motifs permettant de répondre à cette question ou d'orienter vers une exploration plus poussée. Ce processus peut être itéré afin de construire différentes visualisations offrant des informations complémentaires.
Nous avons entrepris de tester l'adéquation d'une approche d'analyse apparentée par visualisation analytique (VA) à un vaste jeu de données biomédicales complexes. Dans le cadre d'expériences pilotes préliminaires, nous avons évalué plusieurs outils de visualisation analytique existants pour le problème actuel. Nous avons retenu Tableau, développé par Tableau Software, comme l'outil le plus adapté à la tâche en question.
Les critères de sélection dans ces expériences pilotes étaient fondés sur des paramètres subjectifs tels que la facilité d'utilisation, l'utilisabilité globale, ainsi que sur des caractéristiques techniques objectives telles qu'un éventail de techniques d'interaction et de fonctionnalités de visualisation. Nous disposons ici d'un ensemble de données dans un tableur Microsoft Excel typique d'un laboratoire travaillant dans le domaine des maladies infectieuses. Cet ensemble contient un identifiant de sujet et des données sur la variation des séquences génétiques d'ADN.
Dans ce cas, les polymorphismes de nucléotide unique de NF kappa BIA, ou PNS, du sujet, ainsi que la concentration observée de plusieurs molécules biologiques, ici des cytokines produites par les cellules immunitaires du sujet après stimulation de ces cellules par des stimuli spécifiques. Nous allons maintenant descendre vers le tableau. Pour vous donner une idée de l'ampleur de ce jeu de données, nous souhaitons déterminer s'il existe une relation générale entre le génotype, c'est-à-dire les différents PNS, dans ce cas du gène NF Kappa BIA, et la réponse cytokinique observée.
Après la stimulation, nous allons maintenant connecter le jeu de données à Tableau, en veillant à importer le tableau NF kappa BIA. Vous pouvez voir sur le côté gauche que Tableau est connecté au bon tableau et a automatiquement séparé les variables des colonnes en ce que Tableau appelle des dimensions et des mesures. Les dimensions sont simplement les colonnes qui catégorisent les données, tandis que les mesures correspondent aux valeurs quantitatives de ces colonnes.
Pour cette visualisation, nous allons maintenant tracer les niveaux de concentration du stimulus en fonction de la concentration observée de la réponse en cytokine. Nous calculons maintenant la moyenne des valeurs des niveaux de concentration en cytokine. L'ordre des niveaux de concentration est incorrect, mais il est assez facile de les réorganiser rapidement.
Ensuite, nous pouvons modifier la vue pour l'ajuster à l'écran et faciliter la visualisation des données. Puisque nous souhaitons étudier comment différencier les différents génotypes, il suffit de glisser la dimension « génotype » dans cette section de couleur. La visualisation s'effectue automatiquement et immédiatement selon le génotype.
Maintenant, nous pouvons essayer différents formats d'affichage. Par exemple, un graphique linéaire pourrait mieux révéler un motif que nous souhaitons capturer. Il existe évidemment de nombreuses autres options.
L'analyse croisée réalisée par les biologistes suggère que nous commencions par explorer les relations concernant la production de l'un des marqueurs cytoniques appelé QNF alpha après stimulation avec un réactif nommé 3M oh oh deux. Pour ce faire, nous devons filtrer la dimension marqueur, TNF alpha, et la dimension stimulus, 3M oh oh deux. Afin de rendre le processus de filtrage plus souple, nous pouvons sélectionner l'option afficher le filtre rapide pour les dimensions marqueur et stimulus, en veillant à ce qu'il s'agisse d'une liste à valeurs uniques.
Cette visualisation montre clairement une différence concernant la production de TNF alpha après des niveaux différents de stimulation par trois MO oh deux, séparée par génotype en différentes couleurs. Nous pouvons choisir n'importe quelle autre combinaison de marqueur et de valeurs de filtre de stimulus, et la visualisation changerait en conséquence. De manière similaire à Excel, nous pourrions créer différentes visualisations dans des onglets séparés. À des fins de présentation, nous pouvons également générer une vue synthétique de plusieurs analyses.
Dans ce cas, nous avons étudié la production de TNF Alpha chez plusieurs sujets présentant un génotype différent pour le polymorphisme NF Kappa BIAS. Dans cette démonstration, nous avons réussi à produire une série de visualisations puissantes en environ une minute et trente secondes, en utilisant une approche de VA par analyse appariée. Un ensemble similaire de visualisations nécessite généralement à un chercheur en biomédecine environ 30 minutes pour être généré dans Excel.
Un exemple précédent était une analyse bidimensionnelle simple. La véritable puissance de l'analyse visuelle (VA) réside dans la capacité de visualiser plusieurs dimensions simultanément. Par exemple, Tableau prend en charge l'analyse entre ensembles de données grâce à des jointures logiques de valeurs clés.
Voici deux feuilles de calcul placées dans le même classeur. Le premier jeu de données provient de l'exemple de démonstration précédent, et l'autre est un ensemble de données de cellules analysées par une technique appelée cytométrie en flux, pour la production de plusieurs cytokines dans une même cellule. En même temps, une mesure appelée degré de polyfonctionnalité ou PFD, vous pouvez nommer la feuille afin de faciliter leur identification lors de l'étape d'importation.
Cela permet à Tableau de relier les deux feuilles de calcul. Après avoir choisi l'option de plusieurs tableaux, vous pouvez utiliser la fonction d'ajout d'un nouveau tableau pour joindre les deux tableaux. Cette fonction ajoute la deuxième feuille de calcul à la première et utilise les instructions de jointure pour combiner les ensembles de données à l'aide de clés identiques telles que le type de cellule, le niveau de concentration, l'étape, le stimulus du groupe et l'identifiant du sujet.
Remarquez que les dimensions sont séparées par le nom du tableur. Cela nous permet d'utiliser les dimensions qui ne faisaient pas partie de l'instruction logique combinée. La définition de la polyfonctionnalité, par exemple, correspond au pourcentage de cellules produisant plus d'une cytokine.
Par exemple, une cellule produisant deux cytokines avec une DPF de deux et une cellule produisant trois cytokines avec une DPF de trois. Ici, nous créons un champ calculé afin de combiner ces valeurs en une seule mesure que nous pouvons utiliser dans une représentation visuelle. Nous pouvons maintenant commencer à construire la visualisation.
Tout d'abord, nous traçons la concentration des niveaux de cytokines en fonction des PFD sur deux, et comme dans la dernière démonstration, nous prenons la valeur moyenne des PFD supérieure à deux. Nous organisons également les libellés de concentration du plus faible au plus élevé en les définissant manuellement. Étant donné que les informations sur le génotype ne sont disponibles que pour certains individus de ce groupe, nous devons filtrer les lignes de données qui ne contiennent pas d'informations sur le génotype.
Comme précédemment, nous pouvons rapidement insérer le génotype dans l'étiquette de couleur, ce qui nous permet de distinguer chaque génotype différent également. Ensuite, nous pouvons ajuster l'affichage pour qu'il s'adapte à l'écran et faciliter ainsi la visualisation des données. Nous pouvons également modifier le second graphique en barres.
Par exemple, un graphique linéaire ayant testé cela donne une bonne idée de la manière dont la réponse CYT et la réponse PFP varient selon les profils spécifiques à chaque génotype. On remarque immédiatement que le SNP NF-kappa b avec le génotype GG présente un profil de réponse différent par rapport aux autres génotypes. Nous pouvons approfondir cela en étudiant l'impact de différents stimuli sur ce profil.
Remarquez que, après l'ajout de LPS dans la dimension du stimulus, les trois principaux génotypes affichent un niveau similaire de PFD à toutes les concentrations, mais avec les seuls stimuli 3M MO oh deux, le génotype GG présente une augmentation marquée de la PFD passant d'une faible à une forte concentration de stimulus. Cette observation nous permet de formuler une hypothèse à tester dans de futures expériences, à savoir que le type de stimulus influence la PFD. Dans les deux dernières démonstrations, nous avons vu la génération rapide de visualisations permettant de détecter des motifs potentiellement significatifs à l'intérieur et entre les jeux de données.
La puissance de l'analyse visuelle peut être rapidement étendue à de grands ensembles de données, en augmentant les dimensions de l'analyse selon l'application et en intégrant des informations provenant d'ensembles de données vastes. Par exemple, avec les nombreux silos de données générés dans les études de cohorte, l'analyse visuelle (VA) constitue une approche très transférable qui pourrait potentiellement être appliquée à tout domaine comportant une grande quantité de données de types variés, notamment des ensembles de données catégorielles et numériques. L'approche VA offre deux principaux avantages.
Un, génération flexible d'hypothèses. L'utilisateur peut générer sur-le-champ des hypothèses concernant les données à partir des résultats actuels, et créer rapidement de nouvelles visualisations explorant ces hypothèses, ce qui permet d'économiser du temps. L'ergonomie et l'efficacité des outils UVA constituent leur principal avantage par rapport aux outils traditionnels de visualisation de l'information.
L'effort habituellement requis pour la création de graphiques à l'aide de méthodes traditionnelles peut prendre plusieurs jours ouvrables, alors que la même tâche est facilement accomplie en deux à trois heures sur une plateforme d'analyse visuelle (VA) telle que Tableau. Il est évident qu'il existe, et qu'il existera probablement, d'autres plateformes applicatives, chacune présentant des avantages et des inconvénients spécifiques. Le bénéfice supplémentaire offert par une approche utilisant l'analyse para ajoute clairement à l'avantage global d'une méthode fondée sur l'analyse visuelle pour l'analyse de données complexes multidimensionnelles.
Consultez la transcription complète et accédez à des milliers de vidéos scientifiques
Ce vidéo aborde les défis liés à l'analyse de grands ensembles de données immunologiques et présente l'analyse visuelle (VA) comme une solution. Les techniques d'analyse visuelle s'appuient sur des visualisations afin d'aider les analystes à identifier des motifs et des tendances dans des données complexes.
L'analytique visuelle (VA) répond au défi croissant de la surcharge de données immunologiques en permettant une exploration rapide et interactive de jeux de données complexes et multidimensionnels. Cette approche accélère la génération et la validation d'hypothèses, réduisant ainsi le temps nécessaire pour obtenir des informations exploitables dans les flux de travail de découverte précoce. En intégrant l'expertise métier à une maîtrise des outils d'analytique visuelle, les équipes biopharmaceutiques peuvent renforcer la confiance dans la validation des cibles et hiérarchiser les candidats thérapeutiques offrant une valeur prédictive accrue.
Les méthodes de validation par analyse (VA) s'intègrent dans le continuum de découverte, depuis la validation précoce de cibles jusqu'à l'identification de composés candidats, permettant une transition fluide vers l'évaluation préclinique en générant des jeux de données prêts à être testés et interprétables visuellement.