2 января 2011 г.
Визуальный аналитики (VA) представляет собой новый подход анализа данных в интерактивном режиме. В этом видео, мы обсуждаем проблемы перегрузки данных вызванные высокой пропускной биологические эксперименты, и предложить В.А. в качестве решения такой проблемы. Видео показывает анализ внутри и между наборами данных иммунологических использованием В. А. инструмент под названием таблицы.
Облегчение анализа иммунологических данных с помощью методов визуальной аналитики. В то время как возможности сбора и хранения данных стремительно развивались, способности к их обработке и анализу за тот же период продвинулись незначительно. В результате в биомедицинских лабораториях часто накапливаются большие наборы данных, которые не анализируются эффективно или результативно.
В результате эта потенциально ценная и важная информация теряется в бездне систем хранения данных. Визуальная аналитика (ВА) стала новым способом анализа больших сложных наборов данных. Методы ВА основаны на визуализациях, которые позволяют аналитикам использовать свои способности визуального восприятия для выявления таких закономерностей в данных, как общие тенденции или статистические выбросы.
Эти экспресс-визуализации позволяют быстро формулировать гипотезы в процессе изучения данных. Гибкость инструментов визуального анализа (VA) дает аналитику возможность масштабировать изображение, детально изучать конкретные показатели и устанавливать связи между несколькими наборами данных, исследуя их взаимоотношения. Применяя визуальный анализ к интегрированным источникам данных, пользователь может выявить новые и значимые закономерности.
Анализ в парах — это один из подходов к визуальному анализу (VA), при котором эксперт по инструментам VA и технический специалист, также известный как предметный эксперт, работают совместно: предметный эксперт формулирует биологически значимые вопросы о данных, а эксперт по инструментам VA создает визуализации, которые могут помочь выявить закономерности для ответа на эти вопросы или привести к дальнейшему исследованию. Этот процесс может быть итерационным для создания различных визуализаций, обеспечивающих более глубокое понимание данных.
Мы поставили перед собой задачу проверить применимость метода парного визуального анализа (VA) к большому сложному набору биомедицинских данных. В ходе предварительных пилотных экспериментов мы оценили несколько существующих инструментов VA для решения данной проблемы. В качестве наиболее подходящего для текущей задачи инструмента мы выбрали Tableau от компании Tableau Software.
Критерии отбора в этих пилотных экспериментах основывались на субъективных параметрах, таких как удобство использования и общая эргономика, а также на объективных технических характеристиках, включая диапазон методов взаимодействия и возможности визуализации. Здесь представлен набор данных в электронной таблице Microsoft Excel, типичный для лаборатории, работающей в области инфекционных заболеваний. Данный набор содержит идентификаторы субъектов и данные о вариациях в последовательностях генетической ДНК.
В данном случае рассматриваются однонуклеотидные полиморфизмы (SNP) гена NF kappa BIA субъекта, а также наблюдаемая концентрация нескольких биологических молекул — в данном примере цитокинов, вырабатываемых иммунными клетками субъекта после их стимуляции специфическими стимулами. Теперь перейдем к электронной таблице. Чтобы вы могли представить объем этого набора данных: нас интересует, существует ли общая взаимосвязь между генотипом (то есть различными SNP гена NF kappa BIA в данном случае) и наблюдаемым цитокиновым ответом.
После стимуляции мы подключим набор данных к Tableau, убедившись, что импортирована таблица NF kappa BIA. В левой части экрана видно, что Tableau подключен к правильной таблице и автоматически разделил переменные столбцов на то, что в Tableau называется измерениями (dimensions) и мерами (measures). Измерения — это столбцы, которые категоризируют данные, а меры представляют собой количественные значения в этом столбце.
Для данной визуализации мы построим график зависимости наблюдаемой концентрации цитокинового ответа от уровней концентрации стимула. Теперь мы вычислим средние значения уровней концентрации цитокинов. Порядок уровней концентрации указан неверно, но это можно легко и быстро исправить путем пересортировки.
Затем мы можем переключить режим просмотра, чтобы он соответствовал размеру экрана, что упростит визуализацию данных. Поскольку наша цель — изучить способы дифференциации различных генотипов, достаточно перетащить параметр генотипа в раздел выбора цвета. Визуализация автоматически и мгновенно разделяет данные по генотипам.
Теперь мы можем попробовать другие форматы отображения. Например, линейный график может лучше выявить закономерность, которую мы хотим зафиксировать. Очевидно, что существуют и многие другие варианты.
Биологи в данном парном анализе предлагают начать с изучения взаимосвязей продукции одного из цитокиновых маркеров, называемого TNF alpha, после стимуляции реагентом 3M H₂O₂. Для этого нам необходимо отфильтровать измерение маркеров по TNF alpha и измерение стимулов по 3M H₂O₂. Чтобы сделать процесс фильтрации более гибким, мы можем выбрать опцию «показать быстрый фильтр» (show quick filter) для обоих измерений — маркеров и стимулов, убедившись, что выбран список одиночных значений.
Эта визуализация наглядно демонстрирует различие в продукции TNF alpha после стимуляции тремя разными уровнями MO oh two, разделенными по генотипам с помощью различных цветов; мы можем выбрать любую другую комбинацию значений маркера и фильтра стимула, и визуализация изменится соответствующим образом. По аналогии с Excel, мы можем создавать различные визуализации на отдельных вкладках. Для целей презентации также можно создать сводный вид нескольких анализов.
В данном случае мы исследовали выработку TNF Alpha у нескольких субъектов с различными генотипами однонуклеотидных полиморфизмов NF Kappa BIAS. В данной демонстрации мы успешно создали серию информативных визуализаций примерно за 1 минуту 30 секунд, используя подход к парному анализу VA. Аналогичный набор визуализаций обычно требует от биомедицинского исследователя 30 минут работы в Excel.
Предыдущим примером был простой двумерный анализ. Главное преимущество визуального анализа (VA) заключается в возможности одновременной визуализации нескольких измерений. Например, Tableau поддерживает анализ между наборами данных с помощью логического объединения по ключевым значениям.
Здесь представлены две электронные таблицы, размещенные в одной книге. Первый набор данных взят из предыдущего демонстрационного примера, а второй представляет собой набор данных клеток, проанализированных методом проточной цитометрии для определения продукции нескольких цитокинов в одной клетке. В то же время используется показатель, называемый степенью полифункциональности (PFD); вы можете переименовать листы, чтобы их было проще идентифицировать на этапе импорта.
Это позволяет Tableau связать две электронные таблицы. После выбора опции нескольких таблиц можно воспользоваться функцией добавления новой таблицы для объединения двух таблиц. Эта функция добавляет вторую электронную таблицу к первой и использует операторы объединения (join), чтобы скомбинировать наборы данных с помощью идентичных ключей, таких как тип клеток, стадия уровня концентрации, группа стимула и идентификатор субъекта.
Обратите внимание, что размерности разделены по именам электронных таблиц. Это позволяет использовать размерности, которые не входили в логическое утверждение о соединении. Определение полифункциональности, например, представляет собой процент клеток, вырабатывающих более одного цитокина.
Например, клетка, вырабатывающая два цитокина, будет иметь PFD, равное двум, а клетка, вырабатывающая три цитокина, — PFD, равное трем. Здесь мы создаем одно вычисляемое поле, чтобы объединить эти значения в один показатель для использования в визуальном представлении. Теперь можно приступить к построению визуализации.
Сначала мы строим график зависимости уровней концентрации цитокинов от PFDs на протяжении двух периодов и, как в предыдущем примере, вычисляем среднее значение PFDs более двух. Мы также располагаем метки концентрации от низкой к высокой, устанавливая их вручную. Поскольку информация о генотипе доступна только для некоторых объектов в этой группе, нам необходимо отфильтровать строки данных, не содержащие сведений о генотипе.
Как и прежде, мы можем быстро добавить генотип в цветовую метку, что позволит нам также дифференцировать каждый отдельный генотип. Затем мы можем переключить вид так, чтобы он соответствовал размеру экрана, для более удобной визуализации данных. Также мы можем изменить вторую столбчатую диаграмму.
Например, линейный график с результатами этого теста дает наглядное представление о том, как ответы CYT и PFP варьируются в соответствии с паттернами, специфичными для каждого генотипа. Сразу заметно, что SNP NF kappa b с генотипом GG имеет иной паттерн ответа по сравнению с другими генотипами. Мы можем изучить это подробнее, исследовав влияние различных стимулов на данный паттерн.
Обратите внимание, что после добавления LPS в измерении стимула три основных генотипа демонстрируют схожий уровень PFD при всех концентрациях, однако только при стимулах 3M MO oh two генотип GG показывает резкий рост PFD при переходе от низкой к высокой концентрации стимула. Этот результат позволяет нам сформулировать гипотезу для проверки в будущих экспериментах, а именно: тип стимула влияет на PFD. В последних двух демонстрациях мы рассмотрели возможность быстрого создания визуализаций для выявления потенциально значимых закономерностей как внутри одного набора данных, так и между различными наборами данных.
Возможности визуальной аналитики могут быть быстро расширены на большие наборы данных с масштабированием параметров анализа в зависимости от области применения и интеграцией информации из обширных массивов данных. Например, учитывая наличие множества разрозненных хранилищ данных, создаваемых в ходе когортных исследований, визуальная аналитика представляет собой универсальный подход, который потенциально может быть применен в любой области с большим объемом данных различных типов, включая категориальные и числовые наборы данных. Подход на основе визуальной аналитики дает два основных преимущества.
Во-первых, гибкая генерация гипотез. Пользователь может на месте формулировать гипотезы о данных, исходя из текущих результатов, и быстро создавать новые визуализации для проверки этих гипотез, что позволяет сэкономить время. Удобство использования и эффективность инструментов UVA являются их главным преимуществом перед традиционными средствами визуализации информации.
Усилия, которые обычно требуются при построении графиков традиционными методами, могут занять несколько рабочих дней, в то время как на платформе визуального анализа (VA), такой как Tableau, эта задача легко выполняется за два-три часа. Очевидно, что существуют и, вероятно, появятся другие платформы приложений, каждая из которых имеет свои специфические преимущества и недостатки. Дополнительный эффект от применения параллельного анализа определенно увеличивает общее преимущество подхода на основе VA при анализе сложных многомерных данных.
Просмотрите полный транскрипт и получите доступ к тысячам научных видео
В данном видео обсуждаются сложности анализа больших иммунологических наборов данных и предлагается использование визуальной аналитики (ВА) в качестве решения. Методы ВА используют визуализации, чтобы помочь аналитикам выявлять закономерности и тенденции в сложных данных.
Визуальная аналитика (ВА) решает растущую проблему переизбытка иммунологических данных, обеспечивая возможность быстрого интерактивного исследования сложных многомерных наборов данных. Такой подход ускоряет выдвижение и проверку гипотез, сокращая время получения результатов на ранних этапах поиска новых лекарственных средств. Интегрируя экспертные знания в данной области с владением инструментами ВА, биофармацевтические группы могут повысить достоверность валидации мишеней и приоритизировать перспективные соединения с более высокой прогностической значимостью.
Методы VA интегрируются в процесс поиска новых соединений — от ранней валидации мишеней до идентификации соединений-лидеров, обеспечивая плавный переход к доклинической оценке за счет создания визуально интерпретируемых наборов данных, готовых для проверки гипотез.