Artykuł metodologiczny

Zastosowanie chemininformatyki do opracowania bazy danych metod analitycznych z możliwością przeszukiwania struktury

2.1K wyświetleń

DOI:

10.3791/68194

6 czerwca 2025

W tym artykule

Podsumowanie

W tym artykule opisano AMOS, internetową bazę danych Analytical Methods and Open Spectra, aplikację cheminoinformatyczną zaprojektowaną w celu zapewnienia naukowcom łatwego dostępu do metod analitycznych i danych spektralnych.

Streszczenie

Metody analityczne mogą obejmować zarówno szczegółowe dokumenty regulacyjne, jak i prostsze podsumowania. Metody regulacyjne mogą obejmować informacje o podatnych analitach, obsługiwanych matrycach, wymaganych odczynnikach, wydajności statystycznej, walidacji międzylaboratoryjnej i innych szczegółach. Podsumowania zazwyczaj zawierają ogólny przegląd odczynników, oprzyrządowania, a często także krótką listę analitów. Metody analityczne stosowane przez organy rządowe Stanów Zjednoczonych, w tym Agencję Ochrony Środowiska Stanów Zjednoczonych (USEPA), U.S. Geological Survey (USGS), Departament Rolnictwa Stanów Zjednoczonych (USDA), Agencję ds. Żywności i Leków (FDA) i inne, oferują szczegółowe informacje proceduralne. Dostawcy urządzeń, tacy jak Agilent, Shimadzu, Thermo Fisher Scientific, Sciex i inni, zapewniają również dostęp do setek not aplikacyjnych, które można uznać za metody podsumowujące. W ramach tego badania opracowano bazę danych metod, w której substancje chemiczne są ekstrahowane z dokumentów dotyczących metod, z identyfikatorami (nazwami i/lub numerami rejestru Chemical Abstracts Service (CASRN)) przypisanymi do struktur chemicznych. Powstała w ten sposób baza danych, zawierająca około 7000 metod, jest przeszukiwana według identyfikatora, struktury chemicznej i podobieństwa strukturalnego, a uzupełnia ją około miliona widm z domeny publicznej (LC/MS, GC/MS, NMR i IR). Aplikacja obsługuje wyszukiwanie metod analitycznych i filtrowanie na podstawie analitów, użycia funkcjonalnego, źródeł metod i innych powiązanych metadanych.

Wprowadzenie

Przykładem internetowego dostarczania danych chemicznych do społeczności są aplikacje takie jak PubChem1, ChemSpider2 i CompTox Chemicals Dashboard (CCD)3. Podjęto wysiłki w celu rozpowszechniania szczegółowych informacji na temat metod analitycznych publikowanych w artykułach w czasopismach, publikowanych przez dostawców przyrządów jako techniczne noty aplikacyjne, dostarczanych przez agencje rządowe jako standardowe procedury operacyjne lub metody regulacyjne oraz wydawanych przez organizacje normalizacyjne, takie jak Międzynarodowa Organizacja Normalizacyjna (ISO). Dziesiątki tysięcy substancji chemicznych zostało przebadanych przez te źródła w szerokim zakresie warunków i technik analitycznych. Ten obszerny zbiór źródeł obejmuje różne substancje i obejmuje scenariusze, począwszy od kwantyfikacji pojedynczej substancji chemicznej w określonej matrycy (np. krwi), poprzez mieszaniny pestycydów i ich pozostałości w określonych uprawach, aż po setki substancji chemicznych zidentyfikowanych w wodzie pitnej. Chociaż wiele metod analitycznych można znaleźć za pośrednictwem publicznych wyszukiwarek, nie wszystkie są dostępne bezpłatnie lub w otwartym dostępie.

Znalezienie konkretnych interesujących informacji może być trudne. Wyszukiwarki ogólnego przeznaczenia nie są zoptymalizowane pod kątem danych chemicznych, a ich algorytmy rankingowe mogą przesłaniać wysokiej jakości treści przeznaczone dla wąskiego grona odbiorców. Przeszukiwanie stron internetowych czasopism może przynieść bardziej ukierunkowane wyniki, ale dostęp do nich jest często ograniczony, a publicznie dostępne są tylko streszczenia, co utrudnia ocenę przydatności metody. Ponadto parametry krytyczne, takie jak matryce próbek, granice wykrywalności i oznaczanie ilościowe, często nie są przechowywane w ustrukturyzowanym formacie. Innym istotnym wyzwaniem jest zmienność i niespójność identyfikatorów chemicznych, nazw i synonimów związanych z pojedynczą substancją chemiczną. Brak ustrukturyzowanych metod i danych ogranicza rozwój narzędzi programowych, które mogłyby wykorzystać zgromadzoną przez dziesięciolecia wiedzę z zakresu chemii analitycznej i powiązane publikacje.

W wyniku tych wyzwań i ograniczeń istnieje zapotrzebowanie na wyselekcjonowaną, zorientowaną na chemię aplikację do harmonizacji i poszukiwania metod analitycznych - taką, która nie została zidentyfikowana nigdzie indziej. Aby wypełnić tę lukę, amerykańska Agencja Ochrony Środowiska opracowała AMOS, bazę danych Analytical Methods and Open Spectra oraz aplikację internetową. AMOS gromadzi obecnie i porządkuje trzy rodzaje rekordów danych: metody analityczne, różne widma analityczne oraz szeroką kategorię dokumentów uzupełniających określanych zbiorczo jako arkusze informacyjne. Każdy rekord jest powiązany z docelowymi analitami i odczynnikami chemicznymi metody. Dane można przeszukiwać na wiele sposobów, w tym według zapytań tekstowych, struktury chemicznej oraz podobieństwa strukturalnego lub spektralnego.

Aplikacja AMOS skupia się przede wszystkim na dostarczaniu otwartego dostępu i otwartych rekordów danych. Tam, gdzie to możliwe, rekordy w bazie danych są hiperłącza do ich oryginalnych źródeł. Rekordy, które nie są objęte licencją otwartą, a zatem nie są przechowywane bezpośrednio w bazie danych, mogą być nadal integrowane i dostępne za pośrednictwem adresu URL, pod warunkiem, że są dostępne w inny sposób. Dotyczy to dwóch typów rekordów: metod analitycznych, które znajdują się za zaporami płatnymi, zazwyczaj z czasopism lub organizacji normalizacyjnych, do których EPA ma dostęp, oraz widm, które są dostępne, ale wymagają dostępu do logowania.

Źródła danych różnią się pod względem struktury rekordów, co wymaga znacznego wysiłku w zakresie ekstrakcji i selekcji w celu zebrania i zharmonizowania zawartości. Większość rekordów zawiera identyfikatory substancji (np. CASRN, DTXSID, InChIKey, nazwy zwyczajowe), a w wielu przypadkach ekstrakcja jest prosta. Jednak dopasowanie tych identyfikatorów do struktur chemicznych i szczegółów substancji może być skomplikowane. Niektóre identyfikatory mogą być bezpośrednio dopasowane do wpisów w bazie danych EPA dotyczącej rozproszonej toksyczności możliwej do przeszukiwania (DSSTox)4; W przypadku gdy nie zostaną znalezione dopasowania, identyfikatory są łączone z istniejącymi substancjami lub rejestrowane są nowe substancje. Inicjatywa AMOS doprowadziła w konsekwencji do rozszerzenia bazy danych DSSTox, poprawiając podstawowe dane wspierające inne bazy danych i aplikacje EPA, takie jak CompTox Chemicals Dashboard3.

W przypadku niektórych cennych informacji dodatkowych wymagane jest ręczne sprawdzanie. W przypadku metod analitycznych parametry eksperymentalne, takie jak granice wykrywalności i oznaczania ilościowego, matryca próbki i metodologia analityczna, nie są zorganizowane w ustandaryzowany sposób, a zautomatyzowane narzędzia nie mogą zidentyfikować tych informacji ze względu na ich niespójne przechowywanie.

Dwa elementy zapisu informacji, media związane z próbką i funkcjonalne zastosowanie analitu, są bardzo istotne dla bieżących wysiłków na rzecz monitorowania zagrożeń i obaw związanych z narażeniem na zanieczyszczenia. W związku z tym wiele uwagi poświęcono uporządkowaniu tych atrybutów w ramach danych rekordowych. Na potrzeby tego projektu opracowano ontologię klasyfikacji użytkowania funkcjonalnego. Ontologia ta organizuje funkcjonalne zastosowania substancji w strukturę hierarchiczną, począwszy od bardziej ogólnych zastosowań "rodzicielskich" do bardziej szczegółowych zastosowań "podrzędnych". Ontologia ułatwia eksplorację substancji z perspektywy zastosowań, wspierając inicjatywy badawcze, które kładą nacisk na zastosowania funkcjonalne jako sposób oceny narażenia i zagrożenia 5,6. Ponadto metody zostały oznaczone zgodnie z kategorią zharmonizowanych pożywek dla ich próbek, zgodnie z bazą danych monitorowania multimediów EPA (MMDB)7. Kategoryzacja ta umożliwia wyszukiwanie substancji chemicznych na podstawie ich występowania w określonych podłożach, usprawniając opracowywanie rozwiązań skoncentrowanych na wykrywaniu substancji chemicznych w określonych próbkach środowiskowych lub biologicznych. Adnotacje te zwiększają integrację AMOS z przepływami pracy zorientowanymi na narażenie i zagrożenia, które są opracowywane w ramach EPA.

Podczas tworzenia widm wyzwanie polegające na przetwarzaniu różnych formatów plików - z których niektóre są tylko nominalnie ustandaryzowane - i analizowaniu towarzyszących metadanych często wymaga niestandardowej obsługi. W przypadkach, gdy kolekcje widmowe są połączone z publikacją, może być konieczne ręczne wyodrębnienie szczegółów udokumentowanych w publikacji w celu załadowania danych. Wysiłki te zaowocowały stworzeniem bazy danych, która integruje i strukturyzuje te rozbieżne widma, co pozwala naukowcom uniknąć konieczności pracochłonnego kuratorowania w przyszłych przedsięwzięciach.

Według stanu na marzec 2025 roku, baza danych zawiera około 935 000 widm, z czego prawie 99% to widma masowe i mniejsze zbiory NMR (~2 000) i IR (~400). Dodatkowo istnieje około 770 000 zewnętrznie połączonych widm (połączonych z bazą danych SpectraBase8), ~36 000 arkuszy informacyjnych i ~7 400 metod analitycznych. Substancje zintegrowane z aplikacją są podzbiorem substancji z bazy danych DSSTox, która jest włączona do CompTox Chemicals Dashboard (CCD) i zawiera ponad 1,2 miliona substancji.

Protokół

Większość funkcjonalności systemu AMOS można podzielić na trzy kategorie: wyszukiwanie rekordów dla określonych substancji, wyszukiwanie konkretnych zbiorów substancji lub wyszukiwanie w obrębie kategorii rekordów. Dostęp do poszczególnych stron poświęconych tym funkcjonalnościom jest możliwy za pośrednictwem paska nawigacyjnego znajdującego się u góry każdej strony. Aplikacja jest obecnie dostępna pod adresem https://hcd.rtpnc.epa.gov/#/ poprzez moduł AMOS. Narzędzia programistyczne wykorzystane w niniejszym badaniu wymieniono w Tabela materiałów.

1. Wyszukiwanie rekordów dla konkretnych substancji

  1. Wyszukiwanie ogólne: Przeprowadź wyszukiwanie ogólne, aby uzyskać listę wszystkich typów rekordów powiązanych z pojedynczą substancją (patrz Rysunek 1).
    1. W polu tekstowym w lewym górnym rogu paska nawigacji lub w polu wyszukiwania na stronie głównej wprowadź nazwę substancji, numer CASRN, InChIKey lub identyfikator substancji DSSTox (DTXSID). Naciśnij Enter lub kliknij Search, aby wykonać wyszukiwanie.
      UWAGA: Pasek wyszukiwania na stronie głównej posiada dodatkową opcję wyszukiwania według podciągu znaków; więcej informacji znajduje się w sekcji dotyczącej wyszukiwania według częściowego identyfikatora (krok 2.2).
    2. Jeśli wyszukiwany identyfikator zostanie rozpoznany i odpowiada jednej substancji, po lewej stronie strony zostaną wyświetlone podstawowe informacje o substancji oraz tabela zawierająca wszystkie rekordy powiązane z tą substancją. Wybierz wiersz w tej tabeli, aby wyświetlić powiązany rekord po prawej stronie strony, jeśli jest on przechowywany bezpośrednio w bazie danych.
    3. Jeśli wyszukiwany identyfikator odpowiada wielu substancjom – np. jest to skrót używany dla więcej niż jednej substancji – pojawi się monit o jednoznaczne określenie wyboru, umożliwiający użytkownikowi wskazanie substancji, którą chce zobaczyć. Wybierz substancję z tej listy, a zostaniesz przekierowany do widoku rozpoznanej substancji.
    4. Aby przefiltrować tabelę wyników, kliknij karty znajdujące się bezpośrednio nad tabelą, aby filtrować według typu rekordu (spowoduje to również ukrycie lub wyświetlenie różnych kolumn), wprowadź tekst w polach na górze tabeli, aby filtrować według innych aspektów danych, oraz zaznacz pola wyboru nad kartami, aby filtrować według szerszych właściwości danych.
  2. Wyszukiwanie wsadowe: Przeprowadź wyszukiwanie wsadowe, aby wygenerować i pobrać plik arkusza kalkulacyjnego zawierający informacje o wszystkich rekordach w bazie danych powiązanych z daną listą substancji (patrz Rysunek 2).
    1. W polu danych wejściowych wprowadź listę identyfikatorów DTXSID do wyszukiwania, jeden w każdej linii. Jeśli identyfikatory DTXSID nie są dostępne, użyj łącza na stronie, aby przejść do narzędzia CCD, które może dostarczyć numery DTXSID na podstawie innych identyfikatorów.
    2. Użyj pól wyboru w sekcji Search Options, aby odfiltrować wyniki lub dodać dodatkowe informacje do rekordów. Opcje są podzielone na pięć kategorii: filtrowanie według typów rekordów, filtrowanie według metodologii analitycznych, dodawanie dodatkowych informacji na poziomie substancji do pliku z wynikami, dodawanie dodatkowych informacji na poziomie rekordu (obecnie dostępne tylko dla widm masowych) oraz kilka opcji różnorodnych.
      UWAGA: Opcje z przerywanym podkreśleniem posiadają tekst wyjaśniający daną opcję bardziej szczegółowo. Najedź kursorem na etykietę opcji, aby go zobaczyć.
    3. Kliknij Search na dole strony, aby wykonać wyszukiwanie.
      UWAGA: Wynikowy arkusz kalkulacyjny zawiera listę powiązań substancja-rekord wraz z identyfikatorami substancji, łączami do źródeł oraz innymi podstawowymi informacjami. Jeśli w jednym rekordzie pojawia się wiele wyszukiwanych substancji, rekord ten zostanie wyświetlony raz dla każdej z nich.
  3. Wyszukiwanie podobieństwa strukturalnego: Przeprowadź to wyszukiwanie, aby uzyskać listy metod i kart informacyjnych w bazie danych, które zawierają albo wyszukiwaną substancję, albo substancję o wystarczająco wysokim współczynniku podobieństwa strukturalnego Tanimoto (patrz Rysunek 3).
    UWAGA: To wyszukiwanie może być przydatne w przypadkach, gdy interesująca substancja nie pojawia się w żadnych metodach, ale metody z substancjami bardzo podobnymi mogłyby potencjalnie służyć jako punkt odniesienia.
    1. Wprowadź DTXSID, InChIKey, CASRN lub nazwę substancji w polu wyszukiwania i kliknij Search lub naciśnij Enter. Wyszukiwanie może potrwać od 20 do 30 s.
    2. Po zakończeniu wyszukiwania poniżej pojawi się tabela z kartami. Wybierz kartę, aby przejrzeć wyniki wyszukiwania.
      1. Dwie pierwsze karty zawierają listę znalezionych metod i kart informacyjnych. Wybierz jedną z nich, aby wyświetlić ten dokument po prawej stronie strony. Metody lub karty informacyjne zawierające wyszukiwaną substancję są wyróżnione pogrubioną czcionką.
      2. Trzecia karta zawiera listę podobnych substancji, które znaleziono w metodach lub kartach informacyjnych. Wybierz wiersz w tabeli, aby wyświetlić porównanie między substancją wyszukiwaną a substancją wybraną z tabeli. Jeśli sama wyszukiwana substancja została znaleziona w jakichkolwiek dokumentach, zostanie ona wyświetlona pogrubioną czcionką.
      3. Użyj selektora Filter minimum substance similarity na górze, aby ukryć wyniki wyszukiwania, w których substancje znajdują się poniżej wybranego progu podobieństwa.

Analiza cholesterolu; spektrometria mas; wykres widma; tabela danych; stosunek m/z; identyfikacja chemiczna; CASRN.
Rycina 1: Wyniki wyszukiwania rekordów zawierających cholesterol. Ogólne wyszukiwanie frazy „cholesterol” wyświetla listę pasujących rekordów w tabeli (po lewej). Po prawej stronie przedstawiono widmo mas dla wybranego rekordu. Aby wyświetlić powiększoną wersję tej ryciny, kliknij tutaj.

Interfejs wyszukiwania wsadowego dla substancji DTXSID, przedstawiający opcje danych i wybory metodologiczne.
Rycina 2: Interfejs wyszukiwania wsadowego. Pole wyszukiwania zawiera dwie substancje zidentyfikowane za pomocą ich numerów DTXSID. Dla zapytania wybrano domyślne opcje wyszukiwania. Kliknij tutaj, aby wyświetlić większą wersję tej ryciny.

Interfejs bazy danych metod analitycznych; lista metod GC/MS; przewodnik wykrywania metamfetaminy.
Rysunek 3: Wyniki wyszukiwania struktury dla 1P-LSD. W tabeli wymieniono metody zawierające substancje o podobnej strukturze. Wybrana metoda jest wyświetlona po prawej stronie. Brak pogrubionych wpisów w tabeli wskazuje, że 1P-LSD nie występuje w żadnej z wymienionych metod. Prosimy kliknąć tutaj, aby wyświetlić większą wersję tego rysunku.

2. Wyszukiwanie substancji

  1. Wyszukiwanie ClassyFire: Przeprowadź to wyszukiwanie, aby wyświetlić listę wszystkich substancji należących do podanych pierwszych czterech poziomów klasyfikacji ClassyFire9 (patrz Rysunek 4).
    1. Korzystając z czterech pól u góry strony, wybieraj kolejno cztery najwyższe poziomy klasyfikacji. Po wybraniu każdego z trzech pierwszych, użyj przycisku poniżej danego pola, aby pobrać listę klasyfikacji o jeden poziom niżej. W przypadku czwartego poziomu przycisk poniżej uruchomi wyszukiwanie.
      UWAGA: Po zakończeniu wyszukiwania poniższa tabela zostanie wypełniona listą substancji istniejących w ramach tej klasyfikacji. Tabela zawiera powszechne identyfikatory i informacje o substancjach, a także liczbę rekordów istniejących w AMOS.
    2. Użyj przycisków znajdujących się pomiędzy wyborem klasy a tabelą, aby uzyskać dostęp do czterech funkcji:
      1. Kliknij Kopiuj klasyfikację do adresu URL, aby skopiować adres URL do schowka, który po otwarciu w nowej karcie lub oknie przeglądarki automatycznie wypełni poziomy klasyfikacji i uruchomi wyszukiwanie.
      2. Kliknij Resetuj wybór, aby zresetować wybory w polach klasyfikacji. Nie resetuje to tabeli znalezionych substancji.
      3. Kliknij Pobierz tabelę, aby rozpocząć pobieranie pliku arkusza kalkulacyjnego zawierającego wszystkie widoczne pola i rekordy z tabeli, z wyjątkiem obrazów substancji. Jeśli używane są filtry u góry tabeli wyników, pobrane wyniki również zostaną przefiltrowane, ale zawartość filtrów nie zostanie uwzględniona.
      4. Kliknij Wyślij wybrane substancje do wyszukiwania wsadowego, aby otworzyć nową kartę wyszukiwania wsadowego, w której pole do wpisywania DTXSID będzie uprzednio wypełnione substancjami wybranymi z wyników wyszukiwania ClassyFire. Wybór poszczególnych substancji można dokonać za pomocą pola wyboru w każdym wierszu; zaznaczenie lub odznaczenie wszystkich substancji jest możliwe poprzez kliknięcie pola wyboru w nagłówku tabeli. Szczegóły dotyczące wyszukiwania wsadowego znajdują się w kroku 1.2.
  2. Wyszukiwanie według częściowego identyfikatora: Wykonaj tę operację, aby znaleźć wszystkie substancje pasujące do nieunikalnego identyfikatora (patrz Rysunek 5). Obecnie dostępne opcje to podciąg nazwy (obejmujący zarówno nazwę preferowaną przez EPA, jak i powszechne synonimy), pierwszy blok InChIKey, dokładny wzór sumaryczny oraz zakres mas monoizotopowych.
    1. U góry strony wybierz identyfikator i wprowadź informacje w sąsiednim polu lub polach.
    2. Kliknij Szukaj, aby uruchomić wyszukiwanie.
    3. Po zakończeniu wyszukiwania tabela zostanie wypełniona listą substancji pasujących do częściowego identyfikatora oraz informacjami o tym, jak często występują one w bazie danych AMOS i w innej literaturze. Użyj filtrów u góry kolumn tabeli, aby dalej doprecyzować wyniki, oraz pola wyboru Pokaż substancje wieloskładnikowe, aby wyświetlić lub ukryć substancje składające się z wielu związków.
      UWAGA: Jeśli przeprowadzono wyszukiwanie według podciągu nazwy, pojawi się kolumna z listą znalezionych synonimów. Jeśli substancja została znaleziona tylko po synonimach – tzn. jeśli nazwa preferowana nie zawiera podciągu – nazwa preferowana zostanie zapisana kursywą.

Interfejs wyboru klasyfikacji chemicznej; lista substancji fluorków alkilowych; związki organohalogenowe.
Rysunek 4: Wyniki wyszukiwania klasyfikacji w ClassyFire. Wyniki obejmują informacje na poziomie substancji oraz liczbę rekordów dla każdej grupy klasyfikacyjnej. Aby zobaczyć powiększoną wersję tego rysunku, kliknij tutaj.

Interfejs wyszukiwania w bazie danych substancji wyświetlający wyniki dla triazyn wraz ze strukturami chemicznymi, wzorami i identyfikatorami.
Rysunek 5Wyniki wyszukiwania cząstkowego identyfikatora dla „trazyna”. Wyszukiwanie zwraca substancje, których preferowane nazwy lub synonimy zawierają podciąg znaków „trazine”. W dwóch z trzech wyników słowo „trazine” występuje wyłącznie w synonimach, a nie w nazwach preferowanych. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

3. Przeszukiwanie rekordów

  1. Karty informacyjne i listy metod: Strony te zawierają wszystkie karty informacyjne i metody znajdujące się w bazie danych, z różnymi sposobami ich filtrowania (patrz Rysunek 6). Ponieważ funkcjonalność obu stron jest w dużej mierze taka sama, zostały one tutaj pogrupowane.
    UWAGA: Przejście do strony spowoduje załadowanie tabel. Może to zająć chwilę ze względu na liczbę dostępnych rekordów.
    1. Po załadowaniu tabeli należy użyć pól wejściowych na górze każdej kolumny, aby filtrować dane i poszczególne pola. Dokładny zestaw pól różni się w zależności od tabeli, ale większość z nich można wybrać lub filtrować.
    2. Użyj pola Full Table Filter nad tabelą, aby przeszukać wszystkie kolumny pod kątem określonego ciągu znaków.
      UWAGA: Lista metod zawiera dwa pola, które są domyślnie ukryte – autora oraz wydawcę. Pełny filtr tabeli wyszuka rekordy, które mają szukany termin w którymkolwiek z tych pól.
    3. Lista kart informacyjnych umożliwia filtrowanie poszczególnych wyników poprzez wyszukiwanie danej substancji. Wprowadź nazwę substancji, numer CASRN, InChIKey lub DTXSID, a następnie kliknij search , aby przefiltrować tabelę. Kliknij Clear Filter , aby wyczyścić filtr substancji.
      UWAGA: Obie tabele posiadają następujące przyciski: Copy Filters to Clipboard kopiuje do schowka adres URL, który po otwarciu w przeglądarce załaduje listę i automatycznie wypełni pola filtrów w tabeli aktualnymi wartościami; Download Table pobiera listę wszystkich widocznych wyników i filtrów w tabeli; Download Substances pobiera listę wszystkich substancji pojawiających się w (przefiltrowanej) tabeli; Reset Filters czyści wszystkie filtry tabeli, w tym pełny filtr tabeli.
  2. Wyszukiwanie widm masowych: Wykonaj to wyszukiwanie, aby uzyskać listę dopasowań widm masowych z bazy danych na podstawie dostarczonego przez użytkownika widma (patrz Rysunek 7).
    1. Wypełnij lub dostosuj cztery wymagane pola wejściowe: zakres mas dla substancji docelowej w daltonach, z marginesem błędu w daltonach lub częściach na milion (ppm); metodologię, GC/MS lub LC/MS; widmo masowe, podane jako lista par stosunku ładunku do masy i intensywności; oraz szerokość okna masowego dla podobieństwa piku.
    2. Po wypełnieniu tych pól kliknij przycisk Search poniżej nich.
      UWAGA: Po zakończeniu wyszukiwania, jeśli znaleziono jakiekolwiek widma, po prawej stronie strony pojawi się tabela wymieniająca widma pasujące do wybranej metodologii ze wszystkich substancji mieszczących się w zakresie mas, posortowana według podobieństwa entropii między widmem przesłanym przez użytkownika a widmem z bazy danych.
    3. Wybierz wiersz w tabeli, aby wyświetlić wykres pokazujący porównanie widma użytkownika z widmem z bazy danych (odpowiednio na górze i na dole wykresu). Użyj pola Minimum similarity to show , aby ukryć wyniki poniżej określonego podobieństwa entropii.
  3. Wizualizacja klasyfikacji zastosowań funkcjonalnych: Ta strona wizualizuje ontologię zastosowań funkcjonalnych AMOS i zawiera linki do metod oraz kart informacyjnych dla tych klas zastosowań. Klasy są reprezentowane w grafie skierowanym, w którym krawędzie prowadzą od bardziej ogólnych klas nadrzędnych do bardziej szczegółowych klas podrzędnych (patrz Rysunek 8).
    1. Użyj pola wyszukiwania po prawej stronie, aby przeszukać listę klas zastosowań funkcjonalnych. Najedź kursorem na nazwę klasy zastosowania, aby wyróżnić odpowiadający jej węzeł w grafie.
    2. Przeglądając graf bezpośrednio, najedź kursorem na określony węzeł, aby wyświetlić krótki opis tej klasy, a także wyróżnić wszelkie bezpośrednie klasy nadrzędne lub podrzędne dla tego węzła.
    3. Kliknij prawym przyciskiem myszy na nazwę klasy z listy po prawej stronie strony lub na węzeł w grafie, aby otworzyć menu z opcjami dla list metod i kart informacyjnych. Wybierz jedną z nich, a w nowej karcie przeglądarki otworzy się odpowiednia lista, z polem klasy funkcjonalnej przefiltrowanym zgodnie z wybraną klasą funkcjonalną.
  4. Ternarny wykres gleby: Ta strona odtwarza klasyfikację tekstury gleby Departamentu Rolnictwa USA, umożliwiając wyszukiwanie metod AMOS według typu gleby.
    1. Najedź kursorem na obszar wykresu, aby zobaczyć szczegóły dotyczące jego składu.
    2. Kliknij obszar wykresu, aby otworzyć w nowej karcie listę metod z polem matrycy przefiltrowanym według wybranej klasyfikacji gleby.

Tabela metod chemii analitycznej, metodologie LC/MS, analiza wody, filtrowanie bazy danych.
Rysunek 6: Przefiltrowana lista metod analitycznych. Tabela została przefiltrowana według anality i matrycy, wyświetlając jedynie metody związane z PFAS (substancjami per- i polifluoroalkilowymi) w wodzie. Odpowiadająca im lista kart informacyjnych ma bardzo zbliżony układ. Aby zobaczyć powiększoną wersję tego rysunku, kliknij tutaj.

Schemat porównania widm mas LC-MS/MS; układ eksperymentalny dla identyfikacji molekularnej; analiza widmowa.
Rycina 7: Wyniki wyszukiwania podobieństwa widm. Jako dane wejściowe wykorzystano widmo kofeiny z bazy danych AMOS. Podobne widma zostały pogrupowane według substancji, przy maksymalnej wartości podobieństwa wynoszącej 1,0. Lustrzany wykres przedstawia widmo wejściowe (góra) oraz wybrane widmo z bazy danych (dół). Jasnoniebieskie piki są charakterystyczne dla próbki wejściowej, pomarańczowe dla dopasowania z bazy danych, a ciemnoniebieskie są wspólne. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Wykres chemikaliów przemysłowych; diagram sieciowy wizualizujący relacje w klasyfikacji chemicznej.
Rysunek 8: Wizualizacja klasyfikacji zastosowań funkcjonalnych. Struktura hierarchiczna jest przedstawiona z kursorem najechanym na węzeł „industrial chemicals” (obramowany na żółto). Jego klasy pochodne są obramowane na zielono. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

Schemat trójkąta tekstury gleby, proporcje iłu, pyłu i piasku dla analizy klasyfikacji gleb.
Rysunek 9: Wizualizacja trójkątnego wykresu gleby. Wykres przedstawia dane składnikowe dla próbek gleby. Podpowiedź w prawym górnym rogu pokazuje dokładny skład obszaru znajdującego się aktualnie pod kursorem. Aby zobaczyć powiększoną wersję tego rysunku, kliknij tutaj.

Wyniki

Przedstawione powyżej zrzuty ekranu z programu AMOS pokazują typowe wyniki poszczególnych wyszukiwań w aplikacji, w tym zarówno wyszukiwanie interesujących substancji, jak i przeszukiwanie widm, kart informacyjnych oraz metod. Różnorodność sposobów odpytywania bazy danych ma na celu objęcie najbardziej prawdopodobnych i użytecznych rodzajów wyszukiwań w sposób umożliwiający głębszą analizę danych oraz substancji, których one dotyczą.

Aby ułatwić użytkownikowi wyszukiwanie, wiele funkcji jest ze sobą powiązanych w sposób mający na celu wsparcie głębszej analizy dostępnych danych. Jako przykład przepływu pracy: wizualizacja klasyfikacji zastosowań funkcjonalnych odsyła do widoków metod i kart informacyjnych powiązanych z daną klasą funkcjonalną, z których można wyodrębnić listy substancji i wprowadzić je do wyszukiwania wsadowego lub analizować poszczególne dokumenty, a następnie szczegółowo badać pojedyncze substancje w tych dokumentach. Ponieważ wiele substancji opisanych w metodach posiada w bazie danych eksperymentalne widma mas, pozwala to badaczowi na szybkie przejście od kategorii substancji do zestawu metod i widm, które mogą służyć do wykrywania obecności konkretnej substancji (patrz Rysunek 9).

Ponieważ wyniki będą w znacznym stopniu zależeć od tego, czego poszukiwany jest obiekt oraz od tego, które zapytanie lub zapytania zostaną uruchomione, trudno jest zdefiniować reprezentatywne wyniki dla całej aplikacji. W ogólnym ujęciu dokładniejszym opisem „sukcesu” może być analiza z perspektywy doświadczenia użytkownika; w takim przypadku przyjmuje się oczekiwanie, że następujące założenia będą zazwyczaj prawdziwe: metody wyszukiwania i filtrowania (oraz możliwość przełączania się między różnymi wyszukiwaniami i filtrami) skutecznie pozwalają zidentyfikować podzbiory informacji, których potrzebuje użytkownik, a znalezione przez niego wyniki są dokładne i użyteczne. Rysunek 10 przedstawia przykładowy schemat działania demonstrujący funkcjonalności AMOS.

Schemat sieci klasyfikacji zastosowań funkcjonalnych; filtrowanie bazy danych metod; wyniki analiz toksykologicznych.
Rycina 10: Przykład przepływu pracy demonstrujący funkcjonalności AMOS. Przepływ pracy rozpoczyna się od klasyfikacji zastosowań funkcjonalnych (leki przeciwchorobom układu oddechowego), filtruje metody związane z lekami przeciwchorobom układu oddechowego we krwi, analizuje jedną konkretną metodę i identyfikuje widma dla substancji zawartej w tej metodzie. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Dyskusja

Podczas gdy wiele projektów i aplikacji koncentruje się na gromadzeniu i standaryzacji informacji z jednego typu rekordu, takiego jak metody, arkusze informacyjne lub określony rodzaj widm, AMOS jest pierwszym zidentyfikowanym narzędziem, które kompiluje i integruje duże ilości informacji z wielu typów rekordów. Ujednolicenie, harmonizacja i ustrukturyzacja danych z tych różnych źródeł skutkują powstaniem bazy danych, którą można łatwiej włączyć do przepływów pracy wymagających dostępu do metodologii chemii analitycznej. Możliwość przeszukiwania bazy danych na kilka uzupełniających się sposobów umożliwia efektywne wyszukiwanie informacji, które w przeciwnym razie wymagałyby dużego wysiłku ręcznego w wielu witrynach internetowych lub narzędziach.

Przed publicznym udostępnieniem użyteczność AMOS została zademonstrowana poprzez wykorzystanie go przez pracowników EPA do wspierania szerokiego zakresu projektów. EPA jest stale zainteresowana zastosowaniem spektrometrii mas do analizy nieukierunkowanej10,11, a wiele inicjatyw wykorzystało eksperymentalne widma mas w AMOS w celu usprawnienia poszukiwań w dużej bibliotece spektralnej in silico wygenerowanej z chemikaliów DSSTox12,13. W ramach innych projektów wykorzystano wyszukiwanie podobieństw strukturalnych w celu zidentyfikowania punktów wyjścia do opracowania nowych metod, zbadano istniejące metody oceny granic wykrywalności i kwantyfikacji, a także przeanalizowano kolekcje substancji chemicznych powiązanych z metodami oceny zakresu pokrycia przestrzeni chemicznej.

Agregacja potencjalnych danych treningowych w ramach projektu AMOS dodatkowo wspiera rozwój ilościowych modeli dostosowania metod analitycznych14, co jest podstawową potrzebą rozwoju przepływów pracy związanych z analizą nieukierunkowaną (NTA). Działania kuratorskie w ramach AMOS ułatwiają również inicjatywy mające na celu modelowanie, badanie i wizualizację przestrzeni chemicznych związanych z zakresem metodologicznym14.

Chociaż podstawowa funkcjonalność AMOS jest dojrzała, ciągły rozwój opiera się na opiniach użytkowników. Bieżące zadania obejmują włączanie dodatkowych danych, zarządzanie dalszymi metadanymi w celu ulepszonego filtrowania oraz rozszerzanie możliwości wyszukiwania. We współpracy z interesariuszami EPA opracowywane są interfejsy programowania aplikacji (API), które umożliwią dostęp programowy, rozwiązując problemy z przypadkami użycia, w których graficzny interfejs użytkownika (GUI) może być nieefektywny. Strona z informacjami o wersji została zintegrowana z aplikacją w celu śledzenia i komunikowania aktualizacji kodu w czasie.

Nowe rekordy danych i substancje chemiczne są obecnie dodawane co tydzień; Przewiduje się jednak, że po publicznej premierze harmonogram wydawniczego będzie wolniejszy. Chociaż dokłada się znacznych starań w celu zapewnienia dokładności rekordów i powiązanych metadanych, wiele danych pochodzi z publicznych baz danych. W związku z tym pełna weryfikacja każdego rekordu nie jest możliwa, a użytkownicy powinni mieć świadomość, że nie można zagwarantować absolutnej dokładności danych.

Oświadczenia

Niniejszy dokument niekoniecznie reprezentuje poglądy lub politykę Amerykańskiej Agencji Ochrony Środowiska.

Podziękowania

Autorzy dziękują zespołowi kuratorskiemu za całą ich pracę związaną z opieką nad substancjami chemicznymi w bazie danych oraz Joshui Powellowi, Asifowi Rashidowi i Freddiemu Valone za wsparcie techniczne w budowie i wdrożeniu AMOS. Dziękujemy również Charlesowi Lowe'owi za recenzję manuskryptu.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
GitN/Ahttps://git-scm.com/System kontroli wersji typu open source.
Język JavaScriptN/Ahttps://ecma-international.org/publications-and-standards/standards/ecma-262/Język programowania.  Zdefiniowany zgodnie z międzynarodowymi standardami ECMA.
PostgreSQLGlobalna grupa rozwojowa PostgreSQLhttps://postgresql.org/about/licenceSystem zarządzania bazami danych typu open source.
PytonFundacja oprogramowania Pythonhttps://www.python.org/Język programowania typu open source.

Bibliografia

  1. Kim, S., et al. PubChem substance and compound databases. Nucleic Acids Res. 44 (D1), D1202-D1213 (2016).
  2. Pence, H. E., Williams, A. J. ChemSpider: An online chemical information resource. J Chem Educ. 87 (11), 1123-1124 (2010).
  3. Williams, A. J., Grulke, C. M., Edwards, J. The CompTox chemistry dashboard: A community data resource for environmental chemistry. J Cheminform. 9, 61(2017).
  4. Grulke, C. M., Williams, A. J., Thillanadarajah, I., Richard, A. M. EPA's DSSTox database: History of development of a curated chemistry resource supporting computational toxicology research. Comput Toxicol. 12, 100096(2019).
  5. Tickner, J. A., Schifano, J. N., Blake, A., Rudisill, C., Mulvihill, M. J. Advancing safer alternatives through functional substitution. Environ Sci Technol. 49 (2), 742-749 (2015).
  6. Phillips, K. A., Wambaugh, J. F., Grulke, C. M., Dionisio, K. L., Isaacs, K. K. High-throughput screening of chemicals as functional substitutes using structure-based classification models. Green Chem. 19 (4), 1063-1074 (2017).
  7. Isaacs, K. K., et al. A harmonized chemical monitoring database for support of exposure assessments. Sci Data. 9, 314(2022).
  8. SpectraBase. , https://spectrabase.com/ (2025).
  9. Djoumbou Feunang, Y., et al. ClassyFire: Automated chemical classification with a comprehensive, computable taxonomy. J Cheminform. 8, 61(2016).
  10. Ulrich, E. M., et al. EPA's non-targeted analysis collaborative trial (ENTACT): Genesis, design, and initial findings. Anal Bioanal Chem. 411 (4), 853-866 (2019).
  11. Sobus, J. R., et al. Using prepared mixtures of ToxCast chemicals to evaluate non-targeted analysis (NTA) method performance. Anal Bioanal Chem. 411 (4), 835-851 (2019).
  12. Chao, A., et al. In silico MS/MS spectra for identifying unknowns: A critical examination using CFM-ID algorithms and ENTACT mixture samples. Anal Bioanal Chem. 412 (6), 1303-1315 (2020).
  13. McEachran, A. D., et al. Revisiting five years of CASMI contests with EPA identification tools. Metabolites. 10 (6), 260(2020).
  14. Charest, N., et al. Improving predictions of compound amenability for liquid chromatography-mass spectrometry to enhance non-targeted analysis. Anal Bioanal Chem. 416 (10), 2565-2579 (2024).

Przedruki i uprawnienia

Tagi

Baza danych chemoinformatycznychwyszukiwanie struktur chemicznychmapowanie identyfikatorów metodwidma z domeny publicznejwidma LC/MSwidma GC/MSwidma NMRwidma IR