$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Os dados espectrais de MS/MS foram obtidos a partir de amostras residuais de PTF não identificadas que foram coletadas usando procedimentos que seguiram as diretrizes e regulamentos aprovados pelo conselho institucional, conforme descrito anteriormente 21,29,30.
NOTA: A Figura 1 fornece uma visão geral do fluxo de trabalho completo, que consiste em cinco módulos. Todas as entradas, saídas e ferramentas de software estão resumidas na Tabela Suplementar 1.

Figura 1: Resumo dos módulos de fluxo de trabalho de metaproteômica clínica no Galaxy. O fluxo de trabalho completo de metaproteômica clínica compreende cinco módulos: Geração de Banco de Dados, Descoberta, Verificação, Quantificação e Interpretação de Dados. (A) O grande banco de dados abrangente inclui sequências de proteínas de espécies microbianas que se acredita estarem presentes na amostra, humanos e contaminantes comuns. A ferramenta de software MetaNovo combinou diretamente os dados espectrais de MS/MS com peptídeos e infere proteínas e seu organismo de origem a partir de dados brutos de MS e do grande banco de dados de sequência de proteínas de entrada, criando um banco de dados reduzido33. O banco de dados reduzido da MetaNovo é então mesclado com proteínas humanas e contaminantes para criar o banco de dados para descoberta de peptídeos. (B)Dois algoritmos de identificação de peptídeos, SearchGUI / PeptideShaker e MaxQuant, combinam sequências de peptídeos com espectros de MS / MS e o banco de dados de proteínas chamariz-alvo49. (C)Os peptídeos identificados por SearchGUI/PeptideShaker e MaxQuant são verificados em seguida usando PepQuery2. O PepQuery2 reexamina rigorosamente as sequências de peptídeos microbianos supostamente identificadas e seus espectros MS / MS correspondentes em relação a outras correspondências potenciais com o proteoma do hospedeiro humano e / ou contaminantes, verificando assim correspondências microbianas de alta confiança40,41. Os peptídeos verificados são usados para gerar um banco de dados de sequência de proteínas verificadas que será usado para quantificação de peptídeos e proteínas. (D) O MaxQuant42 pesquisa dados de MS/MS em relação à sequência de proteínas verificada e quantifica peptídeos microbianos e proteínas inferidas junto com proteínas humanas. (E) Unipept45 e MSstatsTMT46 são usados na etapa final para anotar proteínas com taxonomia e informações funcionais (acessos de comissão enzimática), bem como gerar gráficos de vulcão e comparação. Clique aqui para ver uma versão maior desta figura.
1. Marcação TMT e geração de espectros MS/MS
- Para se preparar para a análise de EM, realize a coleta de amostras clínicas de acordo com as diretrizes e regulamentos.
NOTA: Como este protocolo enfatiza o fluxo de trabalho de bioinformática, os procedimentos para coleta de amostras clínicas podem diferir do que foi usado para este manuscrito. Aqui, as proteínas foram digeridas tripticamente em uma mistura de peptídeos, marcadas, fracionadas e analisadas por espectrometria de massa para gerar dados espectrais MS / MS para análise downstream usando a plataforma Galaxy. Instruções detalhadas de processamento de amostras foram descritas anteriormente por Boylan et al.29 e Afiuni-Zadel et al.30.
- Isole proteínas de amostras clínicas e digeri-las em peptídeos usandotripsina 29,30.
- Rotule as proteínas com um reagente Tandem Mass Tag (TMT)-11-plex. Este reagente de marcação ajudará na quantificação de peptídeos e proteínas 31,32.
- Divida as amostras rotuladas aleatoriamente e uniformemente em quatro grupos experimentais baseados em TMT.
- Para cada grupo experimental, inclua uma amostra de referência agrupada rotulada com uma etiqueta TMT exclusiva para servir como referência comum para comparação com cada amostra individual nos quatro grupos experimentais31,32.
- Realize o fracionamento off-line em amostras agrupadas por cromatografia líquida de fase reversa (RPLC) de alto pH 29 , 30 .
- Analisar as frações por cromatografia líquida-tandem MS (LC-MS/MS) através de um espectrómetro de massas híbrido quadrupolo-Orbitrap 29,30. Salve os dados espectrais MS/MS gerados no formato Thermo Raw (thermo.raw).
NOTA: Conforme necessário, os arquivos Thermo Raw são convertidos para o formato genérico Mascot (.mgf) para serem compatíveis com vários softwares. Neste texto, as abreviações "RAW" e "MGF" denotam o formato de arquivo dos conjuntos de dados MS/MS de entrada. Nas figuras, os conjuntos de dados MS/MS são representados pelos mesmos ícones RAW para simplificar.
2. Configuração do módulo
NOTA: As seleções de botão/menu estão em negrito. Arquivos de exemplo, fluxos de trabalho e parâmetros de ferramenta podem ser acessados por meio de tabelas suplementares. Mais informações sobre como usar o Galaxy podem ser encontradas na página de perguntas frequentes do GTN (https://training.galaxyproject.org/training-material/faqs/galaxy/).
- Servidor Galaxy Europe
- Acesse o servidor Galaxy Europe (Galaxy EU; https://usegalaxy.eu/).
- Crie uma conta ou faça login. É necessário um endereço de e-mail válido para criar uma nova conta. Faça login como usuário para usar o Galaxy.
- Preparando uma história de galáxias
- Se um usuário estiver importando entradas de exemplo da Tabela Suplementar 2 , siga as etapas 2.2.1.1-2.2.1.3.
- Abra os históricos de galáxias de exemplo usando os links fornecidos na Tabela Suplementar 2.
- Clique no botão cinza Importar este histórico localizado no canto superior esquerdo do painel (central). Renomeie o histórico e clique em Copiar histórico. Se desejar, adicione seus conjuntos de dados a esse histórico clicando no botão Upload no painel esquerdo e adicione arquivos para upload.
- Clique em Iniciar > Fechar. O(s) arquivo(s) carregado(s) aparecerá(ão) no painel de histórico no lado direito. Aguarde até que a cor do(s) conjunto(s) de dados fique verde antes de usar.
NOTA: Se estiver importando (copiando) um histórico existente, não crie um histórico separado (novo).
- Se um usuário estiver criando um novo histórico e carregando seus dados, siga as etapas 2.2.2.1.-2.2.2.2.
- No painel Histórico (lado direito), clique no ícone + (mais) uma vez para criar um novo histórico chamado "Histórico sem nome". Clique no ícone de lápis ao lado do histórico e clique em Salvar. As mesmas etapas para adicionar conjuntos de dados a um histórico existente (exemplo) se aplicam ao upload de dados.
- No painel mais à esquerda, clique em Carregar e adicione arquivos para upload. Clique em Iniciar > Fechar. O(s) arquivo(s) carregado(s) aparecerá(ão) no novo histórico. Aguarde até que a cor do(s) conjunto(s) de dados fique verde.
- Se um usuário estiver analisando vários arquivos MS/MS simultaneamente, siga as etapas 2.2.3.1.-2.2.3.3.
- Coloque-os em uma coleção de conjuntos de dados para selecioná-los como uma entrada. Clique no ícone de marca de seleção no painel Histórico e selecione (verificar) conjuntos de dados.
- Clique no botão que diz o número de conjuntos de dados selecionados (por exemplo, 4 de 8 selecionados) e, no menu suspenso, clique em Criar lista de conjuntos de dados. Na janela pop-up, digite um nome para a coleção (por exemplo, Dados MGF, Dados RAW). Se desejar, selecione se os conjuntos de dados originais serão ocultados assim que a coleta for feita.
- Clique no botão azul Criar coleção no canto inferior direito do pop-up. Clique no ícone de marca de seleção no painel Histórico para desmarcar os conjuntos de dados.
NOTA: Cada um dos cinco módulos deve ser executado em seu próprio histórico Galaxy (importado ou novo) para melhorar a experiência do usuário. Para evitar redundância, as instruções posteriores do módulo omitirão a configuração e se concentrarão nas etapas do fluxo de trabalho.
- Importando e executando um fluxo de trabalho
NOTA: É altamente recomendável que todos os usuários, seja usando dados de exemplo ou seus dados, usem e/ou adaptem os fluxos de trabalho modulares com parâmetros predefinidos (Tabela Suplementar 2). Ao fazer isso, os usuários podem evitar ter que pesquisar e definir os parâmetros para cada ferramenta. Se desejar, os usuários podem pesquisar ferramentas clicando no botão Ferramentas no painel mais à esquerda e digite o nome da ferramenta (com a maior precisão possível) na barra de pesquisa no painel adjacente. As ferramentas de correspondência aparecerão automaticamente. Clique no resultado correto da pesquisa e defina os parâmetros apropriados (consulte Arquivo Suplementar 1). Antes de executar uma ferramenta, os usuários podem configurar notificações por e-mail para alertá-los quando um trabalho for concluído, selecionando o botão próximo ao final dos parâmetros. Por conveniência, existem dois Correr Botões: um no canto superior direito do painel central e o outro após os campos de parâmetro. Tabela Suplementar 3 fornece recursos de treinamento adicionais. As versões e bancos de dados da ferramenta estão atualizados e operacionais no momento da redação (junho de 2024), mas podem mudar à medida que o Galaxy e as ferramentas e bancos de dados associados são atualizados.
- Abra o fluxo de trabalho em uma nova guia usando os links na Tabela Suplementar 2.
- Clique no botão Importar no canto superior direito do painel. Uma nova guia será aberta com uma caixa verde que confirma que o fluxo de trabalho foi importado. A caixa verde também incluirá duas opções: começar a usar esse fluxo de trabalho imediatamente ou retornar à página anterior.
- Clique no primeiro botão ("começar a usar este fluxo de trabalho...") para abrir a guia Fluxo de trabalho no painel central da interface, que exibe todos os fluxos de trabalho armazenados. Encontre o fluxo de trabalho que acabou de ser importado e clique no botão azul de reprodução (triângulo). Isso exibirá os campos de entrada.
NOTA: Para cada fluxo de trabalho fornecido, os campos de entrada correspondem às entradas de exemplo (Tabela Suplementar 2). Se um usuário estiver analisando seus dados, suas entradas deverão ser nomeadas de acordo para garantir que os arquivos corretos sejam usados para cada módulo.
- Se um usuário quiser visualizar fluxos de trabalho no servidor Galaxy EU, siga as etapas 2.3.2.1-2.3.2.4.
- Clique no botão Fluxo de trabalho na barra superior do site do Galaxy. Nessa guia, clique na subguia Meus fluxos de trabalho para exibir todos os fluxos de trabalho importados. Para exibir um fluxo de trabalho, clique no botão Editar que tem um ícone de lápis para abrir o Editor de fluxo de trabalho.
- No Editor de fluxo de trabalho, interaja com o fluxo de trabalho, como clicar e arrastar para reorganizar, clicar nas ferramentas para visualizá-las, alterar parâmetros, etc. Depois de fazer as alterações, salve o fluxo de trabalho editado clicando no ícone de disco na parte superior do painel direito e, se desejar, execute o fluxo de trabalho clicando no ícone de reprodução (também na parte superior do painel direito).
- Crie fluxos de trabalho específicos do usuário para analisar dados de entrada personalizados. Dependendo do conhecimento do usuário sobre metaproteômica e da experiência com a plataforma Galaxy, crie um fluxo de trabalho e analise os dados.
- Se um usuário for menos experiente, teste várias ferramentas no histórico e extraia um fluxo de trabalho de sua análise concluída.
NOTA: Este fluxo de trabalho extraído pode ser expandido, revisado e reutilizado, permitindo que os usuários reproduzam seu trabalho com precisão. Instruções mais detalhadas podem ser encontradas na seção GTN FAQs para fluxos de trabalho (https://training.galaxyproject.org/training-material/faqs/galaxy/#workflows).
- Clique em cada campo de entrada e selecione a entrada apropriada. As seções 3 a 7 descrevem as entradas do módulo. Verifique se todas as entradas estão em um formato aceito para evitar erros. Clique em formatos aceitos em cada campo de entrada para verificar se todos os arquivos são compatíveis com as ferramentas. Uma vez feito isso, clique em Executar fluxo de trabalho.
NOTA: Se um usuário preferir configurar as ferramentas manualmente, o material tutorial para cada módulo deste fluxo de trabalho de metaproteômica clínica é fornecido no site do GTN (https://gxy.io/GTN:P00019). Os tempos de execução estimados para as principais ferramentas foram incluídos na Tabela Suplementar 2, mas os tempos de execução dependem do tamanho dos dados de entrada, dependências da ferramenta (como requisitos de memória em comparação com a memória alocada), tempos de manutenção programados, erros etc. Os status do trabalho são indicados pela cor do conjunto de dados e, quando o conjunto de dados é selecionado (clicado), será exibida uma mensagem informando se um trabalho está aguardando para ser enfileirado (cinza), em execução (laranja) ou com falha (vermelho). Quando um trabalho for concluído, o conjunto de dados ficará verde (sem mensagem de confirmação). Os usuários podem optar por receber notificações por e-mail para alertá-los quando os trabalhos forem concluídos (consulte a OBSERVAÇÃO no início da etapa 2.3). As instruções do módulo abaixo omitirão etapas de configuração explícitas, pois são as mesmas para cada módulo (consulte a seção 2 e as perguntas frequentes do GTN, se necessário) e descreverão as principais ferramentas para cada módulo. Consulte a Tabela Suplementar 1 para obter uma lista completa das ferramentas usadas. Os nomes das ferramentas foram colocados em negrito. Para referência, todos os nomes, versões e descrições de ferramentas estão incluídos na Tabela de Materiais. Se um usuário estiver executando os fluxos de trabalho de exemplo da Tabela Suplementar 2, consulte os nomes de arquivo de exemplo incluídos entre parênteses no final de cada etapa. Se um usuário estiver executando as ferramentas de forma independente, os nomes de arquivo de exemplo poderão ser desconsiderados. Para renomear um conjunto de dados, clique no ícone de lápis no canto superior direito do conjunto de dados. No campo "Nome", digite o novo nome e clique em Salvar.
3. Módulo 1: Geração de banco de dados de sequências de proteínas
NOTA: Se um usuário quiser usar as entradas de exemplo e o fluxo de trabalho da Tabela Suplementar 2, certifique-se de seguir as instruções na seção 2. Para o Módulo 1, importe a entrada e o fluxo de trabalho para DATABASE GENERATION. A coluna de saída da Tabela Suplementar 2 inclui exemplos de históricos de saída concluídos para referência. Para todos os módulos, o tutorial GTN correspondente pode ser encontrado na Tabela Suplementar 3.
- Compilar uma lista de espécies que estão ligadas à doença ou condição de interesse e/ou ao local de coleta da amostra.
- Obtenha esta lista de espécies a partir de uma revisão da literatura. Alternativamente, se as amostras foram analisadas anteriormente, obtenha a lista de espécies a partir do rRNA 16S ou sequenciamento metagenômico.
- Salve esta lista de espécies como um arquivo tabular (por exemplo, Species.tabular).
NOTA: Usando a lista de espécies, um grande banco de dados abrangente de sequências de proteínas de microrganismos causadores de doenças conhecidas será gerado e, usando o MetaNovo, esse grande banco de dados, que contém milhões de sequências de proteínas, será reduzido a um banco de dados mais gerenciável que contém proteínas presentes nas amostras. A etapa de redução do banco de dados é crucial, pois muitas ferramentas de pesquisa de banco de dados não podem lidar com milhões de sequências. O banco de dados reduzido será mesclado com proteínas humanas e contaminantes para gerar um banco de dados compacto para gerar um banco de dados compacto, que será usado para identificação de peptídeos no próximo módulo (seção 4).
- Use a lista de espécies (Species.tabular) como entrada para UniProt (baixe o proteoma como fasta) para gerar um banco de dados de sequências de proteínas (Species UniProt FASTA.fasta).
- Execute o Protein Database Downloader para gerar mais dois bancos de dados de sequências de proteínas: Human SwissProt (somente revisado) e proteínas contaminantes (Human SwissProt Protein Database.fasta, Contaminants [cRAP] Protein Database.fasta). As proteínas contaminantes também são denominadas como Repositório Comum de Proteínas Adventícias, ou cRAP.
- Use os três bancos de dados de proteínas como entradas para arquivos de mesclagem FASTA e filtre sequências exclusivas para excluir duplicatas e gerar um grande banco de dados de sequências de proteínas (Human UniProt Microbial Proteins cRAP para MetaNovo.fasta).
- Use o banco de dados grande (abrangente) (da etapa 3.4) e os conjuntos de dados MS (MGF) como entrada para o MetaNovo33 para gerar um banco de dados reduzido (MetaNovo Compact Database.fasta).
- Execute arquivos de mesclagem FASTA e filtre sequências exclusivas no banco de dados gerado pela MetaNovo, no Human SwissProt (somente revisado) e nos bancos de dados cRAP para gerar um banco de dados reduzido (alvo) de sequências de proteínas microbianas, humanas e contaminantes que serão usadas para detectar peptídeos (Proteínas Microbianas UniProt Humanas [da MetaNovo] e cRAP.fasta).
4. Módulo 2: Descoberta de peptídeos por meio de pesquisa em banco de dados
NOTA: Se um usuário quiser usar as entradas de exemplo e o fluxo de trabalho da Tabela Suplementar 2, certifique-se de seguir as instruções na Seção 2. Para o Módulo 2, importe a entrada e o fluxo de trabalho para DISCOVERY. Para todos os módulos, o tutorial GTN correspondente pode ser encontrado na Tabela Suplementar 3. O SearchGUI 34,35,36 e o PeptideShaker 37 são softwares separados, mas serão considerados como um programa de identificação e processamento de peptídeos, pois são usados em conjunto. Para compatibilidade de software, os conjuntos de dados MS/MS serão convertidos de RAW para MGF para SearchGUI/PeptideShaker usando a ferramenta msconvert (no fluxo de trabalho fornecido). O MaxQuant38 pode processar arquivos RAW.
- Execute o FastaCLI para adicionar sequências de proteínas iscas ao banco de dados reduzido (alvo) para gerar um banco de dados de sequências de proteínas chamariz (FastaCLI MetaNovo Human SwissProt cRAP com decoys.fasta).
NOTA: O FastCLI só precisará ser executado para SearchGUI/PeptideShaker. O MaxQuant pode adicionar iscas e contaminantes a um banco de dados de sequências de proteínas. Aqui, o banco de dados reduzido já contém contaminantes (cRAP), então o MaxQuant foi configurado para adicionar apenas iscas.
- Execute o SearchGUI/PeptideShaker e o MaxQuant para pesquisar os conjuntos de dados MS no banco de dados reduzido para identificar peptídeos e, eventualmente, atribuí-los a sequências de proteínas por meio da pesquisa no banco de dados de sequências. Consulte a Tabela Suplementar 4 para obter os parâmetros da ferramenta.
NOTA: Dois programas de identificação de peptídeos serão usados aqui (SearchGUI/PeptideShaker e MaxQuant) para identificar sequências de peptídeos e proteínas por meio de pesquisa de banco de dados de sequências. Esses programas identificam peptídeos nos espectros MS/MS e pesquisam um banco de dados de sequências de proteínas, combinando dados de peptídeos observados e teóricos, incluindo massas e espectros de peptídeos. No módulo seguinte, os peptídeos identificados serão verificados usando PepQuery2 para validar se os peptídeos microbianos foram obtidos (seção 5).
- Execute o SearchGUI para gerar um arquivo morto que contenha PSMs (GUI de pesquisa em dados [#].searchgui_archive).
- Use o arquivo SearchGUI como entrada para o PeptideShaker para gerar um relatório PSM, um relatório de peptídeos e um relatório de proteínas (Peptide Shaker nos dados [#]: [nome do relatório].tabular).
- Execute o MaxQuant para gerar arquivos de grupos de proteínas e peptídeos (MaxQuant Protein Groups.tabular, MaxQuant Peptides.tabular).
NOTA: MaxQuant requer um arquivo de design experimental, que contém condições experimentais, grupos de amostra e relações entre amostras (Experimental Design Discovery MaxQuant.tabular). Este arquivo informa ao MaxQuant como organizar e analisar os dados do MS. Um exemplo foi fornecido na Tabela Suplementar 5. Se estiver usando os dados do usuário, os usuários devem modificar esse arquivo para corresponder aos seus conjuntos de dados MS.
- Use ferramentas de manipulação de texto para gerenciar as saídas de ambos os programas. Veja o fluxo de trabalho DISCOVERY na Tabela Suplementar 2 para ver quais ferramentas são aplicáveis ao SearchGUI/PeptideShaker e MaxQuant.
NOTA: As seguintes ferramentas de manipulação de texto são implementadas no Galaxy. As principais ferramentas são destacadas abaixo, portanto, é altamente recomendável que os usuários consultem o DISCOVERY Workflow para ver ferramentas adicionais que não são abordadas aqui. Consulte a seção 2 para obter instruções sobre como visualizar um fluxo de trabalho.
- Selecione correspondências microbianas (selecione PSMs microbianos.tabular de SGPS, selecione peptídeos microbianos (MQ).tabular).
- Use a Tabela de Filtro e Consulta39 para selecionar PSMs confiantes e consultar seus números de acesso de proteína (Filtrar PSMs microbianos confiantes.tabular, resultados de consulta em dados [# e #].tabular).
- Use Cortar para extrair sequências de peptídeos como um novo conjunto de dados (Cortar nos dados [#].tabular).
- Use Group para obter entradas exclusivas (por exemplo, sequências de peptídeos exclusivas) para cada programa (MQ Peptides.tabular, SGPS Distinct Peptides.tabular).
- Concatene as duas listas de peptídeos em um único conjunto de dados (SGPS-MQ Peptides.tabular).
- Grupo para remover sequências de peptídeos duplicados. A lista final de peptídeos microbianos distintos será usada para verificação PepQuery2 (Distinct Peptides.tabular).
5. Módulo 3: Verificação de peptídeos microbianos
NOTA: Se um usuário quiser usar as entradas de exemplo e o fluxo de trabalho da Tabela Suplementar 2, certifique-se de seguir as instruções na Seção 2. Para o Módulo 2, importe a entrada e o fluxo de trabalho para VERIFICAÇÃO. Para todos os módulos, o tutorial GTN correspondente pode ser encontrado na Tabela Suplementar 3.
- Use o seguinte como entradas para PepQuery240,41 Lista de peptídeos microbianos distintos (Peptídeos distintos para PepQuery.tabular); Conjuntos de dados espectrais MS (MGF); a Referência UniProt Humana (junto com isoformas) (UniProt Humano + Isoformas FASTA.fasta) e bancos de dados de sequência de proteínas cRAP (cRAP.fasta). Consulte os parâmetros na Tabela Suplementar 6.
NOTA: Verificar a presença de peptídeos e proteínas é crucial para obter dados precisos e insights significativos sobre o proteoma de um sistema biológico. O PepQuery2 permite a validação de novos peptídeos de interesse específicos para doenças com sensibilidade e especificidade. Os peptídeos microbianos identificados (do módulo 2) serão pesquisados em sequências de proteínas humanas e contaminantes para verificar se são de origem microbiana (evitar a atribuição incorreta de peptídeos humanos). Os peptídeos verificados serão usados para gerar um banco de dados de sequências de proteínas verificadas, o que é necessário para reduzir a introdução de falsos positivos durante a quantificação de proteínas no módulo seguinte (seção 6).
- Um arquivo de classificação PSM será gerado para cada conjunto de dados MS/MS usado como entrada (PepQuery2 na coleção [#]: psm_rank.tabular). Execute Recolher Coleta nos arquivos de classificação do PSM para criar um conjunto de dados combinado (Recolher Coleta em dados [#] .tabular) e Filtrar para reter PSMs confiáveis (Filtrar em [coleção de classificação do PSM].tabular).
- Execute Remove começando para excluir cabeçalhos de coluna e Cut para extrair as sequências de peptídeos verificadas como um novo conjunto de dados.
- Execute Cut on the Peptide Reports from SearchGUI/PeptideShaker e MaxQuant (SGPS Peptide Report.tabular, MaxQuant Peptide Report.tabular) para extrair as sequências de peptídeos e entradas de proteínas como um novo conjunto de dados peptídeo-proteína (para cada programa) e Remove começando para excluir os cabeçalhos das colunas.
- Concatene as sequências de peptídeos e entradas de proteínas de ambos os programas para criar um novo conjunto de dados peptídeo-proteína (combinado).
- Execute a Consulta Tabular no conjunto de dados peptídico-proteína combinado e nos peptídeos verificados para atribuir os peptídeos verificados às suas entradas de proteína associadas (Peptide e Protein from Peptide Reports.tabular). As entradas de proteínas são catalogadas por seus números de acesso de proteína (também conhecidos como UniProt IDs).
- Grupo para reter peptídeos verificados exclusivos e seus IDs UniProt associados.
- Execute a Consulta Tabular para extrair os IDs UniProt (UniProt-ID de Peptides.tabular verificado).
- Coloque os IDs UniProt no UniProt para obter suas sequências de proteínas associadas como um novo banco de dados (UniProt.fasta).
- Execute arquivos de mesclagem FASTA e filtre sequências exclusivas no banco de dados de sequências de proteínas geradas pelo UniProt, no banco de dados Human UniProt (junto com isoformas) e nos bancos de dados de contaminantes para gerar um banco de dados verificado que será usado para quantificação de peptídeos (Banco de dados de quantificação para MaxQuant.fasta).
6. Módulo 4: Quantificação MaxQuant
NOTA: Se um usuário quiser usar as entradas de exemplo e o fluxo de trabalho da Tabela Suplementar 2, certifique-se de seguir as instruções na Seção 2. Para o Módulo 2, importe a entrada e o fluxo de trabalho para QUANTIFICAÇÃO. Para todos os módulos, o tutorial GTN correspondente pode ser encontrado na Tabela Suplementar 3.
- Use o banco de dados de sequência de proteínas verificada e os conjuntos de dados MS (RAW) como entradas para o MaxQuant42.
NOTA: Lembre-se de que o MaxQuant requer um arquivo de design experimental e pode ser o mesmo arquivo usado para identificação de peptídeos (etapa 4.2). Altere os nomes dos arquivos conforme necessário. O banco de dados verificado do módulo anterior é necessário para reduzir falsos positivos durante a quantificação de proteínas. A quantificação de proteínas permite que os pesquisadores meçam e comparem a abundância de peptídeos e proteínas em amostras biológicas. Esta etapa é imperativa para entender a expressão diferencial de proteínas, obtendo insights sobre mudanças quantitativas em diferentes condições.
- Gere os arquivos de evidências, grupos de proteínas e peptídeos (MaxQuant Evidence.tabular, MaxQuant Protein Groups.tabular, MaxQuant Peptides.tabular).
- Selecione peptídeos microbianos no arquivo MaxQuant Peptides (Selecione peptídeos microbianos.tabular).
- Corte apenas as sequências de peptídeos microbianos (Corte nos dados [#].tabular).
- Grupo para obter uma lista de peptídeos microbianos quantificados (Peptídeos Quantificados.tabular).
7. Módulo 5: Interpretação dos dados
NOTA: Se um usuário quiser usar as entradas de exemplo e o fluxo de trabalho da Tabela Suplementar 2, certifique-se de seguir as instruções na Seção 2. Para o Módulo 2, importe a entrada e o fluxo de trabalho para INTERPRETAÇÃO DE DADOS. Para todos os módulos, o tutorial GTN correspondente pode ser encontrado na Tabela Suplementar 3. As saídas da quantificação do MaxQuant no módulo anterior serão usadas aqui para anotações taxonômicas e funcionais usando Unipept e análise estatística usando MSstatsTMT. O Unipept permite que os pesquisadores identifiquem e quantifiquem microrganismos em diversos ambientes e se integra a bancos de dados públicos (como o UniProt) para recuperar anotações atualizadas. O MSstatsTMT foi projetado para análise estatística robusta de dados proteômicos quantitativos baseados em espectrometria de massa usando a marcação TMT.
- Use a lista de peptídeos microbianos quantificados (Quantified Peptides.tabular) como entrada para Unipept 43,44,45 para realizar anotações taxonômicas e funcionais. Consulte a Tabela Suplementar 7 para obter parâmetros e uma lista de saídas.
- Os resultados de interesse da Unipept aqui são a árvore de taxonomia microbiana e uma árvore de proteínas da comissão de enzimas microbianas (EC) (Tree.d3_hierarchy de Taxonomia Microbiana, Proteínas EC Microbianas Tree.d3_hierarchy).
- Para visualizar as árvores, clique no conjunto de dados para abrir as opções. Clique em Visualizar (4ª opção da esquerda) > Visualizador de Taxonomia Unipept.
- Para visualizar anotações taxonômicas e funcionais em uma tabela (Unipept peptinfo.tabular): clique no ícone de olho no canto superior direito do conjunto de dados. Role para ver cada peptídeo em sua própria linha e informações em diferentes colunas.
- Antes de executar a análise estatística usando o MSstatsTMT, execute Select no arquivo MaxQuant Protein Groups para criar dois novos conjuntos de dados: proteínas microbianas e humanas (Microbial Proteins.tabular, Human Proteins.tabular). As proteínas possuem tags de taxonomia que designam sua origem.
- Exclua proteínas contaminantes com a etiqueta "con_".
- Reter proteínas microbianas e humanas, que são designadas com etiquetas microbianas (por exemplo, "_9LACO") e "_HUMAN", respectivamente (Microbial-Proteins.tabular, Human-Proteins.tabular).
- MSstatsTMT 42,46,47 será usado para realizar a análise estatística. Use o arquivo MaxQuant Evidence (do Módulo 4) e as proteínas microbianas selecionadas (ou proteínas humanas) da etapa anterior como entradas. Esse fluxo de trabalho prioriza as proteínas microbianas, mas também oferece a opção de caracterizar as proteínas humanas. Consulte a Tabela Suplementar 8 para parâmetros e uma lista de saídas.
NOTA: O MSstatsTMT requer um arquivo de anotação e uma matriz de comparação (também conhecida como matriz de contraste). O arquivo de anotação determinará como as quantificações serão combinadas, enquanto a matriz de comparação acomodará diferentes grupos de amostras. Exemplos desses arquivos foram incluídos (Annotation.tabular, Comparison Matrix.tabular) na Tabela Suplementar 9 e na Tabela Suplementar 10.
- Os resultados de interesse do MSstatsTMT aqui são o vulcão e os gráficos de comparação para as proteínas microbianas (Microbial Proteins Volcano Plot.pdf, Microbial Proteins Comparison.pdf). Visualize os gráficos clicando no ícone de olho no canto superior direito do conjunto de dados.