$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Aqui, descrevemos um método de alta produtividade para a construção e seleção das bibliotecas de domínios da proteína dobrada e solúvel de qualquer fonte de partida genic/genômica. A abordagem combina três tecnologias diferentes: phage display, o uso de um repórter de dobramento e sequenciamento de próxima geração (NGS) com uma ferramenta de web específica para análise de dados. Os métodos podem ser usados em muitos contextos diferentes de pesquisa à base de proteínas, para a identificação e a anotação de novos domínios de proteínas/proteína, a caracterização das propriedades estruturais e funcionais de proteínas conhecidas, bem como a definição de rede de interação de proteínas.
Muitas questões estão ainda presentes na pesquisa baseada em proteína e o desenvolvimento de métodos para a produção de proteína ideal é uma necessidade importante para vários campos de investigação. Por exemplo, apesar da disponibilidade dos milhares de genomas de procariotas e eucariotas1, mapa correspondente do proteomes relativa com uma anotação direta dos peptídeos e proteínas codificadas ainda está faltando para a grande maioria dos organismos. O catálogo de proteomes completa está emergindo como um objetivo desafiador que exige um grande esforço em termos de tempo e recursos. O padrão ouro para anotação experimental permanece a clonagem de todos o Open Frames de leitura (ORFs) de um genoma, construindo o chamado "ORFeome". Geralmente, função do gene é atribuída com base na homologia de genes relacionados de actividade conhecida mas esta abordagem é mal exata devido à presença de muitas anotações incorretas na referência bases de dados2,3,4, 5. Além disso, mesmo para as proteínas que foram identificadas e anotadas, estudos adicionais são necessários para atingir a caracterização em termos de abundância, padrões de expressão em diferentes contextos, incluindo propriedades estruturais e funcionais, bem como redes de interação.
Além disso, uma vez que as proteínas são compostas de diferentes domínios, cada um deles apresentando características específicas e contribuindo de forma diferente para funções de proteína, o estudo e a definição exata destes domínios podem permitir que um quadro mais abrangente, tanto para o single Gene e no nível do genoma completo. Toda esta informação necessária faz pesquisa baseada em proteína um campo amplo e desafiador.
Nesta perspectiva, um importante contributo poderia ser dada por métodos imparciais e alta produtividade para a produção de proteína. No entanto, o sucesso de tais abordagens, ao lado do considerável investimento necessário, conta com a capacidade de produzir construções de proteína solúvel/estável. Esta é uma grande limitação do fator desde que estima-se que apenas cerca de 30% de proteínas pode ser com êxito expressa e produzido em níveis suficientes para ser experimentalmente úteis6,7,8. Uma abordagem para superar essa limitação é baseada na utilização de DNA fragmentado aleatoriamente para produzir diferentes polipeptídeos, que juntos fornecem sobrepostos representação fragmento de genes individuais. Apenas uma pequena percentagem dos fragmentos de DNA gerados aleatoriamente são ORFs funcionais, enquanto a grande maioria deles é não-funcional (devido à presença de códons de parada dentro de suas sequências) ou codifica para un-natural (ORF em uma moldura que não seja o original) polipeptídeos com nenhum significado biológico.
Para resolver todos esses problemas, o nosso grupo desenvolveu uma plataforma de análise com proteína de alta produtividade expressão e interação que pode ser usada em uma escala genômica9,10,11,12. Esta plataforma integra as seguintes técnicas: 1) um método para selecionar conjuntos de domínios da proteína correctamente dobrada da parte codificação do DNA de qualquer organismo; 2) a tecnologia de exibição do fago para selecionar parceiros de interações; 3) o NGS completamente caracterizam a interactome toda sob estudo e identificar os clones de interesse; e 4) uma ferramenta web para análise de dados para usuários sem conhecimento de programação ou bioinformática executar análise Interactome-Seq de forma fácil e amigável.
O uso desta plataforma oferece vantagens importantes sobre estratégias alternativas de investigação; acima de tudo, o método é completamente imparcial, alta produtividade e modular para estudo que variam de um único gene até um genoma inteiro. A primeira etapa do gasoduto é a criação de uma biblioteca de DNA fragmentado aleatoriamente sob estudo, que então profundamente caracteriza-se por NGS. Esta biblioteca é gerada usando um vetor de engenharia onde/fragmentos de genes de interesse são clonados entre uma sequência de sinal para a secreção de proteínas para o espaço periplasmático (ou seja, um líder Sec) e o gene de β-lactamase TEM1. A proteína de fusão irá conferir resistência à ampicilina e a capacidade de sobreviver sob pressão de ampicilina somente se fragmentos clonados são em-frame com esses elementos e a proteína de fusão resultante é corretamente dobrado10,13 ,14. Todos os clones resgataram após seleção de antibióticos, os chamados "clones de filtrado", são ORFs e, a grande maioria deles (mais de 80%), são derivados de genes real9. Além disso, o poder desta estratégia encontra-se nas conclusões que todos os clones ORF filtrado são codificação para proteínas corretamente dobrado/solúvel/domínios15. Como muitos clones, presentes na biblioteca e mapeamento de mesmo região/domínio, têm pontos diferentes inicial e final, isto permite a identificação imparcial, passo a passo dos fragmentos mínimos que poderão resultar em produtos solúveis.
Uma melhoria na tecnologia é dada pelo uso de NGS para caracterizar a biblioteca. A combinação dessa plataforma e uma ferramenta de web específico para análise de dados fornece importante informação imparcial sobre as sequências de nucleótidos exata e sobre a localização das ORFs selecionados na referência de DNA em estudo, sem a necessidade de mais extensas análises ou esforço experimental.
Domainome bibliotecas podem ser transferidas para um contexto de seleção e usadas como um instrumento universal para realizar estudos funcionais. A proteína do elevado-throughput expressão e interação análise plataforma que estamos integrados e que chamamos Interactome-Seq aproveita a tecnologia de exibição do fago, transferindo a ORF filtrada em um vetor de phagemid e criando um fago-ORF biblioteca. Uma vez re-clonado em um contexto de exibição do fago, proteína domínios são exibidos na superfície das partículas de M13; desta forma domainome bibliotecas podem ser selecionadas diretamente para fragmentos do gene codificação domínios com actividades enzimáticas específicas ou vincular propriedades, permitindo interactome redes de criação de perfil. Esta abordagem foi inicialmente descrita por et al . Zacchi 16 e mais tarde usado em vários outros contexto13,17,18.
Em comparação com outras tecnologias utilizadas para estudar a interação da proteína-proteína (incluindo dois sistema híbrido de levedura e espectrometria de massa19,20), uma das principais vantagens é a amplificação do parceiro de ligação que ocorre durante o fago exiba várias rodadas de seleção. Isto aumenta a sensibilidade de seleção, permitindo a identificação dos domínios dos baixo abundantes proteínas presentes na biblioteca. A eficiência da seleção realizada com biblioteca ORF-filtrado é ainda maior devido à ausência de clones não-funcional. Finalmente, a tecnologia permite que a seleção para ser executada contra tanto da proteína e da proteína não iscas21,22,23,24,25.
Seleções do fago usando a biblioteca do fago-domainome podem ser realizadas usando anticorpos proveniente de soros de pacientes com diferentes condições patológicas, por exemplo, doenças auto-imunes13, câncer ou infecção doenças como isca. Esta abordagem é usada para obter a chamado "assinatura de anticorpo" da doença em estudo, permitindo-se maciçamente, identificar e caracterizar os antígenos/epítopos especificamente reconhecidos por anticorpos dos pacientes ao mesmo tempo. Em comparação com outros métodos, o uso do phage display permite a identificação de epítopos antigênicos lineares e conformacionais. A identificação de uma assinatura específica potencialmente poderia ter um impacto importante para a patogênese da compreensão, novo design de vacina, identificação de novos alvos terapêuticos e o desenvolvimento de ferramentas de diagnósticos e prognósticos de novas e específicas. Além disso, quando o estudo é focado em doenças infecciosas, uma grande vantagem é que a descoberta de proteínas imunogênicas é independente do cultivo de organismos patogénicos.
Nossa abordagem confirma que os repórteres dobráveis podem ser usados em escala genômica para selecionar o "domainome": uma coleção de domínios corretamente dobrado, bem expressa, as proteínas solúveis da porção codificação do DNA ou cDNA de qualquer organismo. Uma vez isolados os fragmentos de proteína são úteis para muitos propósitos, fornecendo informações essenciais de experimentais para anotação de gene, bem como para estudos estruturais, mapeamento de epítopo de anticorpos, identificação de antígeno, etc. A completude da elevado-throughput de dados fornecidos pelo NGS permite a análise de amostras altamente complexas, tais como bibliotecas de exibição do fago e detém o potencial para contornar a tradicional colheita trabalhosa e ensaio de clones individuais do fago resgatado.
Ao mesmo tempo graças as funcionalidades da biblioteca de filtrado e a extrema sensibilidade e poder de análise o NGS, é possível identificar o domínio de proteína responsável de cada interação diretamente em uma tela inicial, sem a necessidade de criar bibliotecas adicionais para cada um ligado a proteínas. NGS permite para obter uma definição abrangente do domainome inteiro de qualquer fonte de partida genic/genômica e a ferramenta de web de análise de dados permite a obtenção de uma caracterização altamente específica de um ponto de vista qualitativo e quantitativo do domínios dos interactome proteínas.