Tutti i campioni utilizzati per determinare le fasi di lettura aperti (ORF) selezionati in questo studio sono stati raccolti da Starbuck Island, sito 7 (star7) e Caroline Atoll, Site 9 (CAR9) dei meridionali Line Islands. Si stima che circa 100 L di acqua di mare da questi siti è stato raccolto sotto le pompe di sentina strato limite con corallo, come descritto in precedenza 5. Contenuto delle pompe sono stati oggetto di frazionamento attraverso grandi filtri pori per rimuovere piccoli eucarioti e successivamente concentrati usando 100 kDa filtri flusso tangenziale lasciando solo microbi e virali come particelle (VLP). Per separare i VLP, rimanendo l'acqua di mare è stata fatta passare attraverso 0,45 micron filtri conseguente virome. Cloroformio è stato introdotto per questa frazione virale di arrestare la crescita di eventuali cellule rimanenti e conservata a 4 ° C.
VLPs sono stati purificati utilizzando il metodo di cloruro di cesio, in cui gradienti di densità separati tramite centrifugazione e consentono il recupero di virioni a ~ 1,35 g / ml a 1,5 g / ml 3. DNA virale è stato estratto utilizzando un CTAB / fenolico: protocollo cloroformio e amplificato tramite diversi amplificazione spostamento utilizzando reagenti Phi29. Il sequenziamento del virome è stato realizzato con la tecnologia disponibile in commercio pirosequenziamento.
Bioinformatics utilizzati nella lavorazione e selezione di ORF virali per questo studio sono i seguenti. Tre fasi di pre-processing sono stati utilizzati per le metagenomi virali CAR9 e star7. Innanzitutto, software pubblico è stato utilizzato per rimuovere le sequenze di tag che il risultato di amplificazione del DNA virale prima del sequenziamento 27. In secondo luogo, gli artefatti sequenziamento comuni come duplicati di sequenza e low copy number sono stati filtrati dal set di dati tramite un programma bioinformatica aggiuntivo 28. Infine, la rimozione della contaminazione sequenza straniero 29 è stata effettuata per quelle sequenze che avevano ≥ 90% di copertura e ≥ 94% di identità con le sequenze nei seguenti database: RefSeq vgenomi IRUs; Umana - Riferimento GRCh37; Umana - Celera Genomics; Umana - Craig Venter (HuRef); Umano - Seong-Jin Kim (Corea); Umana - Cromosoma 7 versione 2 (TCAG); e umano - James Watson, Yanhuang (YH, asiatico), yoruba (NA18507; africano) sequenze di riferimento 21. A seguito di questi processi, le sequenze dei campioni CAR9 ammontano a 591.600 e sequenze star7 ammontano a 939.311. Queste sequenze sono stati caricati su MGRAST e assemblati via software assembler utilizzando le impostazioni predefinite. Contigs sono stati tradotti in 6 fasi di lettura e putativi di lettura aperta (pORFs) sono stati identificati utilizzando script, come descritto in precedenza 21.
Per identificare ORF sconosciuti una serie di ricerche di somiglianza base sono state eseguite per rimuovere ORF di funzione nota. In sintesi, le seguenti ricerche sono state condotte con i loro criterio di ricerca corrispondenti 21:
- Somiglianza significativa di ≥ 95% di identità su ≥40 coppia di basi (bp) di MGRAST BLAT database M5NR.
- Somiglianza significativa (e-valore ≤ 0,001) per TBLASTN contro tutti metagenomi pubblici in My Resource metagenoma database.
- Somiglianza significativa (e-valore ≤ 0,001) per BLASTP e TBLASTN contro database di NR.
- Somiglianza significativa (e-valore ≤ 0,001) da RPS-BLAST contro il Database Conserve dominio.
- Traduzioni di proteine da una frazione di selezione di ogni serie di dati comparati contro strutture proteiche risolte nel Protein Data Bank.
- Calcolo delle frequenze dinucleotide utilizzando pacchetto Dinucleotide firme.
I pORFs risultanti sono stati progettati per l'espressione in E. coli utilizzando pubblicamente disponibile il software di progettazione gene. Back-traduzione delle sequenze amino-acido impiegato una tabella di utilizzo universale Codone progettato per ospitare espressione in E. coli con una soglia minima di utilizzo del 2%. Sequenza di riconoscimento enzima di restriziones per BamHI e HindIII sono stati esclusi dalle sequenze per facilitare la clonazione. Una società esterna ha sintetizzato il gene ingegnerizzato sequenze 30 e poi ORF sono stati clonati in un mezzo-copia promotore numero pBAD vettore, pEMB11, via clonazione enzima di restrizione standard. Tutti i cloni sono stati trasformati in E. coli K-12 ceppo BW 27784 23.
Piastre Multi-fenotipo Assay (MAP)
Un elevato throughput e software solida pipeline è stato sfruttato per l'analisi delle mappe, il PMAnalyzer 24. Il gasdotto è stato sviluppato in un ambiente server Linux ed esegue varie fasi tra cui: l'analisi dei file di densità ottica, formattazione dei dati in file di testo leggibili, di pre-elaborazione delle curve di crescita per la garanzia della qualità (QA), e che svolgono tecniche di modellazione matematica per analizzare le curve di crescita . Sono stati sviluppati Gli script di modellazione primarie in Python versione 2.7.5 di utilizzare il modulo PyLab.
MAP riproducibilità è stata valutata utilizzando l'errore standard (SE) per i dati replicati (Figura 2A). Curve di crescita grezzi sono stati confrontati con le curve di crescita logistici per determinare se il programma PMAnalyzer accuratamente parametrizzato e modellato crescita clone durante la sperimentazione (dati non mostrati). Per ulteriori informazioni sulla precisione e la validità delle mappe e PMAnalyzer vedere Cuevas et al. 24
Dopo la convalida del metodo, i dati MAP è stato analizzato utilizzando i parametri multipli, come il tasso di crescita massimo (μ max) e il livello di crescita (GL), forniti dalla pipeline di elaborazione. Visualizzazione comparativa delle curve di crescita è spesso utilizzato per l'interpretazione dei dati di crescita; tuttavia, il numero di curve che può essere visualizzato in un momento per il confronto ha dei limiti. Per analizzare numerose curve di crescita simultaneamente, mappa di calore trame derivati sono stati implorato di confrontare decine di cloni coltivati su un singolo substrate contro risposta media che le condizioni "(Figura 2B). L'influenza posto da sovraespressione di una nuova proteina fago è osservata attraverso i cambiamenti dei parametri della curva, in particolare: lag fase, fase esponenziale e la produzione di biomassa massimo (asintoto). Come esempio, la ripida salita dalla fase di latenza in fase esponenziale modellato nella curva di crescita per la proteina del capside (Figura 2A) è riprodotto da un rapido cambiamento di intensità di colore dal nero al bianco per la stesso clone nella trama dinamica della figura 2B .
Per ottenere un quadro globale di distribuzione clone attraverso substrati, classificazioni fenotipiche derivate dal GL sono stati utilizzati (Figura 3). Qui, i quattro fenotipi sono separati in quattro grafici in cui l'altezza di ciascuna barra rappresenta il numero di cloni che mostrano che il fenotipo per un substrato specifico. Valori anomali nei dati sono riconosciuti come i cloni che cadono nel "guadagno di function "o" perdita di funzione categoria ". I valori anomali possono essere ricercati individualmente e hanno studiato più da vicino sperimentalmente. Inoltre, un'analisi globale riconosce polarizzazioni del substrato nel saggio. Substrati come fenilalanina, acido malico, e glicina determinato una classificazione "nessuna crescita". Substrati che costantemente cadono nella classificazione di crescita non, attraverso tutti i cloni, non sono pesantemente ponderazione caratterizzazione funzionale a valle.
Metabolomica
I prodotti catabolici di cloni che esprimono geni fago sconosciuti sono stati identificati utilizzando metabolomica. In breve, i cloni sono state coltivate sotto o una cultura o un passaggio continuo di serie in lotti ambiente culturale prima di essere inviati per l'analisi GC-TOFMS in un impianto di base metabolomica. Per i dettagli sulla lavorazione del campione, analisi, e la normalizzazione per GC-TOFMS attuate dal core facility prescelta vedere Fiehn et al. 31 BriEfly, 1 ml di solvente di estrazione a freddo vengono aggiunti a ciascun campione, dopo che i campioni sono in agitazione e sonicato in un bagno freddo per 5 min. I campioni vengono centrifugati e infine metà del campione viene travasato e liofilizzati per l'analisi. Gli estratti sono purificati e spillo con indicatori di indice ritenzione interna prima di essere caricati sul gascromatografo e poi successivamente trasferito allo spettrometro di massa. I dati di ogni campione è analizzato tale intensità di segnale per tutti i segnali rilevati nel cromatogramma sono segnalati. Per la normalizzazione, l'abbondanza di picchi per ogni campione si riassume e il totale delle abbondanze di punta sono in media tra tutti i campioni del set. Abbondanze metabolita per campione sono divisi per picco abbondanza del campione e poi moltiplicati per il picco di abbondanza media di campionario. I dati risultanti vengono usati per l'analisi metabolomica nella ricerca discusso.
Validazione di metabolomica riproducibilità era tenuto adeterminare la dimensione del campione appropriato per ogni metodo di coltura. Per rilevare la precisione visto all'interno dei campioni e la variazione visto attraverso campione dimensioni l'errore standard della media (M) sia per n = 3 e n = 6 set di dati sono stati esaminati (Figura 5B). Indipendentemente dalle dimensioni del campione coltura continua (CC), meno dell'1% dei dati aveva un S M ≤ 1,5. Mediana S M s erano 221 e 300, ei valori variava 0-7,55 x 10 5 e 3,74 x 10 5, per n = 3 ed n = 6 rispettivamente. S M s sono stati calcolati anche per ogni serie di campioni replicati nel metodo coltura seriale (SC). Anche in questo caso, meno dell'1% dei dati ha avuto un S M ≤ 1,5, una mediana S M di 137, e una gamma di 0-3,51 x 10 5. Per confrontare le distribuzioni S M tra ogni serie campione (CC n = 3 vs . CC n = 6, CC n = 3 vs SC n = 3, e CC n = 6 contro SC n = 3) un test di permutazione è stata eseguita. La distribution di una coltura continua S M Valori set di dati non era significativamente diversa dalla distribuzione dei valori della cultura di serie S M (p-value = 0.0). Tuttavia, la distribuzione dei valori S M per coltura continua n = dati 3 era significativamente diversa da quella dei valori S M per la coltura continua n = 6 dati (p-value = 1,908,804 mila x 10 -49). Infine, il coefficiente di variazione per metabolita è stato confrontato prima e dopo l'attuazione di un controllo della qualità (QA) fase (Figura 5C). In totale, 210 metaboliti sono stati rimossi dopo l'attuazione della condotta QA (40% dei dati). Meno dell'1% dei dati rimossi aveva un'abbondanza metabolita zero, ~ 2% era dati standard interni, ~ 5% è stata dati dai metaboliti mai osservato in E. coli, e le restanti metaboliti (> 30%) avevano un coefficiente di variazione maggiore di 1.
Come con l'analisi MAP, observatio globalens fornito una comprensione iniziale della profondità di metabolomica informazione offerte. Per ottenere un quadro globale, cloni sono stati gerarchicamente raggruppati in base al loro abbondanze relative di metaboliti che forniscono informazioni sui profili clone-metabolita, potenziali cloni con funzioni correlate, e valori anomali clone-metabolita (Figura 6). Per evidenziare le funzioni delle proteine, metaboliti sono separati e raggruppati in base a vie metaboliche comuni. Usando questa analisi con risultati preliminari, era evidente che la metabolomica è in grado di separare i geni provenienti da classi diverse (Figura 6, evidenziato cloni). Inoltre, identificazione dei valori anomali con i dati metabolomica è stato determinato calcolando punteggi standard (punteggi z) per ogni coppia clone-metabolita. Per garantire la significatività statistica, valori anomali sono stati definiti come una coppia clone metabolita con un valore di punteggio Z di 2, che rappresentano solo il 5 per cento dei dati (dati non riportati).
ether.within-page = "always"> 
Figura 1. Definizioni di classificazioni fenotipo. (A) Rapporto tra il livello di crescita (GL) e tasso di crescita massimo. I punti dati cerchiate in rosso rappresentano le curve di crescita che mostrano poco o nessun utilizzo substrato. (B) la rappresentanza Boxplot definizione soglia di crescita basato sulla distribuzione delle curve di crescita con un tasso di crescita minima (<0,15 OD / ora). (C) La varianza e la deviazione standard di GL è calcolato per substrato D-galattosio. Linee tratteggiate brevi rappresentano due deviazioni standard dalla media. Cliccate qui per vedere una versione più grande di questa figura.
highres.jpg "/>
Figura 2. MAP convalida via precisione e la differenziazione. (A) curve di crescita per i cloni strutturali (Capside) e metaboliche (annotati thioredoxin), due nuovi cloni metaboliche (EDT2440, EDT2441), e la risposta media di cloni coltivati sul saccarosio, D- galattosio e D-mannosio nelle mappe. Le linee blu indicano l'errore standard visto tra i dati replicati (n = 3). (B) Le curve di crescita per 47 diversi cloni sono rappresentati come mappe di calore per il saccarosio, D-galattosio e D-mannosio. Il strutturale (cerchio verde) annotato e cloni metaboliche (arancione cerchio), due cloni metaboliche romanzo (cerchi blu scuro e luce), e la risposta media (cerchio rosso) sono evidenziati. Cliccate qui per vedere una versione più grande di questa figura.
PLOAD / 52854 / 52854fig3highres.jpg "width =" 700 "/>
Figura 3. Distribuzione clone per ogni fenotipo su più supporti. Conteggio Il fenotipo-clone per 47 cloni in tutto 72 le condizioni di crescita specifiche emissioni di carbonio. La tabella fornisce i conteggi diretti, per ciascun fenotipo. Clicca qui per vedere una versione più grande di questa figura.

Figura 4. Diagramma dettaglio la costruzione dell'apparato coltura continua. (A) Procedura utilizzati per costruire porte α-γ del reattore coltura continua, (B) passaggi utilizzati per realizzare il porto flusso dal reattore coltura continua, e (C ) i passi per costruire porte δ e ε del biberon coltura continua. = "Https://www.jove.com/files/ftp_upload/52854/52854fig4highres.jpg" target = "_ blank"> Clicca qui per vedere una versione più grande di questa figura.

Figura 5. Confronto dei metodi Phenomic presentati. (A) del flusso di lavoro per la preparazione dei piatti multi-fenotipo Assay (MAP), culture continue e culture seriali. (B) La percentuale di errore standard della media (M) conta per entrambi n = 3 e n = 6 dimensioni del campione per la cultura continua (CC) e la cultura di serie (SC) metodi di preparazione per la metabolomica. L'asse y è su una scala logaritmica. (C) Le distribuzioni dei coefficienti di variazione (CV) per metabolita, prima e dopo l'attuazione della conduttura QA per il metodo coltura continua (CC).g5highres.jpg "target =" _ blank "> Clicca qui per vedere una versione più grande di questa figura.

Figura 6. Profili metabolomica di cloni coltivati in coltura continua. Le abbondanze metabolita mediano per una serie di metaboliti sono tracciate per 84 cloni cresciuti in culture continui. Profili dei metaboliti di cloni annotati strutturali (Capsid) e metaboliche (tioredoxina), due nuovi cloni metaboliche (EDT2440, EDT2441), e la risposta media metabolica sono evidenziati in rosso. Cliccate qui per vedere una versione più grande di questa figura.
| Composto | Carbonio | Azoto | Zolfo | Fosforo |
| Glicerina | - | 0,40% | 0,40% | 0,40% |
| Cloruro di ammonio | 9,5 mm | - | 9,5 mm | 9,5 mm |
| Solfato di sodio | 0.250 mM | 0.250 mM | - | 0.250 mM |
| Solfato di magnesio | 1,0 mm | 1,0 mm | - | 1,0 mm |
| Fosfato di potassio | 1.32 mM | 1.32 mM | 1.32 mM | - |
| Cloruro di magnesio | - | - | * | - |
| Cloruro di potassio | 10 mM | 10 mM | 10 mM | 10 mM |
| Cloruro di calcio | 0,5 micron | 0,5 micron | 0,5 micron | 0,5 micron |
| Cloruro di sodio | 5 mM | 5 mM | 5 mM | 5 mM |
| Cloruro ferrico | 6 micron | 6 micron | 6 micron | 6 micron |
| Arabinosio L- | 0,10% | 0,10% | 0,10% | 0,10% |
| MOPS pH 7,4 | 1x | 1x | 1x | 1x |
Tabella 1. I composti e le concentrazioni dei diversi media basale utilizzati nelle mappe. * 1,0 mm di cloruro di magnesio viene sostituita. 1x MOPS = MOPS 40 mm, tricina 4 mm.
| Substrati di carbonio | Substrati di azoto | Substrati di zolfo | Psubstrati hosphorus |
| 2 deossi-D-ribosio | 2-deossi-D-ribosio | Acido 1-butano-solfonico | adenosina-5-monophoshate |
| Acido acetico al 4 idrossi-fenil | acetammide | acetil cisteina | beta-glicerofosfato |
| acido acetico | adenina | D-cisteina | creatinephosphate |
| adenosina-5-monofosfato | adenosina | D-metionina | D-glucosio-6-fosfato |
| adonitolo | allantoina | dietil-ditiofosfato | dietil-ditiofosfato |
| alfa-D-glucosio | beta-feniletilamina | DL-ethionine | DL-alfa-glicerofosfato |
| alfa-D-lattosio | biureto | glutatione | potassio fosfato |
| alfa-D-melebiose | citidina | Acido isetionico | pirofosfato di sodio |
| acido citrico | citosina | L'acido L-cisteico | tiofosfato sodio |
| D-alanina | D-alanina | L-cisteina | |
| D-arabinosio | D-asparagina | L'acido L-djenkolic |
| D-arabitolo | D-aspartato | L-metionina |
| D-asparagina | D-cisteina | solfato di magnesio |
| D-aspartato | D-glucosamina | solfonico metano |
| D-cellubiose | L'acido D-glutammico | N-acetil-DL-metionina |
| D-cisteina | Acido DL-alfa-ammino-N-butirrico | N-acetil-L-cisteina |
| D-fruttosio | D-metionina | potassio-tetra-thionate |
| D-galattosio | D-serina | tiosolfato di sodio |
| D-glucosamina | D-valina | Acido sulfanic |
| D-glucosio | acido gamma-amino-N-butirrico | taurina |
| D-glucosio-6-fosfato | glicina | Acido taurocolico |
| D-glutammato | guanidina | tiourea |
| D-mannosio | istamina | |
| D-raffinosio | inosina |
| D-ribosio | L-alanina |
| D-salicina | L-arginina |
| D-serina | L-asparagina |
| D-trealosio | L-citrullina |
| D-xilosio | L-cisteina |
| dulcitolo | Acido L-glutammico |
| glicerina | L-glutammina |
| glicina | L-glutatione |
| i-eritritolo | L-istidina |
| inosina | L-isoleucina |
| L-alanina | L-leucina |
| L-arabinosio | L-lisina |
| L-arabitolo | L-metionina |
| L-asparagina | L-ornitina |
| L-aspartato | L-fenil-alanina |
| L'acido L-cisteico | L-prolina |
| L-cisteina | Acido L-piro-glutammico |
| L-fucosio | L-serina; L-treonina |
| L-glutammico Acid | L-triptofano |
| L-glutammina | L-valina |
| L-isoleucina | N-acetil-D-glucosamina |
| L-leucina | putrescina |
| L-lisina | tiourea |
| L-metionina | timidina |
| L-fenilalanina | timina |
| Acido L-piro-glutammico | tiramina |
| L-ramnosio | tirosina |
| L-serina | uridine |
| L-sorbosio | |
| L-treonina |
| L-triptofano |
| L-valina |
| L-xilosio |
| lattato |
| lattulosio |
| malato |
| mio-inositolo |
| acido ossalico |
| sorbato di potassio |
| propionico |
| putrescina |
| Acido quinic |
| piruvato di sodio |
| succinato sodico |
| saccarosio |
| timidina |
| xilitolo |
Tabella 2. Elenco dei substrati utilizzati nella mappa esperimenti.