3 Kasım 2011
I-TASSER boru hattı kullanarak protein yapısal ve fonksiyonel karakterizasyonu tabanlı bir bilgisayar için yönergeler açıklanmıştır. 3D modelleri sorgu protein dizisi başlayarak, birden fazla iş parçacığı hizalanmalar kullanılarak oluşturulan yapısal montaj simülasyonları yinelemeli. Fonksiyonel çıkarımlar sonra bilinen yapı ve fonksiyonlara sahip proteinlere maçlarına göre çizilir.
Bu prosedürün amacı, protein moleküllerinin üç boyutlu yapılarını ve biyolojik işlevlerini amino asit dizilerinden başlayarak hesaplamalı olarak öngörmektir. Bu işlem, öncelikle proteinlerin ikincil yapılarının makine öğrenimi ile tahmin edilmesiyle gerçekleştirilir. Ardından, diziler ve öngörülen ikincil yapı, mümkün olan en iyi yapı şablonlarını belirlemek amacıyla PDB kütüphanesindeki çözülmüş yapılarla eşleştirilir.
Bu prosedüre threading (iplikleme) adı verilir. Threading prosedürünü takiben, IT AER programı şablonları dizi şablon hizalamalarına göre fragmanlara ayıracak ve ardından üçüncü adımda bu fragmanları tam uzunluktaki modellere yeniden birleştirecektir. Tam atomik modeller, hidrojen bağı ağlarını optimize etmek ve sterik çakışmaları gidermek için atomik düzeydeki rafinasyonlar ile oluşturulur.
Prosedürün son adımı, tahmin edilen yapıları fonksiyon kütüphanesindeki bilinen fonksiyonlu proteinlerle eşleştirerek proteinlerin biyolojik fonksiyonlarını belirlemektir. ITER'in mevcut yapı modelleme yöntemlerine göre temel avantajı, threading hizalamalarını tutarlı bir şekilde doğal duruma daha çok yaklaştırabilen yerleşik yapı fragmanı montaj yaklaşımıdır. Bu yüksek kaliteli yapı modelleri, bilimsel toplulukta ITER'in kullanımını teşvik etmek amacıyla, yapı tabanlı doğru fonksiyonel açıklamaların da temelini oluşturur.
Laboratuvarımız, protein dizilerinin iter'e gönderilebileceği bir web sitesini kullanıma sunmuştur. Bu web site, dünya çapındaki kullanıcıların, ITER simülasyonlarını yöneten ve çalıştıran bilgisayar kümesine bir arayüz kaydedebilmelerini sağlayan bir merkez görevi görmektedir. Bir ITER simülasyon işi, bir düzineden fazla daha küçük alt simülasyondan oluşur.
Tek bir işlemci çekirdeğine sahip tek bir bilgisayarda çalıştırıldığında, bu simülasyonlar yüz saatten fazla sürebilir. Zang laboratuvarı bilgisayar kümesi, bu alt simülasyonları alır, yüzlerce bilgisayara dağıtır ve 2000'den fazla simülasyonu çalıştırabilme kapasitesine sahiptir. Bilgisayar kümemiz sayesinde, her gün yüzlerce I taster simülasyonunu tamamlayabiliyoruz.
Bu kapasiteye rağmen, sistemi optimize etmek ve çevrimiçi IT AER kullanıcılarımızın bekleme süresini en aza indirmek için birçok çalışma yapılması gerekmektedir. Yapı ve fonksiyon modelleme deneyine başlamak için IT AER web sayfasına giriş yapın. Burada tartışılan tüm ilgili web sayfalarının URL adresleri yazılı protokolde bulunabilir.
Amino asit dizisini sağlanan forma kopyalayıp yapıştırın veya gözat düğmesine tıklayarak diziyi doğrudan yükleyin. İş için bir e-posta adresi ve bir isim belirtin. Kullanıcılar isteğe bağlı olarak kalıntı temas veya mesafe kısıtlamaları belirtebilirler.
Yapı modelleme süreci sırasında ek bir şablon ekleyin veya bazı şablon proteinleri hariç tutun. Diziyi göndermek için run it taser düğmesine tıklayın. Gönderilen işin durumunu IT taser kuyruk sayfasını ziyaret ederek kontrol edin.
Arama sekmesine tıklayın ve gönderilen işi aramak için iş kimlik (ID) numarasını veya sorgu dizisini kullanın. Yapı ve fonksiyon modellemesi tamamlandığında, tahmin edilen yapıların bir görüntüsünü ve bir web bağlantısını içeren bir bildirim e-postası belirtilen e-posta adresine gönderilecektir. Sonuçları görüntülemek ve indirmek için bu bağlantıya tıklayın.
Yapı analizine, alfa heliks için H, beta tabaka için S veya rastgele kıvrım (coil) için C olarak görüntülenen ikincil yapı tahminini inceleyerek başlayın. Ayrıca, her bir kalıntı için tahminin güven skorunu dikkate alın. Proteindeki çekirdek bölgeyi tahmin etmek için düzenli ikincil yapı tahminlerinin uzun yapılarına sahip bölgeleri arayın.
Proteinin yapısal sınıfı, sekonder yapı elementlerinin dağılımına dayanarak da analiz edilebilir. Gömülü ve çözücüye açık bölgeleri belirlemek için öngörülen çözücü erişilebilirliğini görüntüleyin. Sorguda, öngörülen çözücü erişilebilirliği değerleri, gömülü bir kalıntı için sıfır puanından, açık bir kalıntı için dokuz puanına kadar değişmektedir.
Çoğunlukla gömülü kalıntıların bulunduğu bölgeler, proteindeki çekirdek bölgeyi belirlemek için kullanılabilirken; çözücüye açık ve hidrofilik kalıntıların olduğu bölgeler potansiyel hidratasyon veya fonksiyonel bölgelerdir. Sorgulanan proteinin öngörülen üçüncül yapılarını görüntülemek için solda görüntülenen etkileşimli JMO Applet'ine aşağı kaydırın. Görüntülenen yapının görünümünü değiştirmek için applet'e tıklayın.
Belirli bir bölgeye yakınlaştırın, öngörülen modeldeki belirli kalıntı türlerini seçin veya kalıntılar arası mesafeleri hesaplayın. Öngörülen yapıların kalitesini tahmin etmek için yapısal modellemenin güven puanlarını analiz edin. Csco değerleri tipik olarak eksi beş ile iki aralığındadır ve daha yüksek bir puan, daha iyi kaliteye sahip bir modeli yansıtır.
İlk modelin tahmini TM skoru ve RMSD değeri, birinci modelin tahmini doğruluğu olarak gösterilmiştir. csco hakkında daha fazla bilgi bağlantısına tıklayın. Tüm modellerin csco küme boyutunu ve küme yoğunluğunu analiz etmek için, low mets threading programları tarafından belirlenen sorgu proteininin ilk 10 threading şablonunu analiz edin.
Sonuçlar sayfasını aşağı kaydırarak, threading hizalamalarının kalitesini analiz etmek için normalize edilmiş Z-skorunu görüntüleyin. Normalize edilmiş csco değeri birden büyük olan hizalamalar, güvenilir bir hizalamayı yansıtır ve sorgu proteini ile aynı katlanmaya sahip olma olasılığı en yüksek olanlardır. Sorgu ve şablon proteinler arasındaki homologiyi değerlendirmek için threading hizalı bölgesindeki ve tüm zincirdeki sekans özdeşliğini inceleyin.
Yüksek sekans özdeşliği, sorgu ve şablon proteinler arasındaki evrimsel akrabalığın bir göstergesidir. Sorgu ve şablon proteinlerdeki korunmuş kalıntıları veya motifleri görsel olarak tanımlamak için renkli olarak gösterilen threading hizalı kalıntıları inceleyin; threading hizalı bölgedeki sekans özdeşliğinin tüm zincir hizalamasına kıyasla daha yüksek olması, sorguda korunmuş yapısal motiflerin veya domainlerin varlığına da işaret eder. Hizalamayı kontrol ederek threading hizalamasının kapsamını değerlendirin.
En üstteki hizalamanın kapsamı düşükse ve sorgu proteininin yalnızca küçük bir bölgesiyle sınırlıysa veya sorgu dizisinin uzun bir segmentinde mevcut değilse, bu durum sorgu proteininin birden fazla domain içerdiğini gösterir. Bu durumda, dizinin bölünmesi ve domainlerin ayrı ayrı modellenmesi önerilir. Yapısal hizalama programı TM align tarafından belirlenen ilk öngörülen modelin en iyi 10 yapısal analoğunu belirlemek için sonuç sayfasındaki bir sonraki tabloyu görüntüleyin.
0.5'den büyük bir TM skoru, tespit edilen analoğun ve modelin benzer bir topolojiye sahip olduğunu ve sorgu proteinin yapısal sınıfını veya protein ailesini belirlemek için kullanılabileceğini gösterir. 0.3'ten küçük TM skoruna sahip olanlar ise rastgele bir yapısal benzerliğe işaret eder. Model ve yapısal analogdaki uzaysal motiflerin korunmasını değerlendirmek için yapısal olarak hizalanmış bölgedeki sekans kimliğini ve RMSD değerini analiz edin.
Yapısal olarak korunan bu kalıntıları ve motifleri belirlemek için hizalamadaki renkli ve hizalanmış kalıntı çiftlerini görsel olarak inceleyin. Sorgu proteinin potansiyel olarak en olası beş enzim OG'sini görmek için öngörülen EC numaraları tablosuna bakın. Bu şablonlar kullanılarak yapılan EC numarası tahmininin güven düzeyi, kıyaslama analizine dayalı EC skoru olarak gösterilmiştir.
Sorgu ve şablon protein arasındaki fonksiyonel benzerlik, 1.1'den büyük bir EC skoru kullanılarak güvenilir bir şekilde yorumlanabilir. Ardından, sorgu proteini ile benzer katlanmaya sahip şablonlar arasında fonksiyonel bir konsensüs olup olmadığına bakın. Eğer birden fazla şablon aynı EC numarasına sahipse ve EC skoru 1.1'den büyükse, tahminin güven düzeyi çok yüksektir.
Ancak, EC skoru yüksek olmasına rağmen tanımlanan hitler arasında bir fikir birliği yoksa tahmin daha az güvenilir hale gelir ve kullanıcılara gen ontolojisine başvurmaları önerilir. Terim tahminleri, sorgulanan proteinin PDB kütüphanesindeki gen ontolojisi terimleriyle açıklanmış ilk 10 homologunu belirlemek için tahmin edilen gen ontolojisi terimleri tablosunu görüntüler; her bir protein genellikle moleküler işlevlerini, biyolojik süreçlerini ve hücresel konumunu tanımlayan birden fazla gen ontolojisi terimi ile ilişkilendirilmiştir. Tanımını ve soy ağacını analiz etmek için amigo web sitesini ziyaret etmek amacıyla her bir terime tıklayın.
Sorgu ve şablon proteinler arasındaki fonksiyonel benzerliğe erişmek için fonksiyonel homoloji skoru sütununu analiz edin. Bu proteinlerden fonksiyonel anotasyon aktarımının güven düzeyi de tahmin edilebilir. Şablonlar arasındaki fonksiyon uyumunu analiz etmek için gen ontolojisi terimlerinin konsensüs tahmini tablosunu görüntüleyin.
Bu yaygın işlevler, sorgulanan proteinin gen ontolojisi terimlerini tahmin etmek ve geo terim tahminlerinin güven düzeyini değerlendirmek için kullanılır. Son olarak, sorgulanan protein için en iyi 10 ligand bağlanma bölgesi tahminini görüntülemek için sayfanın altına kaydırın; tahmin edilen bağlanma bölgeleri, ortak bir bağlanma cebini paylaşan tahmin edilen ligand konformasyonlarının sayısına göre sıralanır. Belirlenen en iyi bağlanma bölgesi halihazırda JM OL uygulamasında görüntülenmektedir.
Diğer öngörüleri analiz etmek ve ligand ile etkileşime giren kalıntıları görselleştirmek için radyo butonlarına tıklayın. BS skoru, model ile şablonların bağlanma bölgesi arasındaki yerel benzerliği ortaya koyar. 1.1'den büyük bir BS skoru, öngörülen bağlanma bölgesinin yakınında yüksek sekans ve yapısal benzerliğe işaret eder.
Şablondaki bilinen bağlanma bölgesiyle karşılaştırıldığında modelde, IT diğer kullanışlı özelliklere bağlantılar içeren ana bir web sayfasıdır. Forum özelliği, kullanıcının çevrim içi bir hesap oluşturmasına ve yapı modelleme konusunda veya sonuçların yorumlanmasında diğer ITER kullanıcılarından yardım almasına olanak tanır. İndirme özelliği, kullanıcıların iter ve ilgili paketleri indirmelerine ve bunları bilgisayarlarına kurmalarına imkan sağlar.
Bu, modelleme deneylerini gerçekleştirmek için gereken sürenin azaltılmasına yardımcı olur. Kuyruk özelliği, gönderilen tüm işlerin durumunun IT a Q sayfasında görülmesini sağlar. Kullanıcılar ayrıca, tamamlanan işlere ait modellenmiş yapıların görüntülerini görsel olarak inceleyebilirler.
Bu sayfada, CSCO beklenen TM skoru, ilk modelin beklenen RMSD değeri ve gönderim tarihi ile birlikte; daha hızlı formatlanmış sorgu dizisini, öngörülen sekonder yapıyı, ilgili güven skorlarını ve kalıntıların öngörülen çözücü erişilebilirliğini gösteren IT AER sonuçları sayfasının bir alıntısı da sunulmuştur. Analiz edilen çekirdek bölge ve sorgudaki potansiyel hidratasyon bölgesi sırasıyla camgöbeği ve kırmızı dikdörtgenlerle vurgulanmıştır. Burada, sorgu proteinleri için tersiyer yapı öngörüleri gösterilmektedir.
Öngörülen modeller, kullanıcının molekül görüntüsünü değiştirmesine olanak tanıyan etkileşimli bir JML uygulama çıkışında görüntülenir. Modeller ayrıca indirme bağlantılarına tıklanarak indirilebilir; modelin kalitesini tahmin etmek için kullanılan güven puanı csco olarak raporlanır. Loomis threading programları tarafından tanımlanan en iyi 10 threading şablonunu ve hizalamasını gösteren itta A sonuçları sayfasına bir örnek sunulmuştur.
Threading hizalamalarının kalitesi, bir'den büyük bir değerin güvenilir bir hizalamayı yansıttığı normalize edilmiş Z-skoru baz alınarak değerlendirilir. Şablondaki hizalanmış kalıntulardan, sorgu kalıntılarıyla aynı olanlar, korunmuş bir kalıntı veya motifin varlığını belirtmek için renklerle vurgulanmıştır. Aksine, en üstteki şablonların çoğunda hizalamanın olmaması, sorgu proteininde birden fazla domainin varlığına işaret eder ve hizalanmamış kalıntular domain bağlayıcı bölgelere karşılık gelir.
Bu tablo, TM hizalı Yapısal Hizalama Programı tarafından tanımlanan ilk 10 yapısal analoğu ve yapısal hizalamaları göstermektedir. Analogların sıralaması, yapısal hizalamanın TM skoruna dayanmaktadır. 0.5'ten büyük bir TM skoru, karşılaştırılan iki yapının benzer bir topolojiye sahip olduğunu gösterir.
0,3'ten düşük bir TM skoru, iki rastgele yapı arasındaki benzerlik anlamına gelirken; yapısal olarak hizalanmış kalıntı çiftleri, amino asit özelliklerine göre renklerle vurgulanmış, hizalanmamış bölgeler ise tire ile belirtilmiştir. Burada, PDB kütüphanesindeki sorgu proteininin tanımlanan enzim homologlarını gösteren ITR sonuç sayfasına bir örnek verilmiştir.
EC numarası tahmininin güven düzeyi, sorgu ve şablon protein arasındaki fonksiyonel benzerliğin 1,1'den büyük bir EC skoru ile belirtildiği EC skoruna dayanarak analiz edilir. Sorgu protein için oluşturulan gen ontolojisi terim tahmin tablosu, gen ontolojisi şablon kütüphanesindeki sorgu proteinin fonksiyonel homologlarını, fonksiyonel homoloji skorlarına göre sıralanmış şekilde içerir. Sorgu protein için nihai gen ontolojisi terim tahminlerini oluşturmak amacıyla, en yüksek skorlu bu eşleşmelerden ortak fonksiyonel özellikler türetilir.
Tahmin edilen gen ontolojisi terimlerinin kalitesi geo skoruna göre değerlendirilir; 0,5'ten büyük bir geo skoru, kofaktör algoritmasını kullanarak en iyi 10 protein ligand bağlanma bölgesi tahminini gösteren IT AZA sonuç sayfası örneğinde sunulduğu üzere güvenilir bir tahmini belirtir. Tahmin edilen bağlanma bölgelerinin sıralaması, ortak bir bağlanma cebini paylaşan tahmin edilen ligand konformasyonlarının sayısına dayanmaktadır. Sorguda BS skoru, tahmin edilen bağlanma bölgesi ile şablon bağlanma bölgesi arasındaki yerel sekans ve yapı benzerliğinin bir ölçüsüdür ve bağlanma bölgesi ceplerinin korunmuşluğunu analiz etmek için kullanışlıdır.
ISER, protein yapısı ve fonksiyonu tahmini için en verimli algoritmalardan biri olsa da, bunun yalnızca bilgisayar algoritmalarıyla yapılan bir tahmin olduğunu unutmamak önemlidir. Örneğin, kalıntı temasları veya bağlanma bilgileri gibi herhangi bir deneysel veri veya fonksiyonel içgörü, tahminlerin doğruluğunu artırmak için son derece faydalı olacaktır. IT AER sunucusu, artan ilgiyi karşılamak amacıyla modelleme prosedürü sırasında bu bilgilerin eklenmesine olanak tanıyan bir portala sahiptir.
Zang laboratuvarı, IT AER yazılımını ticari olmayan araştırmalar için ücretsiz olarak kullanıma sunmuştur. IT AER ve göz seçiciyi (eye taster) aktif olarak geliştirmeye devam ediyoruz; bu yazılımın erişilebilir olmasının, Zang laboratuvarı dışındaki geniş ölçekli uygulamalara yol açacağını, bilimsel topluluğa fayda sağlayacağını ve daha fazla araştırmayı teşvik edeceğini umuyoruz.
Bu makale, proteinlerin 3B yapılarını ve işlevlerini amino asit dizilerinden tahmin etmek için kullanılan I-TASSER iş akışını açıklamaktadır. Süreç; threading, fragman montajı ve bilinen protein yapılarına dayalı işlevsel çıkarımı içermektedir.
Hesaplamalı protein yapısı ve fonksiyonu tahmini, deneysel olarak karakterize edilmemiş proteinler için mekanistik içgörüler sağlayarak erken ilaç keşfinde hedef risklerinin azaltılmasına olanak tanır. I-TASSER iş akışı, hipotez testlerini ve fonksiyonel anotasyonu destekleyerek hedef seçimi ve öncü bileşik tanımlama süreçlerindeki öngörü güvenilirliğini artırır. Bu yaklaşım, düşük kapasiteli deneysel yöntemlere olan bağımlılığı azaltır ve biyofarma Ar-Ge'sinde hedef doğrulamayı hızlandırır.
I-TASSER yöntemi, her aşamada karar verme sürecini bilgilendiren yapısal ve fonksiyonel içgörüler sunarak, hedef belirlemeden öncü bileşik optimizasyonuna kadar olan keşif sürekliliğine entegre olur.