:從Uniprot到TMHMM的完整流程指南)
1. 為什么要湊齊這七個數(shù)據(jù)庫——膜蛋白分析的完整拼圖做膜蛋白研究的人大多有過這種體驗好不容易把一條序列拿到手接下來卻不知道該往哪兒查。翻Uniprot只有注釋信息沒有結(jié)構(gòu)跑TMHMM只給跨膜螺旋不給分類想去PDB找結(jié)構(gòu)搜半天全是同源度很低的蛋白翻來覆去繞圈子。我做了幾年膜蛋白相關的生信分析最大的感受是膜蛋白本身就是一個需要“多維度互相印證”的研究對象單靠任何一個數(shù)據(jù)庫都拼不出全貌。Uniprot管注釋、InterPro管結(jié)構(gòu)域家族、TCDB管轉(zhuǎn)運分類、SURFY管表面暴露、PDB管三維結(jié)構(gòu)、TMHMM管拓撲預測、OPM管膜內(nèi)走向——這七個庫各有側(cè)重合在一起才是一條從“序列”到“注釋”再到“結(jié)構(gòu)”的完整鏈路。這篇文章把七個庫按“注釋—分類—結(jié)構(gòu)—預測”四個層次拆開講重點說清楚每個庫的適用場景、實戰(zhàn)操作步驟、參數(shù)怎么讀、容易踩的坑。無論你是剛開始接觸膜蛋白的新手還是已經(jīng)跑過一輪數(shù)據(jù)庫檢索、但想把這套流程系統(tǒng)化的老手都可以直接照著我下面的流程走一遍。我默認你已經(jīng)會基本的序列檢索操作比如在NCBI做BLAST、會看fasta格式這是上手膜蛋白數(shù)據(jù)庫分析的底線基礎。2. 注釋起點Uniprot 與 InterPro 的正確打開方式2.1 Uniprot 檢索膜蛋白的實用技巧UniprotUniversal Protein Knowledgebase是絕大多數(shù)膜蛋白分析的“第一站”。它整合了Swiss-Prot人工審核注釋質(zhì)量高和TrEMBL自動注釋覆蓋面廣對一個蛋白質(zhì)來說Uniprot條目里的“Function”“Subcellular location”“Topological domain”“Transmembrane”這幾個字段就是最直接的膜蛋白證據(jù)來源。很多新手第一次查Uniprot直接拿基因名或蛋白名搜然后挑第一個條目就開始分析這是最容易出問題的。膜蛋白往往有異構(gòu)體isoform、有不同的命名體系同一個蛋白在不同物種里注釋深度差別很大。更穩(wěn)妥的做法是先限定物種名比如查人源的某轉(zhuǎn)運蛋白就以“organism: Homo sapiens”為限定條件再看該條目是不是Swiss-Prot審核過entry status會明確標出reviewed或unreviewed。在Uniprot的高級檢索Advanced Search里有幾個我高頻使用的檢索式annotation:(type:transmembrane)直接篩出帶跨膜區(qū)注釋的條目keyword:Transport配合膜定位關鍵詞鎖定轉(zhuǎn)運相關膜蛋白existence:Evidence at protein level只保留有蛋白水平證據(jù)的條目避免只有預測注釋的序列誤導后續(xù)分析拿到具體條目后重點看“Subcellular location”段落里的“Membrane”和“Multi-pass membrane protein”這類描述再對照“Topological domain”字段里的“Cytoplasmic”與“Extracellular”這兩塊信息直接決定了你后續(xù)跑TMHMM時怎么驗證預測結(jié)果。2.2 InterPro 結(jié)構(gòu)域分類的坑與用InterPro是一個集成了Pfam、PANTHER、SMART、CDD、PROSITE等多個成員數(shù)據(jù)庫的聚合平臺。它的核心價值不是告訴你“有哪些結(jié)構(gòu)域”而是把不同數(shù)據(jù)庫對一個蛋白的家族分類結(jié)果匯總?cè)ブ亟o出一份統(tǒng)一的分類報告。對于膜蛋白InterPro最有用的兩個信息是一這個蛋白屬于哪個蛋白家族family比如“Major facilitator superfamily”這類膜轉(zhuǎn)運蛋白超家族二它身上有哪幾個跨膜相關的結(jié)構(gòu)域簽名signature比如某些GPCR家族的7次跨膜特征序列。這兩條信息恰好可以和TCDB的分類結(jié)果相互印證。這里有個我反復遇到的坑InterPro的匹配結(jié)果會同時展示來自不同成員數(shù)據(jù)庫的若干條記錄它們的“置信度”和“覆蓋范圍”完全不一樣。Pfam的匹配通常偏保守但很可靠某些基于短motif的PROSITE匹配則可能出現(xiàn)假陽性。所以不要只看“有沒有匹配”要展開看每條匹配的“residue range”覆蓋了序列的哪一段是否與跨膜區(qū)重合。如果多條匹配的區(qū)間互相矛盾一般優(yōu)先信Pfam或CDD的結(jié)果。2.3 兩者聯(lián)動的典型場景我用過一個真實場景分析某個未知的膜蛋白時先在Uniprot里看到“Subcellular location: Membrane; Multi-pass membrane protein”又在InterPro里匹配到“Sugar transporter”家族的Pfam條目這時候基本可以判定它屬于糖轉(zhuǎn)運蛋白家族。接下來就可以跳到TCDB里按家族名搜看能不能找到對應的TC號如果TCDB里也有相同的家族歸類那注釋的可信度就大大提升了。Uniprot和InterPro在功能上是互補的前者是“這一條”蛋白的明細檔案后者是“這一類”蛋白的家族背景。做膜蛋白項目我的習慣是永遠把這兩個庫的結(jié)果并排看互相驗證而不是只信其中一個。3. 功能特化TCDB 與 SURFY 的差異化定位3.1 TCDB 轉(zhuǎn)運蛋白分類體系怎么讀TCDBTransporter Classification Database是膜蛋白里最“專”的一個數(shù)據(jù)庫。它不像Uniprot那樣覆蓋所有蛋白而是只收錄轉(zhuǎn)運蛋白transporter按照Saier實驗室提出的Transport Classification系統(tǒng)把轉(zhuǎn)運蛋白分成了幾大類通道蛋白channels/pores、電化學勢驅(qū)動轉(zhuǎn)運蛋白、初級主動轉(zhuǎn)運蛋白依賴ATP等能量、基團轉(zhuǎn)位蛋白等等。TC號就是這套分類的“身份證”典型格式類似2.A.1.3.1這樣分四層第一大類的編號表示轉(zhuǎn)運機制比如2代表電化學勢驅(qū)動第二個字母表示亞家族A往往代表某個超家族后面的數(shù)字再逐級細化到具體的底物特異性。我在實際項目里用TCDB的方式有兩種。一種是從Uniprot條目里看“Cross-reference”部分如果這個蛋白已經(jīng)被歸入TCDB會有直接鏈接另一種是把序列在TCDB的BLAST頁面里跑一遍看比對到哪個已知轉(zhuǎn)運蛋白繼承它的TC分類。后者對預測“全新”轉(zhuǎn)運蛋白特別有用。讀TC號時要特別注意分類的層級含義。比如你看到一個蛋白被歸入2.A.1Major Facilitator Superfamily, MFS超家族這只說明它是“電化學勢驅(qū)動的糖/藥物/代謝物轉(zhuǎn)運蛋白超家族”但具體轉(zhuǎn)運什么底物還要看第三、第四層數(shù)字對應的家族成員。很多人只看到第一層分類就下結(jié)論說“這是某底物轉(zhuǎn)運蛋白”這是明顯的過度解讀。3.2 SURFY 表面暴露蛋白篩選思路SURFY這個庫相對冷門但在膜蛋白分析里位置很特殊。它的定位是聚焦“表面暴露蛋白”或“表面組”surfaceome分析也就是幫助判斷一個蛋白的哪些區(qū)域是真正暴露在細胞外側(cè)的。你可能會問跨膜區(qū)、胞內(nèi)區(qū)、胞外區(qū)這些信息TMHMM也能給為什么還需要SURFY這里關鍵差異在于TMHMM給出的是“拓撲”即哪段穿膜、哪段在內(nèi)外側(cè)而SURFY更關注“暴露程度”比如胞外側(cè)的loop里哪些殘基真正伸出表面、可以成為抗體結(jié)合位點或疫苗候選表位。在做表面抗原篩選、膜蛋白胞外片段功能研究這類任務時這個維度的判斷幾乎是剛需。值得注意的是SURFY這類表面暴露分析通常需要額外的特征輸入比如蛋白的三維結(jié)構(gòu)或同源模型。如果手上只有序列可以先跑AlphaFold獲取預測結(jié)構(gòu)再結(jié)合SURFY做表面殘基打分如果沒有結(jié)構(gòu)它會依賴序列特征做啟發(fā)式判斷此時結(jié)論的可靠性會打個折扣。3.3 什么時候該用它們TCDB和SURFY的使用場景可以劃得很清楚任務目標所用數(shù)據(jù)庫輸出判斷一個未知蛋白是否為轉(zhuǎn)運蛋白、屬于哪個家族TCDBTC分類號、家族歸屬判斷蛋白表面暴露殘基、篩選表位SURFY表面暴露區(qū)域評分與位置給轉(zhuǎn)運蛋白補充底物特異性信息TCDB Uniprot底物類型、機制描述膜蛋白胞外片段的功能位點分析SURFY 結(jié)構(gòu)庫可設計抗原/抗體的殘基候選這兩個庫都不是“必查項”但凡是涉及“這個蛋白到底轉(zhuǎn)運什么”或者“這個蛋白表面哪里能用”它們就是最快給出答案的地方。4. 結(jié)構(gòu)視角PDB 檢索與 OPM 膜走向4.1 PDB 里找膜蛋白結(jié)構(gòu)的正確姿勢PDBProtein Data Bank是實驗解析三維結(jié)構(gòu)的大本營。膜蛋白因為難結(jié)晶、難純化歷史上在PDB里的占比一直偏低。但近幾年冷凍電鏡cryo-EM技術成熟之后膜蛋白結(jié)構(gòu)數(shù)量有了明顯增長尤其是離子通道、GPCR和轉(zhuǎn)運蛋白這類熱門靶點基本都有高質(zhì)量結(jié)構(gòu)可查。在PDB檢索膜蛋白結(jié)構(gòu)不要直接在首頁搜蛋白名稱那樣容易把配體復合物、突變體、不同物種的同源結(jié)構(gòu)全都混在一起數(shù)據(jù)噪音很大。我推薦的做法是先在Uniprot條目的“Structure”區(qū)域找到對應的PDB條目列表那里的對應關系是注釋過、可信的。如果沒有結(jié)構(gòu)條目再用PDB的Advanced Search以蛋白名稱加“homo sapiens”之類的物種限定再按分辨率resolution、實驗方法X-ray/cryo-EM/NMR篩選。這里講一個多數(shù)人容易忽略的點PDB里的膜蛋白結(jié)構(gòu)文件坐標對應的往往是“去膜環(huán)境”下的構(gòu)象——有的結(jié)構(gòu)是去垢劑環(huán)境里解的有的甚至只解了部分胞外域。因此拿到PDB條目后光看pdb文件本身是不夠的必須結(jié)合它的“l(fā)igand”、“modified residue”等注釋信息判斷這個結(jié)構(gòu)是否完整、是否包含完整的跨膜區(qū)。4.2 OPM 數(shù)據(jù)庫膜平面上的坐標OPMOrientations of Proteins in Membranes數(shù)據(jù)庫解決的是一個PDB本身不回答的問題這個膜蛋白埋在膜里的時候是怎么擺放的具體來說OPM為每一個已解析的膜蛋白結(jié)構(gòu)計算了它在脂雙層中的空間取向——包括穿膜角度、插入深度、膜邊界在哪一層殘基附近以及這個蛋白插入膜的整體自由能transfer energyΔG。為什么這個信息重要如果你只做序列分析確實用不到OPM但你要是做分子動力學模擬、要做膜環(huán)境下的結(jié)構(gòu)比對或者要判斷某個殘基突變后是否會影響膜插入穩(wěn)定性OPM的取向參數(shù)就是必需的坐標系。沒有它你可能把本應在膜內(nèi)的疏水段錯誤地放到了水相整個模擬就是白跑。OPM的使用很直接在網(wǎng)站上搜索蛋白名或PDB編號它會列出該蛋白在膜中的定位參數(shù)同時提供一個調(diào)整好取向的坐標文件可以直接下載用于后續(xù)建模。我個人的建議是凡是做膜蛋白MD模擬初始構(gòu)象一律用OPM處理過的坐標不要自己對著PDB原始坐標瞎擺膜。4.3 結(jié)構(gòu)與拓撲預測的校準PDB和OPM還有一個妙用校正拓撲預測。比如TMHMM預測某個蛋白有6次跨膜但PDB里已有同源蛋白結(jié)構(gòu)顯示其實只有5次跨膜、多出來的一段是一次長疏水loop。這種矛盾出現(xiàn)時結(jié)構(gòu)信息永遠優(yōu)先于預測信息——實驗結(jié)構(gòu)是ground truth預測工具只是參考。我在實戰(zhàn)中的處理順序是先跑TMHMM得到初步拓撲再去PDB/OPM找同源結(jié)構(gòu)驗證兩者一致的拓撲才敢寫進論文或用于設計后續(xù)實驗。如果對不上就回到Uniprot看是不是注釋覆蓋不全或者預測時信號肽干擾了結(jié)果。這個“預測—結(jié)構(gòu)—再預測”的循環(huán)是我認為膜蛋白分析里最值得養(yǎng)成的習慣。5. 預測利器TMHMM 的用法、參數(shù)與邊界5.1 TMHMM 原理極簡版TMHMMTransMembrane Hidden Markov Model是基于隱馬爾可夫模型的跨膜螺旋預測工具也是目前α螺旋型膜蛋白拓撲預測里最常用的之一。它的輸入就是一條氨基酸序列輸出的是預測出的跨膜螺旋位置、殘基位于膜內(nèi)側(cè)還是外側(cè)的拓撲分配、以及每段螺旋的置信度。很多文章會用“TMHMM server 2.0”版本在線提交序列后很快就能出結(jié)果。輸出部分我建議只認真看四塊信息predhel預測的螺旋數(shù)、拓撲字符串一串由i/M/o組成的序列i代表inside、M代表membrane、o代表outside、每段螺旋跨過的殘基范圍、以及對應的概率值。拓撲字符串是解讀結(jié)果的關鍵。比如某蛋白預測結(jié)果是iiiii...MMMMMMMMMMMMMMMM...ooooo就是說N端在胞內(nèi)、跨越一次膜、C端在胞外。這種“一次跨膜”拓撲和“多次跨膜”拓撲在后續(xù)實驗設計上的意義完全不同。5.2 輸出解讀與常見誤判TMHMM最經(jīng)典的誤判來源有兩個一是信號肽二是短的疏水片段。先說信號肽。真核生物的分泌蛋白或膜蛋白N端常常有一段信號肽它本身是疏水的TMHMM很容易把這段誤判成一條跨膜螺旋導致預測結(jié)果多出一次跨膜。解決方法是在跑TMHMM之前先用SignalP把信號肽切掉再用剩余序列跑TMHMM。我在分析宿主蛋白時幾乎每次都做這一步。再說短疏水片段。有些膜蛋白的跨膜螺旋很短或者在序列中存在一段疏水性較強但功能上并不穿膜的片段TMHMM也可能把它們識別進去。判斷方法很簡單看那一段螺旋的長度和概率。常規(guī)α螺旋跨膜區(qū)長度大約是20個殘基左右如果預測片段明顯短于這個長度且概率偏低比如低于0.5就要警惕是誤判。5.3 和其他拓撲預測工具的關系膜蛋白拓撲預測不止TMHMM一個選擇常用的還有Phobius、MEMSAT3、TOP-CONS、DeepTMHMM等等。TMHMM能流行這么多年核心優(yōu)勢是簡單、快、結(jié)果穩(wěn)定適合批量跑序列但它對β桶狀膜蛋白如外膜蛋白porin完全不適用β桶的跨膜結(jié)構(gòu)是反平行β折疊片不是α螺旋用TMHMM去預測外膜蛋白就是張冠李戴。如果序列比對結(jié)果顯示目標蛋白屬于β桶外膜蛋白家族應該改用BOCTOPUS或者PRED-TMBB這類專門工具。我之前處理過一個從宏基因組里注釋出來的疑似孔蛋白用TMHMM預測出來“沒有跨膜螺旋”一度以為它是個分泌蛋白后來用PRED-TMBB一跑發(fā)現(xiàn)是典型的β桶這個教訓記憶非常深。另外DeepTMHMM基于深度學習的新版本在處理信號肽和跨膜區(qū)重疊問題上比2.0版好一些如果預算和算力允許可以兩個版本都跑一遍對比。6. 一體串聯(lián)從一條序列到膜蛋白全景畫像的實操流程6.1 完整流程速覽前面四個部分分別介紹了七個庫的用法但實際做項目時它們不是孤立的。下面就是我日常用的完整流程從一條未知序列開始得到一張“膜蛋白全景畫像”輸入序列在Uniprot檢索/比對獲得基礎注釋和跨膜區(qū)標注用SignalP處理信號肽再用TMHMM跑拓撲預測把序列提交InterPro獲得結(jié)構(gòu)域和家族分類如果是疑似轉(zhuǎn)運蛋白用TCDB進一步分類定家族用PDB查詢是否存在實驗結(jié)構(gòu)或同源結(jié)構(gòu)若有結(jié)構(gòu)用OPM獲取膜內(nèi)取向參數(shù)結(jié)合SURFY做表面暴露分析輸出可用于表位篩選的候選區(qū)域這七步做完你就同時擁有了這個蛋白的“身份信息”Uniprot、“家譜信息”InterPro/TCDB、“結(jié)構(gòu)信息”PDB/OPM和“功能位點信息”TMHMM/SURFY。6.2 每一步干什么、為什么這么干第一步在Uniprot里做的是“建檔”。就算序列沒有完美匹配Uniprot的BLAST也能幫你找到同源蛋白間接獲得功能線索。第二步做“形狀刻畫”。拓撲預測告訴你的不只是跨膜次數(shù)的數(shù)字更關鍵的是起始端在膜內(nèi)還是膜外——這決定了后續(xù)做表達載體設計、標簽位置選擇時的策略。第三步做“身份確認”。InterPro的家庭分類往往直接對應某個功能類別比如“ABC transporter”家族、某個激酶家族。這一步能快速把你從“這個蛋白是什么”拉到“這個蛋白大概是干什么的”這一層級。第四步做“功能深挖”。如果InterPro提示它是轉(zhuǎn)運蛋白TCDB會把分類細化到具體的轉(zhuǎn)運機制和底物類別這是InterPro給不了的信息深度。第五和第六步做“空間定位”。先去PDB找結(jié)構(gòu)有結(jié)構(gòu)就立刻去OPM拿膜內(nèi)的擺放坐標。這兩步是判斷“胞外區(qū)/胞內(nèi)區(qū)哪個loop可以做實驗”的最可靠依據(jù)。第七步做“靶點挖掘”。SURFY給出表面暴露殘基如果你要設計抗體制劑、疫苗多肽或者做細胞表面標記這一步是實際產(chǎn)出最直接的一環(huán)。6.3 一個具體例子走一遍用一條假設的未知人源序列舉例先跑Uniprot BLAST比對到一個人源溶質(zhì)轉(zhuǎn)運蛋白Uniprot注釋顯示它是“multipass membrane protein”。再用SignalP發(fā)現(xiàn)N端無信號肽TMHMM預測出12次跨膜螺旋N端和C端都在胞內(nèi)這個結(jié)果和同家族蛋白的已知拓撲吻合。隨后InterPro匹配到“Major facilitator superfamily”的Pfam條碼TCDB里找到同一家族TC號歸為2.A.1大類下的某成員。PDB檢索該家族找到幾個同源蛋白的冷凍電鏡結(jié)構(gòu)其中分辨率最高的一條已經(jīng)在OPM里收錄——OPM給出的膜插入自由能ΔG為負值說明這個蛋白插入膜的過程是熱力學有利的。最后用SURFY分析胞外側(cè)暴露loop選出一個高暴露片段作為后續(xù)免疫實驗的候選表位。整個流程走下來一條孤零零的序列就變成了一張帶注釋、帶分類、帶結(jié)構(gòu)參照、帶候選位點的完整畫像。這比單查任何一個庫得到的結(jié)論都扎實得多。7. 常見問題與排查技巧實錄7.1 高頻問題速查表現(xiàn)象可能原因排查與解法TMHMM預測螺旋數(shù)遠超預期信號肽干擾先用SignalP切除信號肽再重跑InterPro完全無匹配序列太新或?qū)儆谖词珍浖易逶嘓MMER搜索、擴大同源范圍后再試PDB搜不到目標結(jié)構(gòu)該蛋白或近緣物種無實驗結(jié)構(gòu)去AlphaFold數(shù)據(jù)庫取預測結(jié)構(gòu)或做同源建模TCDB搜不到轉(zhuǎn)運分類不是典型轉(zhuǎn)運蛋白或依賴BLAST繼承用序列BLAST遍歷TCDB庫OPM搜不到某蛋白結(jié)構(gòu)未被收錄或并非標準膜蛋白用PPM在線服務器自行計算膜取向SURFY輸出不穩(wěn)定缺少三維結(jié)構(gòu)輸入先建模型或取AlphaFold結(jié)構(gòu)再做表面分析Uniprot條目是unreviewed該蛋白注釋未被人工審核提高證據(jù)閾值找reviewed同源條目做參考7.2 我踩過的坑與補救方法先說一個最讓我印象深刻的坑當年分析一個細菌外膜蛋白用TMHMM跑出來“0跨膜螺旋”我一度以為序列拿去錯了或者輸入出了bug。后來才意識到自己犯的是工具選型錯誤——β桶外膜蛋白必須用專門的預測器。這個教訓讓我明白了工具使用前必須先判斷蛋白的類型序列親疏水性、家族歸屬都會直接影響預測策略?,F(xiàn)在我的習慣是任何序列在跑TMHMM之前先看一眼它在Uniprot/InterPro的家族歸屬心里對它是α螺旋還是β桶有個預判再去選預測工具。第二個坑是PDB檢索時忽略了“結(jié)構(gòu)域結(jié)構(gòu)”和“全長結(jié)構(gòu)”的區(qū)別。有些PDB條目只包含某一個胞外結(jié)構(gòu)域并不覆蓋跨膜區(qū)。我曾經(jīng)拿一個只有胞外域的晶體結(jié)構(gòu)當成了全長結(jié)構(gòu)來設計跨膜區(qū)突變結(jié)果實驗設計偏差很大。現(xiàn)在檢索PDB時我會專門看鏈的長度與序列覆蓋度判斷它是否是完整結(jié)構(gòu)。第三個坑是OPM坐標的“適用條件”。OPM給出的膜取向是基于某個特定脂環(huán)境計算的不同脂質(zhì)組成下膜蛋白的插入角度可能會有數(shù)度的差別。如果是做精細的MD模擬建議用OPM坐標做初始定位但在平衡階段要允許蛋白在膜內(nèi)自由調(diào)整不要死鎖初始姿態(tài)。7.3 批量分析的效率建議如果你要處理的不止一條序列而是幾十上百條候選膜蛋白我再推薦一套組合策略批量用TMHMM跑拓撲這一步非??彀呀Y(jié)果按螺旋數(shù)分組每組抽樣用InterPro分類再挑代表性成員去PDB/OPM做結(jié)構(gòu)驗證。不要每條序列都全七庫走一遍那樣的時間成本太高而且很多冗余。批量跑TMHMM時我習慣保留原始拓撲字符串方便后續(xù)和TCDB分類結(jié)果做關聯(lián)分析。比如批量比較同一TC家族成員的拓撲一致性如果家族內(nèi)多數(shù)成員是12次跨膜只有個別成員預測是10次一般優(yōu)先懷疑那個個別成員的序列質(zhì)量或注釋拼接有問題。8. 寫在最后我的幾條習慣建議把七庫串起來跑通之后我最大的體會是膜蛋白分析沒有銀彈靠的是交叉驗證。Uniprot的注釋再漂亮也要用InterPro和TCDB從家族層面復核TMHMM的預測再流暢也要回到PDB/OPM看有沒有結(jié)構(gòu)證據(jù)支持而所有這些序列水平的分析最終都要落到SURFY這類功能位點分析上才能真正對實驗設計產(chǎn)生價值。如果只讓我選兩個最重要的使用習慣第一個是永遠先判斷蛋白類型再選預測工具第二個是永遠用OPM做膜內(nèi)坐標而不是自己擺膜。這兩個點分別護住了“序列分析的邊界”和“結(jié)構(gòu)分析的基座”在實戰(zhàn)中幫我校正了絕大多數(shù)返工問題。最后再分享一個小技巧在做完一輪七庫分析后把每一步的關鍵結(jié)論整理成一張記錄表包括序列ID、螺旋數(shù)、家族分類、TC號、PDB條目、OPM膜取向參數(shù)、表面暴露候選區(qū)段。這張表就是你后續(xù)寫文章、做實驗設計、跟合作者溝通的統(tǒng)一語言能省掉無數(shù)翻歷史記錄的精力。這套流程我用了很多年期間數(shù)據(jù)庫本身也在不斷更新但“注釋—分類—結(jié)構(gòu)—預測”四層互證的思路始終沒變。你現(xiàn)在拿著這套方法從一條序列出發(fā)已經(jīng)足夠把膜蛋白的全貌理清楚了。接下來要做的就是帶上自己的數(shù)據(jù)去實戰(zhàn)跑一輪遇到具體問題再回頭翻這篇對應章節(jié)就行。