2015年11月7日 星期六

20151105 miRNA prediction & miRNA tools

上課講師:林威辰老師


如左圖 RNA 主要分成兩大類,一種是可以製造出蛋白的coding RNA,另一種則是無法轉錄出蛋白但卻具有功能的non-coding RNA,今天的miRNA就是其中的一員。





miRNA 是一個小片段的核酸,其主要功能就是抑制蛋白質的轉錄。
miRNA在成熟前的序列是hairpin的結構,在dicer的作用下,pre-miRNA會被切成小片段,將原本hairpin的結構切斷,進而變成mature miRNA。由於pre-miRNA是高度折疊的構造,我們可以從序列的折疊性判斷出是否有可能稱為miRNA,晚點會介紹有哪些網路上可以使用的工具。

miRNA有一個缺點,就是不一定會與target mRNA perfect match,所以從這個特性中可以了解到miRNA的專一性不高。
由於miRNA是阻斷mRNA轉錄成蛋白質,所以miRNA有一個重要的特性,即會降低蛋白質的表現量,但是卻不會影響目標mRNA的表達量。當mRNA的量保持不變或有上升的趨勢時,理應上升的蛋白質表現量卻下降了,藉此可以懷疑有miRNA的介入。(如上圖所示)

miRNA的介紹就先到這!接下來開始介紹幾個好用的網站。

1. RNAfold - 序列折疊程式 

顧名思義,就是預測RNA序列折疊的情況。點擊上方網址或載google直接搜尋"RNAfold"過後就可以看到上圖簡單明瞭的頁面。網頁中有一個可以讓我們貼上序列的格子,貼上去過後就勇敢的忽略下方的各種參數,直接點擊"Proceed>>"
你就會看到下圖的等待頁面,這個頁面很貼心的告訴你有多少人排隊等待結果,但是用了幾次後,發現好像沒幾個人在用這個工具,似乎只需要等待幾秒鐘就可以看到分析結果了。

以這條序列為例:事實上是我亂打的XD
agcugugucgauguguagcgacguacuguaccgaucguacguacguagugcuagcuaggcguacgauca

讓程式執行過後,輸出的結果如下圖:



可以看到圖中有"((..((((((..."的符號出現,這是利用符號讓使用者知道其配對的情況(這個有點難為什麼不用直接圖解就好=.=)

好啦,圖解版在下方,上面那段就忘掉吧~
圖解就好看多了對吧~~~
我亂打的序列配起來還不賴嘛!
對於miRNA來說,配對的情況越好,就越可能形成miRNA(應該是這樣XD)



序列的彩圖下方還可以修改一些顯示的參數以及輸出的格式。
EPS:輸出成.eps的檔案,用途不明
PDF:輸出成.pdf的文檔...我知道是廢話....就是pdf啦沒什麼好說的,不是彩圖
IMAGE CONVERTER:輸出成 .png & .gif 圖檔
FORNA:輸出成一個有點莫名的東西,動態圖..自己玩玩看吧~不知道意義在哪=.=

最後呢,有一個能量圖給使用者參考。對物理不是很在行,不知道怎麼看,當然不知道怎麼用,所以....就這樣吧。
RNAfold 就介紹到這邊!


2. miRBase - miRNA Database

這是其中一個miRNA的資料庫,裡面裝有許多的miRNA基本檔案。
下圖為首頁,如果知道有哪些miRNA,就直接在搜尋欄中搜尋即可。這裡以一個新手的角度去了解這個網站的運作。首先,新手一定不知道miRNA的名字是什麼!網站這裡很貼心地告訴新手miRNA的名稱到底長什麼樣子。
按下最右邊的 "Example" 就會告訴使用者 miRNA 的名稱應該是長什麼樣子的。
過後呢直接按 "Go" 就可以搜尋到使用者想要的miRNA的資料了。
以 "mir-181a" 這個 miRNA 來說,搜尋的結果如上圖所示,資料庫中有73筆資料,下方列出了所有找到的資料。
點擊第一筆資料為例,可以看到該miRNA的詳細資料,如物種及序列等資訊,點擊最下方的 "Get sequence" 就可以得到該miRNA的 FASTA sequence。

3. miRTarBase - miRNA Target Base (似乎是交通大學的網頁)

跟miRBase是一樣的性質,只是界面有些不同。
下圖是首頁,一樣有新手使用的路徑XD
這邊以hsa-mir-377這個miRNA為搜尋條件(hsa是指人類的意思,P.S: miRNA在人類系統內研究較為透徹)
搜尋後可以看到表格式的結果,其中還說明了是利用哪一種實驗方式驗證、論文發表多少次等。在實驗驗證方面,大部分是以NGS的方式驗證,可信度比較低,只有少部分是以Western Blot等技術實際驗證,可信度比NGS高出許多。
點擊其中一個鏈接後,可以看到該miRNA的詳細資料(個人覺得比miRBase詳細),如下圖中綠色標記的miRNA名稱、與哪些疾病相關、miRNA的序列、有哪些target sequences等。


4. RNA22 - Target sequence prediction

這個網頁可以將同時將多個miRNA與target sequence做預測。
下圖為其執行前頁面,紅色框框內可以選著例子,或者是直接在格子內輸入自己的miRNA以及目標sequence。
輸入完畢後,視自己的需求修改下方的參數設定,若沒有什麼修改則直接點選"submit"即可。
執行過後便會輸出分析結果(如下圖)。
如下圖所示,預測會出現兩個miRNA binding sequences,分別是在289及1288的位置。
miRNA的分析工具大致上介紹到這..覺得累 Zzzzz....







2015年10月29日 星期四

關鍵字的重要性

youtube BLAST NCBI

Text mining

布林演算法
chilibot: 關鍵字之間的關係

Pubmed PubReminer (http://hgserver2.amc.nl/cgi-bin/miner/miner2.cgi)


















這個網頁可以隨著年代分析兩個或以上關鍵字之間的關係




















執行後可以看到年代、期刊、作者、研究關鍵字等,可以從中了解到先關領域的研究方向等資訊。





www.genecards.org

Blast 不是同一個物種的(10條到20條)

SMS2

SMS2網址



















A:據說要把網頁的所有東西做過一邊耶....
B:看起來不多噢!做做看吧...
幾分鐘後.....
A:誒,你做到哪了?
B:Zzzzzzz........
A:.........ZZzzzzzzz....


未完待續....

2015年10月15日 星期四

製作演化樹的簡單做法

物種的演化樹
必備的材料當然是有興趣的物種的核酸或蛋白質序列了!
有了序列過後,強大的工具也是必須的。
今天所學到的工具有:
BioEdit
Phylip
TreeView
Hypertree


BioEdit
一開始使用一組已知序列 (SEQ01~SEQ10)
在安裝好BioEdit過後開啟
開啟新的Alignment


















新的Alignment打開後,左上角的File才會出現“import”字樣,選擇"Sequence alignment file".


在文件類型中,選擇 "All Files",才可以看到想要使用的檔案( .fasta)



打開後,即可看到下圖排列整齊的序列

隨後就是將這十組序列排列整齊,我們使用 "ClusterW" 的工具將序列排列整齊




在開始RUN之前,先將"Bootstrap"取消勾選,因為之後再分析時會在使用一次。



開始RUN過後,就可以看到序列已經排列整齊了。



將分析的結果存起來,存檔時選擇 "Phylip 4" 的格式

這樣就完成BioEdit的部分了。
到這裡會得到一個 .phy 的檔案,作為後續分析的一個模板。


Phylip
第一次使用Phylip時,覺得這是個神奇的工具,整個文件夾內包含了許多的程式。
至於有哪些程式,就不一一說明了,壓縮檔載了自己試。

所有的步驟都跟著以下這張圖為主



















將BioEdit的輸出檔案應用在此軟體中,不過有個重要細節要改變。
BioEdit輸出檔案的檔名的副檔名為 .phy,Phylip內的程式的輸入檔都是使用 "infile" 這個不包含副檔名的檔名。
Ex:
以BioEdit輸出檔 " Test01.phy" 為例,其檔名需改成 "infile" 且不含有任何副檔名,才能讓phylip中的程式所讀取。









若用NotePad打開"infile",可以看到與BioEdit界面內ClusterW執行後相似的畫面



















檔名修改完畢後,直接打開"seqboot.exe"


phylip內的軟體特別的地方就是都是指令界面,不是一般常見的圖形界面。
使用起來很新穎但是卻不容易判別指令與其對應的內容。
下圖:seqboot.exe的工作界面。



















按D:選擇輸入檔案內容的種類
按J:選擇功能
按R:選擇複製的次數
按Y:確認並執行

接著會問進一步的問題,如下圖所示,程式詢問"Random number seed"并指定奇數,通常都會用"1"。



















確認後就會執行,執行完畢後便會自動輸出一個"outfile"的檔案。









用NotePad打開"outfile"可以看到一百次類似于"infile"的內容。



















在執行另一個程式前,需將檔名從"outfile"改成"infile",但是這會取代之前使用的"infile",所以在改"outfile"前,先改舊的"infile",通常會在後面加"01",方便留存。

接下來又回到流程圖了。這時候有兩個選擇:
1. Distance-Based method 橙框(上)
2. Character-Based method 橙框(下)
現在以 Distance-Based method 為主,先以 "PROTDIST.EXE" 為例,主要計算目標蛋白在演化上的距離。
打開後界面就跟 "seqboot.exe" 打開後的界面一樣,視窗裡面有多個狀態欄,可以讓你知道一些分析的設定值。以 "M" 為例,程式詢問 "infile" 的內容是否是多組的資料。答案是 "YES",因為我們在 "Seqboot.exe" 那裡已經設定了重複了100次的隨機排序。
設定 "M" 的方法也很簡單,直接在鍵盤上按 "m" 建並確定就好了。確定過後如下圖,程式會再問是哪種multiple數據,回答後再接著問一共有多少組數據。這時候應該回答的答案就要與 "Seqboot.exe" 里設定的次數是一樣的。


















這時候程式需要一點時間才能完成它的任務,所需的時間由數據的數量決定。



















終於............結束了!其實也沒有跑很久啦~~~
結束的畫面就這樣啦~最後會得到一個 "outfile" 啦~~
然後就照著視窗裡面的指令 "Press enter to quit." 來結束程式吧~



















確認一下程式的輸出文件 "outfile" 。
如下圖所示,一堆意義不明的數字!=.=
其實是序列之間的距離,可以不用管它,做到最後就知道了。



















接下來就是跟之前一樣,將 "outfile" 改成 "infile"...前,先把之前的 "infile" 改成 "infile02",至於為什麼是 "02" 不是 "01",你就勇敢地試試看你就知道了!
改完名字後,打開 "neighbor.exe" 。
右邊兩個反白的文件是neighbor.exe的輸出檔,在這裡沒什麼作用,不要理他XD









打開後可以看到下方的視窗,"N" 選項中有 "Neighbor-joining" OR "UPGMA" 兩種分析設定,通常比較常用前者,"UPGMA"的用途尚不知。
跟前面的步驟一樣,選擇 "M" 修改,並輸入之前設定的"100",外加上隨機參數 "1" (可隨意設定,但必須是奇數)
全部設定完成後,就直接按 "Y" 開始執行,執行過程迅速,結束畫面如下圖。這時候出現了兩個輸出檔案,一個是 "outfile" 另一個是 "outtree"。
用Notepad將 "outfile" 打開後,可以看到許多樹狀圖,但那並不是我們想要的,而是100筆數據隨機組合而成,但並不是最終想要的樹狀圖。



















同樣的方式再打開 "outtree",可以看到跟 "infile" 差不多但是更緊密的數字海....
雖然無法很明瞭地看懂其中的意義,但是可以觀察到多了許多括號,這些括號可能是說明樹狀結構的關係。
沒有什麼意義的 "outfile" 就可以果斷的刪除吧~因為之後沒什麼用了。
最後再把 "outtree" 改成 "intree" 。
將 "Consense.exe" 打開,這個程式只會打開 "intree" 檔案,並不會打開 "infile" 檔案,所以不需要先將之前的 "infile" 更改名字。
"Consense.exe" 的視窗更簡單,且不需要更改任何設定就可執行。
直接按 "Y" 開始執行,結束後輸出檔案跟上一個程式輸出的一模一樣,都有 "outfile" & "outtree"。

一樣來看一下 "consense.exe" 的輸出檔 "outfile" 以及 "outtree" 的內容。
首先是 "outfile",結果已經不像之前的 "outfile" 那樣密密麻麻且看不出所以然的數字了,而且最後還把序列之間的關係畫出來並顯示出序列之間的距離。


接下來換成 "outtree" 。
打開後發現內容就只有區區的三行罷了!
"outtree" 是作為 phylip分析過程中最後一個產物,也是產生 "tree" 的一個重要的數據。
在phylip之後,就是 "tree" 的呈現了。
這時候有兩個軟體可以呈現 "tree" :
1. "TreeView"
2. "HyperTree"
各有各的用法,接下來再介紹一下可以產生出什麼樣的 "tree" 。

TreeView
安裝完畢後直接開啟桌面的圖示或是在安裝文件夾內打開 "tv.exe",即可看到以下視窗
將 Phylip 的產物 "outtree" 直接拖進 "treeview" 的視窗內即可打開檔案。
在視窗上方的工具列上可以找到不同類型的 "tree" 可供切換,結果如同以下三張:















前兩張的差異在於其呈現圖形,而第三張與前兩張的差異則在於存在著 “距離” 的單位。


HyperTree
這個軟體不需要進一步的安裝(portable),打開後就可以直接用了。
打開後就馬上發現這個軟體沒辦法實現快速打開檔案,需要一步一步的透過程式內的 “開啟檔案” 功能才能順利打開檔案。以下目睹軟體的英姿:
打開後即可看到特別不一樣的 "tree"。這個 "tree" 有個神奇的地方,可以隨意切換視角!看起來就非常吸引使用者。

最後,一樣有好幾種呈現方式可以選擇。不過跟 "treeview" 不同,就是這是個無“根” "tree"。

視乎....是大功告成了!
讓我再仔細想想還有什麼需要補充的................