遺伝子変異の周辺配列を取得する方法|NCBIでゲノム座標を調べてFASTAを取得する

NCBI・配列解析

この記事でできるようになること
NM_000546.6:c.574C>Tを例に、変異のゲノム座標を確認し、その周辺のDNA配列をFASTA形式で取得します。

今回やりたいこと

今回の記事の大まかな流れは次の通りです。

今回は例として、TP53の変異

NM_000546.6:c.574C>T

を使用します。

これまでの記事で、この変異はNM_000546.6のmRNA上では716番目の塩基に位置し、exon 6に含まれることを確認しました。

※データベースや文献によっては、この領域が「coding exon 5」と記載されていることがあります。これはCDSを含むexonのみを数えた場合の番号です。
本記事では、NM_000546.6のmRNA全体を基準としたexon番号を使用しているため、exon 6と表記します。

ここまでの調べ方については、こちらの記事で詳しく解説しています。
👉 遺伝子変異の場所の見つけ方|NCBIでc.表記から塩基位置を調べてみよう
👉 変異は何番exonにある?NCBIでexonを調べる方法

では、この変異をゲノムDNAを鋳型としたPCRで調べたい場合はどうすればよいでしょうか。

例えば、変異を含むexonの周辺にプライマーを設計するには、mRNA上の位置だけでなく、ゲノムDNA上の位置と、その周辺の塩基配列を知る必要があります。

そこで今回は、

mRNA上で確認した変異は、ゲノムDNA上ではどこにあるのか?

をNCBIで確認し、最後に変異周辺のゲノムDNA配列をFASTA形式で取得します。

mRNAの座標とゲノムの座標は違う

ここで注意したいのが、mRNAとゲノムDNAでは座標が違うことです。

例えば、血液などの試料から抽出してPCRの鋳型として使うゲノムDNAには、exonだけでなくintronなども含まれています。一方、成熟mRNAではintronが取り除かれ、exon同士がつながっています。

詳しいexonとintronの違いについてはこちらで解説しています。
👉 エクソンとイントロンとは?NCBIで実際の遺伝子を見てみよう

イメージとしては、ゲノムDNAが「撮影した動画の全素材」なら、mRNAは必要な場面をつないだ「編集済み動画」のようなものです。

同じ場面でも、「元動画の何分何秒か」と「編集済み動画の何分何秒か」では位置が変わります。

遺伝子の座標も同じです。

今回の変異はNM_000546.6のmRNA上では716番目にありますが、ゲノムDNA上の716番目にあるわけではありません。

NM_000546.6は、今回の変異の位置を示す基準となるtranscript(mRNA配列)です。
c.574C>Tは、この配列を基準に記述されています。

そこでまずmRNA上で変異の位置を確認し、そこから対応するゲノム上の位置を確認すると考えると分かりやすくなります。

では、mRNA上の716番目は、ゲノム上ではどこにあるのでしょうか?

NCBIのGenome Data Viewerで確認してみます。

Genome Data Viewerでは染色体上の座標を見る

まずGenome Data ViewerでTP53を見てみます。
👉https://www.ncbi.nlm.nih.gov/gdv/browser/nucleotide/?id=NM_000546.6
TP53遺伝子は17番染色体上にあるため、Genome Data Viewerでは17番染色体上のTP53の位置が表示されます。

すると以下のような部分があります。

画像に表示されているNC_000017.11は、ヒト17番染色体の参照配列を表しています。その後ろに表示されている数字は、この参照配列上で何番目の塩基にあたるのかを示すゲノム座標です。
ここではNC_000017.11を、「今回基準として使っている17番染色体の配列」くらいに考えておけば大丈夫です。

つまり、この画面では17番染色体の

7,674,846番目~7,674,984番目の塩基

を表示しています。

次に、画像のcds rangeを見てみます。

これは、この参照配列上でTP53のexon 6のCDS部分が、

7,674,859番目~7,674,971番目

に位置することを示しています。
今回のexon 6では、このCDS部分の長さは113 bpです。

7,674,971 − 7,674,859 + 1 = 113 bp

ここで、mRNA上の座標と比較してみます。

前回、NM_000546.6のexon 6は、mRNA上の702~814にあることを確認しました。
👉https://www.ncbi.nlm.nih.gov/nuccore/NM_000546.6

mRNA上のexon6の長さは、

814 − 702 + 1 = 113 bp

です。

つまり、同じ113塩基を、mRNAとゲノムDNAという異なる座標軸で見ているわけです。
ただし、TP53ではこの2つの座標の向きが逆になります。これについては次の章で確認します。

mRNA上では 702~814
ゲノム上では 7,674,859~7,674,971

動画編集に例えるなら、

  • mRNA上の座標
    → 編集済み動画の「何秒目か」
  • ゲノム座標
    → 元動画の「何秒目か」

のようなものです。

同じ場面を指していても、基準となる動画が違うため、位置を表す数字も変わります。

※なお、GDVに表示されているcds rangeは、厳密にはexon全体ではなくCDSにあたる範囲です。今回のexon 6ではexon全体がCDSに含まれるため、どちらも113 bpになりますが、UTRを含むexonではexon全体の範囲とcds rangeは一致しません。

rangeとcds rangeの違いについては、別の記事で詳しく解説します。

変異はゲノム座標のどこにある?

では次に、今回の変異がゲノム座標のどこにあるのかを考えてみます。


まず、今回の変異はNM_000546.6のmRNA上で716番目にあることが分かっています。

そしてexon 6は、mRNA上の702~814番目の塩基で構成されています。

ということは、

716 − 702 = 14

なので、716番目の塩基は、exon 6の先頭である702番目から14 bp離れた位置にあります。

言い換えると、exon 6の15番目の塩基です。

マイナス鎖では向きに注意する

Genome Data Viewerを見ると、TP53の矢印は「←」を向いています。

これは、TP53がマイナス鎖(reverse strand)にあることを示しています。

今回のexon 6のゲノム座標は、7,674,859~7,674,971です。

ここで注意したいのは、mRNA上のexonの先頭が、必ずゲノム座標の小さい側に対応するわけではないことです。

TP53はマイナス鎖にあるため、今回のexon 6では、mRNA上の先頭である702番目は、ゲノム座標の大きい側である7,674,971に対応します。

プラス鎖・マイナス鎖と5′→3′方向については、別の記事で詳しく解説しています。
👉プラス鎖・マイナス鎖とは?mRNAとゲノム座標の向きを初心者向けに解説(coming soon)

今回の変異は、exon 6の先頭から14 bp離れた位置にあります。TP53ではmRNA上を先へ進むと対応するゲノム座標は小さくなるため、

7,674,971 − 14 = 7,674,957

となります。

したがって、今回の変異はゲノム上では、

NC_000017.11の7,674,957番目

に位置することが分かります。

これでようやく、「大元の動画のどの部分を見ればよいのか」が分かったことになります。

ClinVarで答え合わせをしてみる

自分で計算した変異の位置が合っているか、ClinVarで確認してみます。

👉 ClinVar:NM_000546.6(TP53):c.574C>T

ClinVarのHGVS表記を確認すると、

NC_000017.11:g.7674957G>A

と記載されています。

NC_000017.11は、先ほどGenome Data Viewerで確認した17番染色体の参照配列です。

そしてg.7674957から、ゲノム上の変異位置が7,674,957番目であることが分かります。

先ほど計算した、

7,674,971 − 14 = 7,674,957

と一致しました。

これで、

mRNA上の716番目 → ゲノム上の7,674,957番目

という対応をClinVarでも確認できました。

ちなみに、もとの変異はC>Tなのに、ゲノム上ではG>Aと表記されています。

これはTP53がマイナス鎖にあることが関係しています。
👉 なぜC>TがG>Aになる?マイナス鎖と相補鎖の考え方(coming soon)

今回は、同じ変異でも基準とする配列によって表記が変わることがあるとだけ押さえて、先に進みます。

じゃあ最初からClinVarを見ればいいのでは?

ここまで計算しておいて何ですが、ClinVarに登録されている変異であれば、ゲノム上の位置をClinVarから確認できる場合があります。

今回も、NM_000546.6:c.574C>Tに対応するゲノム表記として、

NC_000017.11:g.7674957G>A

が記載されています。

つまり、ゲノム座標を知りたいだけなら、毎回手計算する必要はありません。

今回あえて計算したのは、mRNA上の位置とゲノム上の位置がどのように対応しているのかを理解するためです。

実際の作業ではデータベースを利用しつつ、「なぜこの座標になるのだろう?」と思ったときに、mRNAとゲノムDNAの対応関係を確認できるようにしておくと安心です。

なお、ClinVarにすべての変異が登録されているわけではない点も注意が必要です。

変異周辺の配列をFASTA形式で取得する

ここまでまじめに読んでくださった方は、計算がたくさん並んで、矢印の向きまで追いかけて頭がパンクしそうになっているかもしれません。

筆者も混乱しながら書きました。お付き合いいただいてありがとうございます。

ここまでで、今回の変異がゲノム上の7,674,957番目にあることが分かりました。

せっかくここまでゲノム座標を調べたので、最後にこの数字を実際に使ってみます。

今回やりたかったのは、この変異周辺のゲノムDNA配列を取得することです。

今回は、変異の前後約200 bpを含む範囲を取得してみます。

変異の前後200 bpなので、

  • 7,674,957 − 200 = 7,674,757
  • 7,674,957 + 200 = 7,675,157

したがって、今回は

7,674,757~7,675,157

の範囲を指定します。

両端の塩基を含めると、

7,675,157 − 7,674,757 + 1 = 401 bp

の配列になります。

つまり、長い17番染色体の中から、

「今日はこの範囲の塩基配列をください」

と指定して、必要な部分だけを取り出すイメージです。

取得する配列は、FASTA形式で表示します。

FASTA形式とは、

>配列についての情報
ATGCATGCATGCATGCATGC……

のように、配列についての情報と塩基配列を記載したシンプルな形式です。

では最後に、7,674,757~7,675,157の範囲を指定して、実際にFASTA形式で取得してみましょう。

17番染色体の参照配列を開く

NCBIのNucleotideでNC_000017.11を検索します。

すると、

Homo sapiens chromosome 17, GRCh38.p14 Primary Assembly

というレコードが表示されます。

ここでは、

「NC_000017.11は今回使っている17番染色体の参照配列」

くらいに考えておけば大丈夫です。

GRCh38やNC_000017.11については少し話が長くなるので、別の記事で詳しく説明します。

取得したい範囲を指定する

NC_000017.11のレコードを開いたら、画面右側にあるChange region shownを開きます。

「Selected region」を選択して、

from:7674757
to:7675157

と入力します。座標にはカンマを入れません。

そしてUpdate Viewをクリックします。

これで、17番染色体全体ではなく、今回指定した変異周辺の領域だけを表示できます。

FASTA形式で表示する

範囲を指定できたら、表示形式をFASTAに変更します。

すると、指定した範囲の塩基配列が表示されます。

出ました!

これが、今回探していた変異周辺のゲノムDNA配列です。

最初に見ていた

NM_000546.6:c.574C>T

という変異情報から、

mRNA上の位置を確認する
→ exonを確認する
→ ゲノム座標を求める
→ 変異周辺のゲノムDNA配列を取得する

ところまでたどり着くことができました。

こうしてFASTA形式で配列を取得できれば、次はこの配列を使ってPCRプライマーの設計に進むことができます。

まとめ

今回は、NM_000546.6:c.574C>Tを例に、mRNA上の変異位置からゲノム座標を確認し、変異周辺のゲノムDNA配列をFASTA形式で取得しました。

  • c.574C>Tは、mRNAでは716番目にあたる
  • mRNA 716番目はexon 6にある
  • exon 6はゲノム上の7,674,859~7,674,971にある
  • TP53はマイナス鎖にあるため、mRNA上のexon 6の先頭(702番目)は、ゲノム座標の大きい側7,674,971に対応する
  • そこから変異位置を求めると、ゲノム上の7,674,957番目になる
  • ClinVarでも同じゲノム座標であることを確認できた
  • 変異の前後約200 bpを指定し、周辺配列をFASTA形式で取得できた

つまり、mRNA上の座標とゲノムDNA上の座標は別物です。

mRNA上で見つけた変異がゲノムDNA上のどこにあるのかを確認できれば、必要な周辺配列を取り出し、次のPCRプライマー設計へ進むことができます。

タイトルとURLをコピーしました