分子細胞生物学 · 3
ヒトゲノムの構造:コード配列と調節配列;非コードゲノム配列:イントロン・偽遺伝子・反復配列(EM学生のみ)
Structure of the human genome: coding and regulatory sequences; noncoding genomic sequences: introns, pseudogenes, repetitive sequences (only for EM-students)
🧠 ヒトゲノムはわずか1.5〜2%だけがタンパク質をコードし、残り98%以上は「制御配列(プロモーター・エンハンサーenhancerエンハンサー(enhancer)enhancer(エンハンサー))」「イントロン」「偽遺伝子pseudogene偽遺伝子(pseudogene)pseudogene(偽遺伝子)」「反復配列repetitive sequence反復配列(repetitive sequence)repetitive sequence(反復配列)」という非コードDNADNA(deoxyribonucleic acid)で占められる。 この「ほとんどがコードしていない」という事実こそが、ゲノムを理解する出発点である——非コード領域は単なる「ジャンク」ではなく、転写のオン/オフを決める調節スイッチや、進化の副産物としてのコピー・ミスの痕跡として機能している。
ヒト遺伝子構造
1つの遺伝子は5′調節領域(エンハンサーenhancerエンハンサー(enhancer)enhancer(エンハンサー)、TATA-box、転写因子結合部位)→転写開始 transcription initiation 転写開始(transcription initiation) transcription initiation(転写開始) 部位→エキソン exon エキソン(exon) exon(エキソン) -イントロンが交互 alternating 交互(alternating) alternating(交互) に並ぶ転写領域(5′UTR、翻訳開始translation initiation 翻訳開始(translation initiation)translation initiation(翻訳開始) 部位、翻訳終結/ポリアデニル化シグナルpolyadenylation signalポリアデニル化シグナル(polyadenylation signal)polyadenylation signal(ポリアデニル化シグナル)、3′UTR)という構成を取る。
調節配列
調節配列regulatory sequence 調節配列(regulatory sequence)regulatory sequence(調節配列) とは、生物内の特定遺伝子の発現を増加または減少させる能力を持つ(核酸分子の)セグメントである。多くは調節対象遺伝子の転写開始 transcription initiation 転写開始(transcription initiation) transcription initiation(転写開始) 点の5′側にあるが、3′側に存在することもある。調節遺伝子regulator gene 調節遺伝子(regulator gene)regulator gene(調節遺伝子) は、調節対象となる遺伝子(オペレーターoperator オペレーター(operator)operator(オペレーター) 遺伝子、operator gene、例:lacオペロン)に対する活性化因子/抑制因子repressor 抑制因子(repressor)repressor(抑制因子) タンパク質をコードしうる。
シス因子
シス調節因子cis regulatory element シス調節因子(cis regulatory element)cis regulatory element(シス調節因子) は非コードDNA領域であり、近傍遺伝子の転写を調節する。遺伝子の近傍(多くは上流)に存在し、転写因子の結合部位として機能する。
| 因子 | 内容 |
|---|---|
| コアプロモーターcore promoterコアプロモーター(core promoter)core promoter(コアプロモーター) | 特定遺伝子の転写を開始するDNA領域。センス鎖の5′側(上流)に位置し、約100〜1000 bp(TATA-boxを含む)。RNARNA(ribonucleic acid)ポリメラーゼII・転写因子の結合部位。TATA-boxは遺伝子配列の読み取り開始位置を示すDNA配列 |
| プロキシマルプロモーターproximal promoterプロキシマルプロモーター(proximal promoter)proximal promoter(プロキシマルプロモーター) | コアプロモーターcore promoter コアプロモーター(core promoter)core promoter(コアプロモーター) 近傍(上流)の領域。転写因子群と組織特異的転写単位の結合部位を含む |
| UTR(非翻訳領域untranslated region非翻訳領域(untranslated region)untranslated region(非翻訳領域)、untranslated region) | 転写はされるがタンパク質配列には翻訳されない(アミノ酸をコードしない)。5′・3′両端に存在し、エキソンexon エキソン(exon)exon(エキソン) の一部 |
| エンハンサーenhancerエンハンサー(enhancer)enhancer(エンハンサー) | 50〜1500 bpの短いDNA領域。活性化因子タンパク質が結合し特定遺伝子の転写確率を高める(プロモーターを「オン」にする) |
| サイレンサーsilencerサイレンサー(silencer)silencer(サイレンサー) | 抑制因子repressor 抑制因子(repressor)repressor(抑制因子) と呼ばれる転写調節因子 transcription factor 転写調節因子(transcription factor) transcription factor(転写調節因子) が結合するDNA配列。プロモーターを「オフ」にする |
トランス因子
トランス調節因子trans-regulatory element トランス調節因子(trans-regulatory element)trans-regulatory element(トランス調節因子) とは、離れた遺伝子の転写を調節しうる遺伝子である。より具体的には、転写因子をコードするDNA配列を指す。
その他の要素
- CpG部位:シトシンの直後にグアニン guanine グアニン(guanine) guanine(グアニン) が続く配列。多くのタンパク質コード遺伝子の転写開始 transcription initiation 転写開始(transcription initiation) transcription initiation(転写開始) 点は、CG配列の頻度が異常に高い100〜1000 bp領域(CpGアイランドCpG islandCpGアイランド(CpG island)CpG island(CpGアイランド)、CpG island)内に散在する。ヒトではCpG部位のシトシン残基のピリミジン環5′位でDNAメチル化が起こり5′-メチルシトシンを形成する
- SAR/MAR(scaffold/matrix attachment region):真核染色体DNA中で核マトリックスが付着する配列。染色体の構造維持に重要
ゲノム配列の分類
タンパク質コード領域(DNAのコード領域)の転写産物は、最終的に細胞質で1本のmRNA分子として現れるが、真核ゲノム nuclear genome 核ゲノム(nuclear genome) nuclear genome(核ゲノム) では通常、大きな非コードDNAの介在配列によって中断されている。
コード配列
エキソンexonエキソン(exon)exon(エキソン):成熟RNAの一部をコードする遺伝子配列。ヒトゲノムのうちタンパク質をコードするのはわずか1.5〜2%のみ——大部分はコード以外の機能を担う。5′端は開始コドン start codon 開始コドン(start codon) start codon(開始コドン) (真核生物ではAUG=Met)、3′端は終止コドン stop codon 終止コドン(stop codon) stop codon(終止コドン) で区切られ、終止コドンstop codon 終止コドン(stop codon)stop codon(終止コドン) はリリースファクター release factor リリースファクター(release factor) release factor(リリースファクター) の結合を介して翻訳を終結させ、リボソームサブユニットribosomal subunit リボソームサブユニット(ribosomal subunit)ribosomal subunit(リボソームサブユニット) をmRNAから解離させる。
⚠️ 「1.5〜2%」はタンパク質コード配列 coding sequence コード配列(coding sequence) coding sequence(コード配列) の割合であって、「RNAになるのは2%だけ」という意味ではない。 ENCODEプロジェクトによるヒト細胞の網羅的転写産物解析では、ヒトゲノムの約4分の3が転写されうることが示された1。「コードするのは1.5〜2%」と「転写されるのは約75%」は矛盾せず、その差を埋めているのが大量の非コードRNAである。この結果は「遺伝子」という概念そのものの再定義を促すものとされた——非コードDNAを「転写もされない余り」と捉えるのは誤りである。
非コードゲノム配列
タンパク質配列をコードしないDNA成分。①イントロン、②偽遺伝子 pseudogene偽遺伝子(pseudogene) pseudogene(偽遺伝子)、③反復配列 repetitive sequence反復配列(repetitive sequence) repetitive sequence(反復配列)がこれに含まれる。
① イントロン:成熟RNA産物の生成過程でRNAスプライシングにより除去されるヌクレオチド配列。mRNAが細胞質へ輸送される前に、核内のmRNAプロセシング中に除去される。一部のイントロンは、スプライシング後にさらに加工されて機能的な非コードRNA分子を生成することもある。
② 偽遺伝子pseudogene偽遺伝子(pseudogene)pseudogene(偽遺伝子):機能遺伝子によく似たDNA配列だが、多数の変異により正常な発現・機能を妨げられているもの。ヒトゲノムには約18,000個存在する。
偽遺伝子pseudogene 偽遺伝子(pseudogene)pseudogene(偽遺伝子) の役割:
- mRNAへ転写され、miRNA(マイクロRNAmicroRNAマイクロRNA(microRNA)microRNA(マイクロRNA))を引き寄せる「おとりmRNA(decoy mRNA)」として本来の(野生型)アレルの発現を間接的に高めうる——このおとり機構は偽遺伝子 pseudogene 偽遺伝子(pseudogene) pseudogene(偽遺伝子) 発現が増加した場合、癌細胞の進行性を高める道具 tool 道具(tool) tool(道具) にもなりうる
- その転写産物がsiRNA(低分子干渉RNA、small interfering RNA)へ加工されうる——siRNAはmiRNAと同様の二本鎖RNA double-stranded RNA 二本鎖RNA(double-stranded RNA) double-stranded RNA(二本鎖RNA) 分子群で、相補的ヌクレオチド配列を持つ特定遺伝子の発現に干渉し、転写後にmRNAを分解して翻訳を阻害する
偽遺伝子pseudogene 偽遺伝子(pseudogene)pseudogene(偽遺伝子) のタイプ(下表の4種。NUMTを別枠として扱い「3タイプ」と数える教科書もある):
| タイプ | 特徴 |
|---|---|
| プロセス型偽遺伝子processed pseudogeneプロセス型偽遺伝子(processed pseudogene)processed pseudogene(プロセス型偽遺伝子) | 逆転写酵素により生成されたcDNA(相補的DNA)がヒトゲノムへ再組み込みされたもの。ポリA尾部を持つがmRNAにイントロンを含まない。変異や固有プロモーターの欠如により発現しない |
| 重複型偽遺伝子duplicated pseudogene重複型偽遺伝子(duplicated pseudogene)duplicated pseudogene(重複型偽遺伝子) | 遺伝子重複により生じ変異を蔵する。機能的な「母」遺伝子の近傍に見られ、エキソンexon エキソン(exon)exon(エキソン) -イントロン構造を保持。DNAポリメラーゼによるコピー過程での誤りが発現を妨げる |
| 孤発型偽遺伝子solitary pseudogene 孤発型偽遺伝子(solitary pseudogene)solitary pseudogene(孤発型偽遺伝子) (単一型、unitary pseudogene) | かつて機能していた遺伝子そのものが機能喪失変異 loss-of-function variant 機能喪失変異(loss-of-function variant) loss-of-function variant(機能喪失変異) を蓄積して不活化したもので、ゲノム内に機能的な対応物(「母」遺伝子)を持たない。代表例がL-グロノ-γ-ラクトン酸化酵素遺伝子——ヒトではこの遺伝子が多数の変異を蓄積して偽遺伝子 pseudogene 偽遺伝子(pseudogene) pseudogene(偽遺伝子) となっており、ヒトがビタミンC(アスコルビン酸ascorbic acid (vitamin C)アスコルビン酸(ascorbic acid (vitamin C))ascorbic acid (vitamin C)(アスコルビン酸))を自力で合成できない分子的理由になっている2 |
| NUMT(核内ミトコンドリア)偽遺伝子 pseudogene偽遺伝子(pseudogene) pseudogene(偽遺伝子) | ミトコンドリア遺伝子mitochondrial gene ミトコンドリア遺伝子(mitochondrial gene)mitochondrial gene(ミトコンドリア遺伝子) の一部が核へ逃避 escape逃避(escape) escape(逃避)・移動し活性化されたもの——ヒトDNA中のミトコンドリアDNA mitochondrial DNAミトコンドリアDNA(mitochondrial DNA) mitochondrial DNA(ミトコンドリアDNA) |
③ 反復配列repetitive sequence反復配列(repetitive sequence)repetitive sequence(反復配列):ゲノム全体に複数コピーで存在するパターンを持つ核酸。タンデム反復tandem repeat タンデム反復(tandem repeat)tandem repeat(タンデム反復) 配列の配列、またはゲノム全体に分散した反復配列 repetitive sequence 反復配列(repetitive sequence) repetitive sequence(反復配列) として存在する。
サテライトsatellite (satellite DNA) サテライト(satellite (satellite DNA))satellite (satellite DNA)(サテライト) DNA(satellite DNA、タンデム反復tandem repeatタンデム反復(tandem repeat)tandem repeat(タンデム反復)):1つ以上のヌクレオチドのパターンが直接隣接して反復するもの。比較的短い配列の完全または準完全な反復からなる。
| 種類 | 特徴 |
|---|---|
| マイクロサテライトmicrosatelliteマイクロサテライト(microsatellite)microsatellite(マイクロサテライト) | 反復DNAの一区画で、DNAモチーフ(長さ2〜5 bp)が典型的には5〜50回反復する。ゲノム中の数千箇所に存在し、他領域より変異率が高い(マイクロサテライト不安定性microsatellite instability, MSI マイクロサテライト不安定性(microsatellite instability, MSI)microsatellite instability, MSI(マイクロサテライト不安定性) は腫瘍促進性 facilitatory 促進性(facilitatory) facilitatory(促進性) 複製エラーのマーカー)——遺伝的多様性の高さの一因。法医学forensic medicine 法医学(forensic medicine)forensic medicine(法医学) 的同定・親子鑑定paternity test 親子鑑定(paternity test)paternity test(親子鑑定) に応用 |
| テロメア | 染色体両端に存在。TTAGGG六ヌクレオチドの反復(1〜1.5万bp)。細胞分裂cell division 細胞分裂(cell division)cell division(細胞分裂) ごとに短縮するため、テロメラーゼtelomerase テロメラーゼ(telomerase)telomerase(テロメラーゼ) がこれを延長する——ただしこの酵素は正常な体細胞組織では強く抑制されており、この短縮がヒトの寿命に限界を設けている(07-telomeric-repeat-sequences-replication-of-the-telomeric-regions-of-eukaryotic参照) |
| セントロメアcentromereセントロメア(centromere)centromere(セントロメア) | キネトコア複合体kinetochore complex キネトコア複合体(kinetochore complex)kinetochore complex(キネトコア複合体) が染色体に付着する部位。171 bp長のAT豊富配列のタンデム反復 tandem repeatタンデム反復(tandem repeat) tandem repeat(タンデム反復)。複数の171 bp単位が1〜3 kbのHOR(高次higher order 高次(higher order)higher order(高次) 反復、higher-order repeat)を形成し、その反復が0.5〜5 Mbのセントロメア centromere セントロメア(centromere) centromere(セントロメア) 座を形成する |
⚠️ 「テロメラーゼtelomerase テロメラーゼ(telomerase)telomerase(テロメラーゼ) は胚性幹細胞 embryonic stem cell 胚性幹細胞(embryonic stem cell) embryonic stem cell(胚性幹細胞) でのみ発現する」と覚えない。 高感度なテロメラーゼ telomerase テロメラーゼ(telomerase) telomerase(テロメラーゼ) 活性測定では、正常体細胞組織50検体はすべて陰性だった一方、正常な卵巣・精巣(生殖系列)は陽性であり、不死化immortalization 不死化(immortalization)immortalization(不死化) 細胞株 cell line 細胞株(cell line) cell line(細胞株) 100株のうち98株、12種類のヒト腫瘍の生検101検体のうち90検体が陽性だった3。正しくは「生殖系列・幹細胞区画では活性、正常体細胞では抑制、癌では再活性化」と三分して整理する。腫瘍の約9割でテロメラーゼ telomerase テロメラーゼ(telomerase) telomerase(テロメラーゼ) が再活性化しているという点が臨床的に最も重要である。
💡 反復配列repetitive sequence 反復配列(repetitive sequence)repetitive sequence(反復配列) の実像 real image 実像(real image) real image(実像) は2022年のT2T(telomere-to-telomere)完全ゲノムで初めて確定した。 2000年以来のヒト参照ゲノムはユークロマチン euchromatin ユークロマチン(euchromatin) euchromatin(ユークロマチン) 部分しか覆っておらず、残る約8%——まさにセントロメア centromere セントロメア(centromere) centromere(セントロメア) のサテライト satellite (satellite DNA) サテライト(satellite (satellite DNA)) satellite (satellite DNA)(サテライト) 反復や末端部——が未完成のまま残されていた。T2T-CHM13は3.055 Gbのギャップの無い配列としてこれを完成させ、約2億塩基対 base pairing 塩基対(base pairing) base pairing(塩基対) の新規配列を加えた4。この完全配列上で測ると、動原体centromere / kinetochore 動原体(centromere / kinetochore)centromere / kinetochore(動原体) 周辺およびセントロメア centromere セントロメア(centromere) centromere(セントロメア) の反復配列 repetitive sequence 反復配列(repetitive sequence) repetitive sequence(反復配列) だけでゲノムの6.2%(189.9 Mb)を占め、活性なセントロメア centromere セントロメア(centromere) centromere(セントロメア) 反復アレイの中にもメガベース規模の構造再編があることが明らかになった5。
転移因子transposable element 転移因子(transposable element)transposable element(転移因子) (mobile genetic element、トランスポゾンtransposonトランスポゾン(transposon)transposon(トランスポゾン)、transposon):ゲノム内を移動、または異なるゲノム間を移動しうる遺伝物質 hereditary material遺伝物質(hereditary material) hereditary material(遺伝物質)。時に変異を生成・逆転させ、細胞のゲノムサイズを変化させる。
| 種類 | 機序 |
|---|---|
| レトロトランスポゾンretrotransposonレトロトランスポゾン(retrotransposon)retrotransposon(レトロトランスポゾン) | 自身のRNAコピーを作り、ゲノムの別部位へ導入する一方、元の位置にも残存する。LTR(長末端反復long terminal repeat (LTR)長末端反復(long terminal repeat (LTR))long terminal repeat (LTR)(長末端反復)、long terminal repeat)配列を持つもの、または持たないもの(RNA中間体から逆転写酵素を介しdsDNAへ変換されるもの)の2種がある |
| DNAトランスポゾン transposonトランスポゾン(transposon) transposon(トランスポゾン) | DNAとして直接転移する——カット・アンド・ペースト機構cut-and-paste mechanism ペースト機構(cut-and-paste mechanism)cut-and-paste mechanism(ペースト機構) でゲノムのある部位から切り出され、別の部位へ挿入される。挿入部位insertion site 挿入部位(insertion site)insertion site(挿入部位) の標的DNA配列を短く重複させる。レトロトランスポゾンretrotransposon レトロトランスポゾン(retrotransposon)retrotransposon(レトロトランスポゾン) と異なり自己増幅せず(コピー数copy number コピー数(copy number)copy number(コピー数) は増えない) |
まとめ
- ヒト遺伝子はシス因子 cis element シス因子(cis element) cis element(シス因子) (コアプロモーターcore promoterコアプロモーター(core promoter)core promoter(コアプロモーター)・プロキシマルプロモーターproximal promoterプロキシマルプロモーター(proximal promoter)proximal promoter(プロキシマルプロモーター)・エンハンサーenhancerエンハンサー(enhancer)enhancer(エンハンサー)・サイレンサーsilencerサイレンサー(silencer)silencer(サイレンサー)・UTR)とトランス因子 trans element トランス因子(trans element) trans element(トランス因子) (転写因子をコードする遺伝子)による調節を受け、CpGアイランドCpG island CpGアイランド(CpG island)CpG island(CpGアイランド) はDNAメチル化を介した転写制御 transcriptional regulation 転写制御(transcriptional regulation) transcriptional regulation(転写制御) の要となる。
- ヒトゲノムのタンパク質コード領域はわずか1.5〜2%にとどまり、残りはイントロン(28%)・偽遺伝子pseudogene 偽遺伝子(pseudogene)pseudogene(偽遺伝子) (9%)・反復配列repetitive sequence 反復配列(repetitive sequence)repetitive sequence(反復配列) (50%)という非コード配列 coding sequence コード配列(coding sequence) coding sequence(コード配列) が占める。ただし「コードしない」=「転写されない」ではなく、ENCODEによればゲノムの約4分の3が転写されうる。
- 偽遺伝子pseudogene 偽遺伝子(pseudogene)pseudogene(偽遺伝子) はプロセス process プロセス(process) process(プロセス) 型(逆転写由来、イントロンなし)・重複型(遺伝子重複由来、エキソンexon エキソン(exon)exon(エキソン) -イントロン構造保持)・孤発型(機能喪失変異loss-of-function variant 機能喪失変異(loss-of-function variant)loss-of-function variant(機能喪失変異) 由来)・NUMT(ミトコンドリア由来)に分類され、おとりmRNAやsiRNA前駆体として遺伝子発現調節 gene expression regulation 遺伝子発現調節(gene expression regulation) gene expression regulation(遺伝子発現調節) に寄与しうる。
- 反復配列repetitive sequence 反復配列(repetitive sequence)repetitive sequence(反復配列) はサテライト satellite (satellite DNA) サテライト(satellite (satellite DNA)) satellite (satellite DNA)(サテライト) DNA(マイクロサテライトmicrosatelliteマイクロサテライト(microsatellite)microsatellite(マイクロサテライト)・テロメア・セントロメアcentromereセントロメア(centromere)centromere(セントロメア)、タンデム型)と転移因子 transposable element 転移因子(transposable element) transposable element(転移因子) (レトロトランスポゾンretrotransposonレトロトランスポゾン(retrotransposon)retrotransposon(レトロトランスポゾン)・DNAトランスポゾン transposonトランスポゾン(transposon) transposon(トランスポゾン)、分散型)に大別され、テロメアの反復配列 repetitive sequence 反復配列(repetitive sequence) repetitive sequence(反復配列) 短縮は細胞老化 senescence細胞老化(senescence) senescence(細胞老化)・寿命と直結する。テロメラーゼtelomerase テロメラーゼ(telomerase)telomerase(テロメラーゼ) は生殖系列・幹細胞で活性、正常体細胞で抑制、腫瘍の約9割で再活性化する。
- セントロメアcentromere セントロメア(centromere)centromere(セントロメア) などの高度反復領域は長らく参照ゲノムから欠落していたが、2022年のT2T-CHM13(3.055 Gb、ギャップなし)で完成し、動原体centromere / kinetochore 動原体(centromere / kinetochore)centromere / kinetochore(動原体) 周辺・セントロメアcentromere セントロメア(centromere)centromere(セントロメア) 反復がゲノムの6.2%(189.9 Mb)を占めることが確定した。
出典
- 1.Landscape of transcription in human cells(Nature・2012)ENCODEの網羅的転写産物解析により、ヒトゲノムの約4分の3が転写されうることが示された(タンパク質コード領域は1.5〜2%にすぎないが、転写される割合ははるかに大きい)閲覧 2026-08-22
- 2.Molecular basis for the deficiency in humans of gulonolactone oxidase, a key enzyme for ascorbic acid biosynthesis(The American Journal of Clinical Nutrition・1991)ヒトのL-グロノ-γ-ラクトン酸化酵素遺伝子は多数の変異を蓄積して偽遺伝子となっており、ヒトがアスコルビン酸を合成できない分子的基盤である(孤発型/単一型偽遺伝子の代表例)閲覧 2026-08-22
- 3.Specific association of human telomerase activity with immortal cells and cancer(Science・1994)テロメラーゼ活性は正常体細胞組織50検体すべてで陰性、正常卵巣・精巣では陽性、不死化細胞株100株中98株・ヒト腫瘍生検101検体中90検体で陽性であり、正常体細胞では抑制され癌で再活性化される閲覧 2026-08-22
- 4.The complete sequence of a human genome(Science・2022)T2T-CHM13は3.055 Gbのギャップのないヒトゲノム配列で、従来の参照ゲノムに欠けていた約8%(セントロメアのサテライトアレイ、短腕など)を埋め、約2億塩基対の新規配列を追加した閲覧 2026-08-22
- 5.Complete genomic and epigenetic maps of human centromeres(Science・2022)T2T-CHM13上で動原体周辺およびセントロメアの反復配列はゲノムの6.2%(189.9 Mb)を占め、活性なセントロメア反復アレイ内にもメガベース規模の構造再編がある閲覧 2026-08-22