Download Towards Deciphering Gene Regulatory Informatio in

Survey
yes no Was this document useful for you?
   Thank you for your participation!

* Your assessment is very important for improving the work of artificial intelligence, which forms the content of this project

Document related concepts
no text concepts found
Transcript
Special Topics in Genomics
Lecture 1: Introduction
Instructor: Hongkai Ji
Department of Biostatistics
Email: [email protected]
Outline of today’s lecture
 Introduction to genome and genomics
 Topics and tools
 Relevance of statistics
DNA
DNAs (Deoxyribonucleic acids) are
molecules to store genetic
information of a living organism.
DNA consists of two polymers made
from four types of nucleotides:
adenine (A) guanine (G), cytosine
(C) and thymine (T).
Purines: A, G; Pyrimidines: C, T
Two polymers are complementary to
each other and from a double-helix
structure
5’-ACCGTTCGACGGTAA-3’
|||||||||||||||
3’-TGGCAAGCTGCCATT-5’
Chromosome
Genome
TCAGTTGGAGCTGCTCCCCCACGGCCTCTCCTCACATTCCACGTCCTGTAGCTCTATGACCTCCACCTTTGAGTCCCTCCT
CTCACACCTGACATGAAAAGGCACATGAGGATCCTCAAATACCCCGTGATCAGTCTCAGGGTAGCTCTCATAGCCTGGACA
GGGCCCCCCTCGGGGGTTGCGCCCAGGTCCAGGCGGGGGATGCACAGCAACAGTCACCGAAGCAGAAGCCGTCACAGTGGT
GATGGGCTGGCAGTAGCTGGGCACAGAGCTGCCCATGGCGGTGGACGTTGGGTTCCGAGGGTTGTGAGAACGGGCCCCACG
GGGCCCTGAGCGGTCCCTATTGCTAGGGCCAGAATGCCCTTCAGTAGAAATTTCAAAAGCGTCTCTGCGCGGTCTGTAGGG
GGGTGGCCGCAAGCCTTCTCTAGGGGGATCCCTTCGAGGCTGCTGGCCTTGCCGTCCAGGGGACAAGGAGCCAGAGTCCAG
GTGGGGCTGTTGCCGAGGGGTCAAGGGAGGCTGATGTCTGGAGTCCGGATGGACCACCTGCAGAGGAGAGACATAGGTCAA
CACAGGGAGGTAGGATGGTGGTGATGTTCCACCCACAAAAGAAAACCTATTCCTTTAGAAACCTCCAGGATGTGAATCCTG
CCTGCACCTGCACAGCTGGCTGGAGGCATATAGCCACTGCCCATAGATCTCAACTTACCCTCACAACCAACTGCCCCCAGG
CCTAAGTTCTCTGCCTCAAAACTGCCAAGGCCTGGATAGCCAAGAGCCTGGGTGTCTTGGAAATATGCAACCATAAATAGT
AGCTTTTAGAAGTATAAGGCTCCTGTTTCTGGGTCATATTAGTGTTGTTTTCACCTGTCCCCAGCCCTAAGCCAGGTGTGG
CCAGAAGCAAATGTACTGTAAGAGCAGAGCAAAAACTTCCACACAGATAGTTCTGTTAGGCAATACATCTCTGCCTGACTA
TTAGGAATCTGGTTTCTGGGTCCTCTGTACAAAGCTCGGAGCAACACAGTGGCCACATCAATCAAAAGGACCGTGACCAAC
TTCAAAGTCGGTGAGCTTGTACCTATTTTTAGGCTCCTGCTGAACAGAACCAGATTCACACTACAGCTCAGCAGGGCATCG
TCACGGGTGTGTGTGTGTGTGTGTGTGTGTGTGTGTGTGTGTGTTGGGGGGGGGGGGTGGACAGAGGACGGGGACACAATT
CACTGGCCAGCCCTTCTCTCCTTCAAGGAAGGCTGCTCTAGCCTGGGACTGGAATACACATTTCCTGTAAACATGGTGGGG
GCCTCAGGCAAGCCAGAGTTTTGGAGCCTTCCTTAACTCTTCAAGGTGAGCATCTTGACTTGGAGGGTGGGGGTGCGGGTA
AGGAAGGAACCTGTGGACTCCTCCCTACAAGACAGAAAAGGAATAAGCCACGAAGACAATAACGATTTTTGTATCAAGCGT
CCTCTCCCATTTCAGCTTACCTGACAATGAAATCAAATTCGGACCCTGCAAGCATCAGTACACCCAGCAGAGTGGACACAG
CACCGTCCAGAACGGGAGCAAACATGTGCTCCAGAGCGAGCATAGCCCTGTGGTTCTTGTCCCCAATGGCTGTCAGAAAGG
CCTGAACAAAGGAGAAAATTGACACGGTCACATTCTGGGTGTGGTAAAGTGCTCAGCTGTGTCTATACTTGGGTTTTGTAT
…
Total amount of DNA in human genome: 3 * 109 base pairs (bp)
Gene
Gene
Gene
Gene
Gene
Gene
Central Dogma
Gene expression
Topic 1: gene expression and microarray
Expression
No Expression
Spatially
X
Y
Z
Temporally
X
A
A
A
B
B
B
C
C
C
Y
Z
X
Y
Z
X
Y
Z
Microarray
cDNA sample
probe
Microarray data
Topic 2: transcriptional regulation
Transcription factors (TF):
Transcription factor binding sites (TFBS):
TF1
TF1
TF2
CCACCCAC, TAATAAAAT
TF2
TF1
TTATGTAACCTGCACTTACTACCACCCACAACATAATAAAATCTAAACCACTGAATGAAATACAAAATCTATGTATGA...
TF2
TTATGTAACCTGCACTTACTACCACCCACAACATAATAAAATCTAAACCACTGAATGAAATACAAAATCTATGTATGA...
Transcription factor binding motif
TF
GTATGTACTTACTATGGGTGGTCAACAAATCTATGTATGA
123456789
TF
TAACATGTGACTCCTATAACCTCTTTGGGTGGTACATGAA
TF
CTGGGAGGTCCTCGGTTCAGAGTCACAGAGCAGATAATCA
1 2 3 4 5 6 7 8 9
TGGGTGGTC
A 0 0 1 0 1 0 0 0 1
TGGGTGGTA
C 0 0 0 0 0 0 0 0 4
TGGGAGGTC
TF
TTAGAGGCACAATTGCTTGGGTGGTGCACAAAAAAACAAG
G 0 6 5 6 0 6 6 0 1
TGGGTGGTG
TF
AACAGCCTTGGATTAGCTGCTGGGGGGGTGAGTGGTCCAC
TGAGTGGTC
TF
ATCAGAATGGGTGGTCCATATATCCCAAAGAAGAGGGTAG
TGGGTGGTC
T 6 0 0 0 5 0 0 6 0
Transcription Factor Binding Sites (TFBS)
1
2
3
4
5
6
7
8
9
A
0.00
0.00
0.17
0.00
0.17
0.00
0.00
0.00
0.17
C
0.00
0.00
0.00
0.00
0.00
0.00
0.00
0.00
0.66
G
0.00
1.00
0.83
1.00
0.00
1.00
1.00
0.00
0.17
T
1.00
0.00
0.00
0.00
0.83
0.00
0.00
1.00
0.00
Motif
Motifs are regulatory codes in the genome
TCAGTTGGAGCTGCTCCCCCACGGCCTCTCCTCACATTCCACGTCCTGTAGCTCTATGACCTCCACCTTTGAGTCCCTCCT
CTCACACCACCCATGTTTTGTTTATGAGGATCCTCAAATACCCCGTGATCAGTCTCAGGGTAGCTCTCATAGCCTGGACAG
GGCCCCCCTCGGGGGTTGCGCCCAGGTCCAGGCGGGGGATGCACAGCAACAGTCACCGAAGCAGAAGCCGTCACAGTGGTG
ATGGGCTGGCAGTAGCTGGGCACAGAGCTGCCCATGGCGGTGGACGTTGGGTTCCGAGGGTTGTGAGAACGGGCCCCACGG
GGCCCTGAGCGGTCCCTATTGCTAGGGCCAGAATGCCCTTCAGTAGAAATTTCAAAAGCGTCTCTGCGCGGTCTGTAGGGG
GGTGGCCGCAAGCCTTCTCTAGGGGGATCCCTTCGTTGCTGCTGGCCTTGCCGTCCAGGGGACAAGGAGCCAGAGTCCAGG
TGGGGCTGTTGCCGAGGGGTCAAGGGAGGCTGATGTCTGGAGTCCGGATGGACCACCTGCAGAGGAGAGACATAGGTCAAC
ACAGGGAGGTAGGATGGTGGTGATGTTCCACCCACAAAAGAAAACCTATTCCTTTAGAAACCTCCAGGATGTGAATCCTGC
CTGCACCTGCACAGCTGGCTGGAGGCATATAGCCACTGCCCATAGATCTCAACTTACCCTCACAACCAACTGCCCCCAGGC
CTAAGTTCTCTGCCTCAAAACTGCCAAGGCCTGGATAGCCAAGAGCCTGGGTGTCTTGGAAATATGCAACCATAAATAGTA
GCTTTTAGAAGTATAAGGCTCCTGTTTCTGGGTCATATTAGTTTTGTTTTCACCTGTCCCCACCCATAAGCCAGGTGTGGC
CAGAAGCAAATGTACTGTAAGAGCAGAGCAAAAACTTCCACACAGATAGTTCTGTTAGGCAATACATCTCTGCCTGACTAT
TAGGAATCTGGTTTCTGGGTCCTCTGTACAAAGCTCGGAGCAACACAGTGGCCACATCAATCAAAAGGACCGTGACCAACT
TCAAAGTCGGTGAGCTTGTACCTATTTTTAGGCTCCTGCTGAACAGAACCAGATTCACACTACAGCTCAGCAGGGCATCGT
CACGGGTGTGTGTGTGTGTGTGTGTGTGTGTGTGTGTGTGTGTTGGGGGGGGGGGGTGGACAGAGGACGGGGACACAATTC
ACTGGCCAGCCCTTCTCTCCTTCAAGGAAGGCTGCTCTAGCCTGGGACTGGAATACACATTTCCTGTAAACATGGTGGGGG
CCTCAGGCAAGCCAGAGTTTTGGAGCCTTCCTTAACTCTTCAAGGTGAGCATCTTGACTTGGAGGGTGGGGGTGCGGGTAA
GGAAGGAACCTGTGGACTCCACCCAACAAGACAGAAAAGGAATAAGCCACGAAGACAATAACGATTTTTGTATCAAGCGTC
CTCTCCCATTTCAGCTTACCTGACAATGAAATCAAATTCGGACCCTGCAAGCATCAGTACACCCAGCAGAGTGGACACAGC
ACCGTCCAGAACGGGAGCAAACATGTGCTCCAGAGCGAGCATAGCCCTGTGGTTCTTGTCCCCAATGGCTGTCAGAAAGGC
CTGAACAAAGGAGAAAATTGACACGGTCACATTCTGGGTGTGGTAAAGTGCTCAGCTGTGTCTATACTTGGGTTTTGTAT
Transcription Factor Binding Sites (TFBS)
Gene
Gene regulatory network
TF1
Transcription factors
TF2
Other genes
Activation
TF1
TF2
TACTACCACCCACAACATAATAAAATCTAA
Gene1
TF2
TF1
TTAATAAAATACCACCCACAACCTAAGGAT
Gene2
Repression
Other Interactions
TF3
TF3
Gene3
Diseases
Misregulation
Motif discovery and decoding regulatory
programs in the genome
Genomic Language
Dictionary
GGCCCTGAGCGGTCCCTATTGCTGGGTGGTCAATGCCCTTCATCTGAAATTTC
AAAAGCGTCTCTGCGCGGTCTGTAGGGGGGTGGCCGCAAGCCTTCTCTAGGGG step1
GGCCCTGAGCGGTCCCTATTGCTAGGGCCAGAATGCCCTTCAGTAGAAATTTC
GGCCCTGAGCGGTCCCTATTGCTGGGTGGTCAATGCCCTTCATCTGGAATTTC step2
AAAAGCGTCTCTGCGCGGTCTGTAGGGGGGTGGCCGCAAGCCTTCTCTAGGGG
GGCCCTGAGCGGTCCCTATTGCTAGGGCCAGAATGCCCTTCAGTAGAAATTTC
Human Language
Dictionary
guesswhatthestoryisaslongasyouknowthela
nguageitshouldbeprettyeasy
step1
Guess what the story is. As long as
you know the language, it should be
pretty easy.
step2
Know
Guess
Be
…
Finding motifs from co-regulated genes
(Roth et al., 1998; Hughes et al., 2000; etc.)
GTATGTACTTACTATGGGTGGTCAACAAATCTATGTATGA Gene1
GTATGTACTTACTATGGGTGGTCAACAAATCTATGTATGA
CTGGGAGGTCCTCGGTTCAGAGTCACAGAGCAGATAATCA Gene2
CTGGGAGGTCCTCGGTTCAGAGTCACAGAGCAGATAATCA
TAACATGTGACTCCTATAACCTCTTTGGGTGGTACATGAA Gene3
TAACATGTGACTCCTATAACCTCTTTGGGTGGTACATGAA
Condition1
Gene 1
Gene 2
Gene 3
…
Gene N
Condition2
Motif discovery is difficult in mammalian
genomes due to a low signal-to-noise ratio
100~1000 bp
Gene1
100~1000 bp
yeast
Gene2
100~1000 bp
Gene3
10k~1000k bp
Gene1
human
10k~1000k bp
Gene2
10k~1000k bp
Gene3
Topic 3: ChIP-chip and tiling array
ChIP-chip
(Chromatin ImmunoPrecipitation coupled with Microarray)
500~2000 bp long
No IP
IP
ChIP-chip on tiling arrays
Probe: 25~60 bp long
35~300 bp spacing
500~2000 bp long
IP
CT
IP1
1000
20
32
1120
800
50
12
1700
600
11
20
17
80
780
60
IP2
1200
30
25
1500
730
45
11
1650
700
15
30
23
90
790
70
CT1
80
32
30
21
32
35
22
50
30
24
25
33
12
30
10
CT2
20
25
27
50
29
60
17
45
20
13
15
29
21
45
13
A combined approach to study gene
regulation
ChIP-chip
500~2000bp
GTATGTACTTACTATGGGTGGTCAACAAATCTATGTATGA
CTGGGAGGTCCTCGGTTCAGAGTCACAGAGCAGATAATCA
TAACATGTGACTCCTATAACCTCTTTGGGTGGTACATGAA
TTAGAGGCACAATTGCTTGGGTGGTGCACAAAAAAACAAG
AACAGCCTTGGATTAGCTGCTGGGGGGGTGAGTGGTCCAC
6~30bp
Sequence
Analysis
Topic 4: alternative splicing and exon array
promoter
intron
exon
transcription
start site (TSS)
intron
exon
exon
gene
splicing
Alternative splicing
exon 1
Isoform 1
Isoform 2
Isoform 3
exon 2
exon 3
exon 4
exon 5
Exon array
Topic 5: single nucleotide polymorphism
and SNP array
SNPs:
occur every 100 to 1000 bp
make up 90% of genetic variations
minor allele frequency >= 1% (otherwise
we call them mutations)
SNP array
ACCGTGGA[C/T]CTGAACCG
|||||||| | ||||||||
TGGCACCT[G/A]GACTTGGC
ACCGTGGA[G]CTGAACCG
ACCGTGGA[C]CTGAACCG
Applications:
1. Genotyping & genome-wide
association study
2. Copy number variations and
loss of heterozygosity
ACCGTGGA[T]CTGAACCG
3. Allele specific expression
ACCGTGGA[A]CTGAACCG
What will happen when the genotype
is CC? CT? TT?
…
Topic 6: next-generation sequencing
Traditional sequencing
Next-generation sequencing
Prepare genomic DNA  Attach DNA to surface  Bridge amplification  Fragement become double stranded 
Denature the double stranded molecules  Complete amplification  Determine first base  Image first base 
Determine second base  Image second base  Sequence reads over multiple cycles  Align data. >50 milliion
clusters/flow cell, each 1000 copies of the same template, 1 billion bases per run, 1% of the cost of capillary-based
method. (From: http://www.illumina.com/downloads/SS_DNAsequencing.pdf)
Array vs. next-generation sequencing
Array vs. next-generation sequencing
Microarray, Exon array  RNA-seq
ChIP-chip  ChIP-seq
SNP array  SNP/mutation detection by sequencing
…  …
Other topics
 Epigenomics
 Transposon
 miRNA
Relevance of statistics
Need new statistical theories and tools
Genomics
Statistics
Guide development of efficient data
analysis strategies
Example 1: differential gene expression
Example 1: multiple testing
Gene
t-statistic
p-value
i=1
1.2
0.30
i=2
6.7
0.001
i=3
5.1
0.002
…
…
…
i=I
-0.5
0.56
Bonferroni
adjustment
Rejections
…
Multiplicity needs to be adjusted in order to determine statistical significance
Bonferroni adjustment too stringent
False discovery rate
False discovery rate (FDR)
False discovery rate (FDR, Benjamini & Hochberg, 1995)
Accept
Reject
Total
True H0
U
V
m0
True H1
T
S
m-m0
m-R
R
m
FDR = E(V/R) = Pr(R>0)E(V/R|R>0)
FWER = Pr(V ≥1)
Pooling information
Multiplicity caused some problem in controlling type I errors, but it can be
used to improve statistical power!
A common distribution
1
2
3
…
I
Sample Variance (df)
s12
s22
s32
…
sI2
Variance Estimates
̂ 12
̂ 22
ˆ 32
…
ˆ I2
~t
1
~t
2
~t
3
…
~t
I
Test
Modified t-statistics
Example 2: motif discovery
A
C
G
T
A
.3
.2
.2
.3
C
.2
.3
.3
.2
G
.2
.3
.3
.2
T
.3
.2
.2
.3
A
C
G
T
1
0.00
0.00
0.00
1.00
2
0.00
0.00
1.00
0.00
3
0.17
0.00
0.83
0.00
Background: 0
4
0.00
0.00
1.00
0.00
5
0.17
0.00
0.00
0.83
6
0.00
0.00
1.00
0.00
7
0.00
0.00
1.00
0.00
8
0.00
0.00
0.00
1.00
9
0.17
0.66
0.17
0.00
Motif: Θ
S:
GTATGTACTTACTATGGGTGGTCAACAAATCTATGTATGACTGGGAGGTCCTCGGTTCAGAGTCACAGAGCA
A:
000000000000001000000000000000000000000001000000000000000000000000000000
f (A,Θ | S)
Inference by iterative estimation/sampling
(Gibbs sampler)

A
Marginalization: f (A | S) = ∫ f (A, Θ | S) dΘ
Related documents