Survey
* Your assessment is very important for improving the work of artificial intelligence, which forms the content of this project
* Your assessment is very important for improving the work of artificial intelligence, which forms the content of this project
Special Topics in Genomics Lecture 1: Introduction Instructor: Hongkai Ji Department of Biostatistics Email: [email protected] Outline of today’s lecture Introduction to genome and genomics Topics and tools Relevance of statistics DNA DNAs (Deoxyribonucleic acids) are molecules to store genetic information of a living organism. DNA consists of two polymers made from four types of nucleotides: adenine (A) guanine (G), cytosine (C) and thymine (T). Purines: A, G; Pyrimidines: C, T Two polymers are complementary to each other and from a double-helix structure 5’-ACCGTTCGACGGTAA-3’ ||||||||||||||| 3’-TGGCAAGCTGCCATT-5’ Chromosome Genome TCAGTTGGAGCTGCTCCCCCACGGCCTCTCCTCACATTCCACGTCCTGTAGCTCTATGACCTCCACCTTTGAGTCCCTCCT CTCACACCTGACATGAAAAGGCACATGAGGATCCTCAAATACCCCGTGATCAGTCTCAGGGTAGCTCTCATAGCCTGGACA GGGCCCCCCTCGGGGGTTGCGCCCAGGTCCAGGCGGGGGATGCACAGCAACAGTCACCGAAGCAGAAGCCGTCACAGTGGT GATGGGCTGGCAGTAGCTGGGCACAGAGCTGCCCATGGCGGTGGACGTTGGGTTCCGAGGGTTGTGAGAACGGGCCCCACG GGGCCCTGAGCGGTCCCTATTGCTAGGGCCAGAATGCCCTTCAGTAGAAATTTCAAAAGCGTCTCTGCGCGGTCTGTAGGG GGGTGGCCGCAAGCCTTCTCTAGGGGGATCCCTTCGAGGCTGCTGGCCTTGCCGTCCAGGGGACAAGGAGCCAGAGTCCAG GTGGGGCTGTTGCCGAGGGGTCAAGGGAGGCTGATGTCTGGAGTCCGGATGGACCACCTGCAGAGGAGAGACATAGGTCAA CACAGGGAGGTAGGATGGTGGTGATGTTCCACCCACAAAAGAAAACCTATTCCTTTAGAAACCTCCAGGATGTGAATCCTG CCTGCACCTGCACAGCTGGCTGGAGGCATATAGCCACTGCCCATAGATCTCAACTTACCCTCACAACCAACTGCCCCCAGG CCTAAGTTCTCTGCCTCAAAACTGCCAAGGCCTGGATAGCCAAGAGCCTGGGTGTCTTGGAAATATGCAACCATAAATAGT AGCTTTTAGAAGTATAAGGCTCCTGTTTCTGGGTCATATTAGTGTTGTTTTCACCTGTCCCCAGCCCTAAGCCAGGTGTGG CCAGAAGCAAATGTACTGTAAGAGCAGAGCAAAAACTTCCACACAGATAGTTCTGTTAGGCAATACATCTCTGCCTGACTA TTAGGAATCTGGTTTCTGGGTCCTCTGTACAAAGCTCGGAGCAACACAGTGGCCACATCAATCAAAAGGACCGTGACCAAC TTCAAAGTCGGTGAGCTTGTACCTATTTTTAGGCTCCTGCTGAACAGAACCAGATTCACACTACAGCTCAGCAGGGCATCG TCACGGGTGTGTGTGTGTGTGTGTGTGTGTGTGTGTGTGTGTGTTGGGGGGGGGGGGTGGACAGAGGACGGGGACACAATT CACTGGCCAGCCCTTCTCTCCTTCAAGGAAGGCTGCTCTAGCCTGGGACTGGAATACACATTTCCTGTAAACATGGTGGGG GCCTCAGGCAAGCCAGAGTTTTGGAGCCTTCCTTAACTCTTCAAGGTGAGCATCTTGACTTGGAGGGTGGGGGTGCGGGTA AGGAAGGAACCTGTGGACTCCTCCCTACAAGACAGAAAAGGAATAAGCCACGAAGACAATAACGATTTTTGTATCAAGCGT CCTCTCCCATTTCAGCTTACCTGACAATGAAATCAAATTCGGACCCTGCAAGCATCAGTACACCCAGCAGAGTGGACACAG CACCGTCCAGAACGGGAGCAAACATGTGCTCCAGAGCGAGCATAGCCCTGTGGTTCTTGTCCCCAATGGCTGTCAGAAAGG CCTGAACAAAGGAGAAAATTGACACGGTCACATTCTGGGTGTGGTAAAGTGCTCAGCTGTGTCTATACTTGGGTTTTGTAT … Total amount of DNA in human genome: 3 * 109 base pairs (bp) Gene Gene Gene Gene Gene Gene Central Dogma Gene expression Topic 1: gene expression and microarray Expression No Expression Spatially X Y Z Temporally X A A A B B B C C C Y Z X Y Z X Y Z Microarray cDNA sample probe Microarray data Topic 2: transcriptional regulation Transcription factors (TF): Transcription factor binding sites (TFBS): TF1 TF1 TF2 CCACCCAC, TAATAAAAT TF2 TF1 TTATGTAACCTGCACTTACTACCACCCACAACATAATAAAATCTAAACCACTGAATGAAATACAAAATCTATGTATGA... TF2 TTATGTAACCTGCACTTACTACCACCCACAACATAATAAAATCTAAACCACTGAATGAAATACAAAATCTATGTATGA... Transcription factor binding motif TF GTATGTACTTACTATGGGTGGTCAACAAATCTATGTATGA 123456789 TF TAACATGTGACTCCTATAACCTCTTTGGGTGGTACATGAA TF CTGGGAGGTCCTCGGTTCAGAGTCACAGAGCAGATAATCA 1 2 3 4 5 6 7 8 9 TGGGTGGTC A 0 0 1 0 1 0 0 0 1 TGGGTGGTA C 0 0 0 0 0 0 0 0 4 TGGGAGGTC TF TTAGAGGCACAATTGCTTGGGTGGTGCACAAAAAAACAAG G 0 6 5 6 0 6 6 0 1 TGGGTGGTG TF AACAGCCTTGGATTAGCTGCTGGGGGGGTGAGTGGTCCAC TGAGTGGTC TF ATCAGAATGGGTGGTCCATATATCCCAAAGAAGAGGGTAG TGGGTGGTC T 6 0 0 0 5 0 0 6 0 Transcription Factor Binding Sites (TFBS) 1 2 3 4 5 6 7 8 9 A 0.00 0.00 0.17 0.00 0.17 0.00 0.00 0.00 0.17 C 0.00 0.00 0.00 0.00 0.00 0.00 0.00 0.00 0.66 G 0.00 1.00 0.83 1.00 0.00 1.00 1.00 0.00 0.17 T 1.00 0.00 0.00 0.00 0.83 0.00 0.00 1.00 0.00 Motif Motifs are regulatory codes in the genome TCAGTTGGAGCTGCTCCCCCACGGCCTCTCCTCACATTCCACGTCCTGTAGCTCTATGACCTCCACCTTTGAGTCCCTCCT CTCACACCACCCATGTTTTGTTTATGAGGATCCTCAAATACCCCGTGATCAGTCTCAGGGTAGCTCTCATAGCCTGGACAG GGCCCCCCTCGGGGGTTGCGCCCAGGTCCAGGCGGGGGATGCACAGCAACAGTCACCGAAGCAGAAGCCGTCACAGTGGTG ATGGGCTGGCAGTAGCTGGGCACAGAGCTGCCCATGGCGGTGGACGTTGGGTTCCGAGGGTTGTGAGAACGGGCCCCACGG GGCCCTGAGCGGTCCCTATTGCTAGGGCCAGAATGCCCTTCAGTAGAAATTTCAAAAGCGTCTCTGCGCGGTCTGTAGGGG GGTGGCCGCAAGCCTTCTCTAGGGGGATCCCTTCGTTGCTGCTGGCCTTGCCGTCCAGGGGACAAGGAGCCAGAGTCCAGG TGGGGCTGTTGCCGAGGGGTCAAGGGAGGCTGATGTCTGGAGTCCGGATGGACCACCTGCAGAGGAGAGACATAGGTCAAC ACAGGGAGGTAGGATGGTGGTGATGTTCCACCCACAAAAGAAAACCTATTCCTTTAGAAACCTCCAGGATGTGAATCCTGC CTGCACCTGCACAGCTGGCTGGAGGCATATAGCCACTGCCCATAGATCTCAACTTACCCTCACAACCAACTGCCCCCAGGC CTAAGTTCTCTGCCTCAAAACTGCCAAGGCCTGGATAGCCAAGAGCCTGGGTGTCTTGGAAATATGCAACCATAAATAGTA GCTTTTAGAAGTATAAGGCTCCTGTTTCTGGGTCATATTAGTTTTGTTTTCACCTGTCCCCACCCATAAGCCAGGTGTGGC CAGAAGCAAATGTACTGTAAGAGCAGAGCAAAAACTTCCACACAGATAGTTCTGTTAGGCAATACATCTCTGCCTGACTAT TAGGAATCTGGTTTCTGGGTCCTCTGTACAAAGCTCGGAGCAACACAGTGGCCACATCAATCAAAAGGACCGTGACCAACT TCAAAGTCGGTGAGCTTGTACCTATTTTTAGGCTCCTGCTGAACAGAACCAGATTCACACTACAGCTCAGCAGGGCATCGT CACGGGTGTGTGTGTGTGTGTGTGTGTGTGTGTGTGTGTGTGTTGGGGGGGGGGGGTGGACAGAGGACGGGGACACAATTC ACTGGCCAGCCCTTCTCTCCTTCAAGGAAGGCTGCTCTAGCCTGGGACTGGAATACACATTTCCTGTAAACATGGTGGGGG CCTCAGGCAAGCCAGAGTTTTGGAGCCTTCCTTAACTCTTCAAGGTGAGCATCTTGACTTGGAGGGTGGGGGTGCGGGTAA GGAAGGAACCTGTGGACTCCACCCAACAAGACAGAAAAGGAATAAGCCACGAAGACAATAACGATTTTTGTATCAAGCGTC CTCTCCCATTTCAGCTTACCTGACAATGAAATCAAATTCGGACCCTGCAAGCATCAGTACACCCAGCAGAGTGGACACAGC ACCGTCCAGAACGGGAGCAAACATGTGCTCCAGAGCGAGCATAGCCCTGTGGTTCTTGTCCCCAATGGCTGTCAGAAAGGC CTGAACAAAGGAGAAAATTGACACGGTCACATTCTGGGTGTGGTAAAGTGCTCAGCTGTGTCTATACTTGGGTTTTGTAT Transcription Factor Binding Sites (TFBS) Gene Gene regulatory network TF1 Transcription factors TF2 Other genes Activation TF1 TF2 TACTACCACCCACAACATAATAAAATCTAA Gene1 TF2 TF1 TTAATAAAATACCACCCACAACCTAAGGAT Gene2 Repression Other Interactions TF3 TF3 Gene3 Diseases Misregulation Motif discovery and decoding regulatory programs in the genome Genomic Language Dictionary GGCCCTGAGCGGTCCCTATTGCTGGGTGGTCAATGCCCTTCATCTGAAATTTC AAAAGCGTCTCTGCGCGGTCTGTAGGGGGGTGGCCGCAAGCCTTCTCTAGGGG step1 GGCCCTGAGCGGTCCCTATTGCTAGGGCCAGAATGCCCTTCAGTAGAAATTTC GGCCCTGAGCGGTCCCTATTGCTGGGTGGTCAATGCCCTTCATCTGGAATTTC step2 AAAAGCGTCTCTGCGCGGTCTGTAGGGGGGTGGCCGCAAGCCTTCTCTAGGGG GGCCCTGAGCGGTCCCTATTGCTAGGGCCAGAATGCCCTTCAGTAGAAATTTC Human Language Dictionary guesswhatthestoryisaslongasyouknowthela nguageitshouldbeprettyeasy step1 Guess what the story is. As long as you know the language, it should be pretty easy. step2 Know Guess Be … Finding motifs from co-regulated genes (Roth et al., 1998; Hughes et al., 2000; etc.) GTATGTACTTACTATGGGTGGTCAACAAATCTATGTATGA Gene1 GTATGTACTTACTATGGGTGGTCAACAAATCTATGTATGA CTGGGAGGTCCTCGGTTCAGAGTCACAGAGCAGATAATCA Gene2 CTGGGAGGTCCTCGGTTCAGAGTCACAGAGCAGATAATCA TAACATGTGACTCCTATAACCTCTTTGGGTGGTACATGAA Gene3 TAACATGTGACTCCTATAACCTCTTTGGGTGGTACATGAA Condition1 Gene 1 Gene 2 Gene 3 … Gene N Condition2 Motif discovery is difficult in mammalian genomes due to a low signal-to-noise ratio 100~1000 bp Gene1 100~1000 bp yeast Gene2 100~1000 bp Gene3 10k~1000k bp Gene1 human 10k~1000k bp Gene2 10k~1000k bp Gene3 Topic 3: ChIP-chip and tiling array ChIP-chip (Chromatin ImmunoPrecipitation coupled with Microarray) 500~2000 bp long No IP IP ChIP-chip on tiling arrays Probe: 25~60 bp long 35~300 bp spacing 500~2000 bp long IP CT IP1 1000 20 32 1120 800 50 12 1700 600 11 20 17 80 780 60 IP2 1200 30 25 1500 730 45 11 1650 700 15 30 23 90 790 70 CT1 80 32 30 21 32 35 22 50 30 24 25 33 12 30 10 CT2 20 25 27 50 29 60 17 45 20 13 15 29 21 45 13 A combined approach to study gene regulation ChIP-chip 500~2000bp GTATGTACTTACTATGGGTGGTCAACAAATCTATGTATGA CTGGGAGGTCCTCGGTTCAGAGTCACAGAGCAGATAATCA TAACATGTGACTCCTATAACCTCTTTGGGTGGTACATGAA TTAGAGGCACAATTGCTTGGGTGGTGCACAAAAAAACAAG AACAGCCTTGGATTAGCTGCTGGGGGGGTGAGTGGTCCAC 6~30bp Sequence Analysis Topic 4: alternative splicing and exon array promoter intron exon transcription start site (TSS) intron exon exon gene splicing Alternative splicing exon 1 Isoform 1 Isoform 2 Isoform 3 exon 2 exon 3 exon 4 exon 5 Exon array Topic 5: single nucleotide polymorphism and SNP array SNPs: occur every 100 to 1000 bp make up 90% of genetic variations minor allele frequency >= 1% (otherwise we call them mutations) SNP array ACCGTGGA[C/T]CTGAACCG |||||||| | |||||||| TGGCACCT[G/A]GACTTGGC ACCGTGGA[G]CTGAACCG ACCGTGGA[C]CTGAACCG Applications: 1. Genotyping & genome-wide association study 2. Copy number variations and loss of heterozygosity ACCGTGGA[T]CTGAACCG 3. Allele specific expression ACCGTGGA[A]CTGAACCG What will happen when the genotype is CC? CT? TT? … Topic 6: next-generation sequencing Traditional sequencing Next-generation sequencing Prepare genomic DNA Attach DNA to surface Bridge amplification Fragement become double stranded Denature the double stranded molecules Complete amplification Determine first base Image first base Determine second base Image second base Sequence reads over multiple cycles Align data. >50 milliion clusters/flow cell, each 1000 copies of the same template, 1 billion bases per run, 1% of the cost of capillary-based method. (From: http://www.illumina.com/downloads/SS_DNAsequencing.pdf) Array vs. next-generation sequencing Array vs. next-generation sequencing Microarray, Exon array RNA-seq ChIP-chip ChIP-seq SNP array SNP/mutation detection by sequencing … … Other topics Epigenomics Transposon miRNA Relevance of statistics Need new statistical theories and tools Genomics Statistics Guide development of efficient data analysis strategies Example 1: differential gene expression Example 1: multiple testing Gene t-statistic p-value i=1 1.2 0.30 i=2 6.7 0.001 i=3 5.1 0.002 … … … i=I -0.5 0.56 Bonferroni adjustment Rejections … Multiplicity needs to be adjusted in order to determine statistical significance Bonferroni adjustment too stringent False discovery rate False discovery rate (FDR) False discovery rate (FDR, Benjamini & Hochberg, 1995) Accept Reject Total True H0 U V m0 True H1 T S m-m0 m-R R m FDR = E(V/R) = Pr(R>0)E(V/R|R>0) FWER = Pr(V ≥1) Pooling information Multiplicity caused some problem in controlling type I errors, but it can be used to improve statistical power! A common distribution 1 2 3 … I Sample Variance (df) s12 s22 s32 … sI2 Variance Estimates ̂ 12 ̂ 22 ˆ 32 … ˆ I2 ~t 1 ~t 2 ~t 3 … ~t I Test Modified t-statistics Example 2: motif discovery A C G T A .3 .2 .2 .3 C .2 .3 .3 .2 G .2 .3 .3 .2 T .3 .2 .2 .3 A C G T 1 0.00 0.00 0.00 1.00 2 0.00 0.00 1.00 0.00 3 0.17 0.00 0.83 0.00 Background: 0 4 0.00 0.00 1.00 0.00 5 0.17 0.00 0.00 0.83 6 0.00 0.00 1.00 0.00 7 0.00 0.00 1.00 0.00 8 0.00 0.00 0.00 1.00 9 0.17 0.66 0.17 0.00 Motif: Θ S: GTATGTACTTACTATGGGTGGTCAACAAATCTATGTATGACTGGGAGGTCCTCGGTTCAGAGTCACAGAGCA A: 000000000000001000000000000000000000000001000000000000000000000000000000 f (A,Θ | S) Inference by iterative estimation/sampling (Gibbs sampler) A Marginalization: f (A | S) = ∫ f (A, Θ | S) dΘ