-
Notifications
You must be signed in to change notification settings - Fork 0
Expand file tree
/
Copy pathAnnotation.Rmd
More file actions
91 lines (66 loc) · 11.2 KB
/
Copy pathAnnotation.Rmd
File metadata and controls
91 lines (66 loc) · 11.2 KB
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
---
title: "Annotation"
author: "CHARRIAT Florian"
date: "29 mars 2018"
output:
html_document:
code_folding: hide
fig_caption: yes
highlight: zenburn
theme: cerulean
toc: yes
toc_depth: 5
toc_float: yes
---
```{r knitr setup, include=FALSE, eval=TRUE, echo=FALSE, warning=FALSE}
# knitr::opts_chunk$set(echo=TRUE, eval=TRUE, cache=TRUE, message=FALSE, warning=FALSE, comment="")
library(knitr)
options(width=300)
knitr::opts_chunk$set(
fig.width = 10,
fig.height = 5,
fig.align = "center",
size = "tiny",
echo = TRUE, eval=TRUE,
warning = FALSE, message = FALSE,
results = TRUE, comment = "")
# knitr::asis_output("\\footnotesize")
```
```{r Package, echo = FALSE}
if(!require("knitr"))
{
install.packages('knitr')
}
if(!require("DT"))
{
install.packages('DT')
}
library('knitr')
library('DT')
```
<p style="text-align:justify";>Dans un premier temps, Le script <a href="https://floriancha.github.io/Script/index.html" target="_blank">formatFastaName</a> est utilsé. Il va , pour chaque assemblage, changer les noms des scaffolds. Les scaffolds seront numérotés en fonction de leur longueur, ainsi le plus grand scaffold sera nommé scaffold_1. En description de chaque scaffold sa longueur sera donnée. En revanche seul la souche WHTQ va voir ses scaffold renommé, en revanche les autres souches de la litterature conseront leur nom de scaffold.</p>
<p style="text-align:justify";>Les outils d’annotation automatique utilisent souvent un modèle d’apprentissage tel que les profils HMM. L’outil Braker utilise également des données RNA-seq pour améliorer la sensibilité et la spécificité dans la détection des gènes. C’est pourquoi cet outil a été utilisé pour l’annotation structurale automatique de M. oryzae. Braker combine les avantages des outils GeneMark-ET et Augustus.</p>
<p style="text-align:justify";>Tout d’abord, GeneMark-ET génère des structures géniques. Pour cela l’outil utilise un ensemble de paramètres du hidden semi-Markov model (HSMM) définit initialement pour prédire des régions codantes dans l’assemblage. Une fois ces gènes prédits, un sous-ensemble d’exons et d’introns est utilisé pour réestimer les paramètres du HSMM. L’intégration des régions codantes dans le set d’entrainement nécessite que l’exon prédît possède au moins un site d’épissage. Les sites d’épissage sont ceux prédits indépendamment par les deux méthodes, le profil HSMM et l’alignement des données RNA-Seq. Les étapes de prédiction des régions codantes et de la réestimation des paramètres du HSMM sont réalisées de manière itérative tant que les régions codantes prédites varient. Ensuite, Augustus utilise les gènes prédits par GeneMarker-ET pour l’entraînement, puis intègre les informations de mapping des données RNA-seq dans les prédictions finales de gènes.</p>
<p style="text-align:justify";>Pour l’annotation, Braker nécessite un fichier d’assemblage au format fasta et un fichier d’alignement de donnée RNA-seq sur l’assemblage au format bam. Cependant pour enrichir les données utilisées par Braker le fichier d’alignement des données RNA-seq est remplacé par un fichier « hints » introniques. Ce fichier correspond aux positions de tous les introns récupérés à partir de différents fichiers d’alignements dont ceux des données RNA-seq. Nous avons utilisé les alignements des données de 32 expériences de RNA-seq et des données protéiques issues de l’annotation de la souche de référence 70-15 pour la création du fichier hints.</p>
<p style="text-align:justify";>L’annotation automatique des assemblages avec Braker nécessite donc au préalable de réaliser les alignements des données RNA-seq et des données protéiques de la souche de référence 70-15. L’ensemble des étapes d’annotation a été réalisé en utilisant le script Annotation_pipeline.snake. Ce script a été écrit en Snakemake afin de pouvoir paralléliser certaines étapes et de pouvoir lancer les différentes étapes sur le cluster. Tous les scripts utilisés pour l’annotation sont spécialement créés pour ce pipeline. La figure 4 présente un exemple du pipeline d’annotation créé par l’option dag de snakemake. Dans un premier temps, le pipeline traite en parallèle les alignements des données RNA-seq et l’alignement des protéines de la séquence de référence 70-15.</p>
# Alignement RNA-seq
<p style="text-align:justify";>L’outils topHat2 a été utilisé pour effectuer les alignements des 32 jeux de données de RNA-seq sur chaque assemblage (cf tableau ci-dessous). Les paramètres de topHat2 ont été modifiés pour rechercher des introns de taille comprise entre 10 et 8000 pb. De plus, les données RNA-seq étant des données Illumina, la librairie fr-unstranded a été utilisée pour l’alignement. L’outil topHat2 donne en sortie un fichier d’alignement au format bam. Au total, pour chaque assemblage, 32 fichiers bam ont été générés et utilisés dans la suite du pipeline.</p>
```{r création tableau RNAseq ,echo=FALSE}
name <- c('FR13-myc','FR13.sari.3dpi.RNAtot','Mg1','Mg2','Mg3','SRR651980','SRR651981','SRR651982','SRR1561422','SRR298683','SRR298684','SRR298685','SRR298686','SRR298687','SRR298688','SRR298689','SRR298690','SRR298691','SRR298692','SRR651979','HH27','HH28','HH29','HH35','HH36','HH37','S37','S39','S40','S117','S119','S120')
description <- c('Projet GEMO Run1','Projet GEMO Run1 (inPlanta)','RNAseq Magnaburkho','RNAseq Magnaburkho','RNAseq Magnaburkho','RNAseq GY11','RNAseq GY11','RNAseq GY11','RNAseq GY11','RNAseq GY11','RNAseq GY11','RNAseq GY11','RNAseq GY11','RNAseq GY11','RNAseq GY11','RNAseq GY11','RNAseq GY11','RNAseq GY11','RNAseq GY11','RNAseq GY11','RNAseq InPlanta','RNAseq InPlanta','RNAseq InPlanta','RNAseq InPlanta','RNAseq InPlanta','RNAseq InPlanta','RNAseq InPlanta','RNAseq InPlanta','RNAseq InPlanta','RNAseq InPlanta','RNAseq InPlanta','RNAseq InPlanta')
data <- data.frame(description)
rownames(data) <- name
datatable(data, caption =" Tableau n°1: Liste des données RNAseq utilisées pour l'annotation", colnames = c('Id', 'description'),extensions = 'Buttons', options = list(dom = 'Blfrtip',buttons = c('copy', 'csv', 'excel', 'pdf', 'print')))
```
# Traitement des données RNA-seq
<p style="text-align:justify";>Les fichier bam générés sont ensuite fusionnés à l’aide de l’outil samtools merge. L’outil picard est alors utilisé pour trier les données en fonction de leur coordonnée. Une fois les données triées, le fichier fusionné est converti en fichier hints à l’aide de l’outil bam2hints fourni avec Braker. Enfin un script R est utilisé pour filtrer les introns ayant une faible couverture de séquençage.</p>
# Alignement des protéines de référence
<p style="text-align:justify";>Afin de compléter le fichier hints issu de l’alignement des données RNA-seq, un alignement des données protéiques de 70-15 est réalisé. L’utilisation de données protéiques permet notamment d’augmenter la sensibilité et la spécificité pour les gènes peu exprimés dans certaines conditions. Pour améliorer encore la prédiction des gènes, ce sont tous les protéines du pangénome crée lors de la précédente annotation qui seront utilisé comme protéines de références. Les protéines de la souche de référence 70-15 ont été alignées avec l’outil exonerate, en utilisant le modèle protein2genome spécifiquement développé pour aligner des séquences d’acides aminés sur des séquences nucléotidiques. Avec ce modèle d’alignement, l’assemblage est traduit en acides aminés. Le paramètre ‘percent’ a été fixé à 95 afin de filtrer les hits qui ont moins de 95 % du score maximal pouvant être obtenu pour cette requête. L’outil exonerate2hints d’Augustus a ensuite été utilisé pour convertir le fichier de sortie de exonerate en fichier hints compatible avec Braker.</p>
# Braker
<p style="text-align:justify";>Le fichier contenant tous les hints a été généré par simple concaténation du fichier hints issu des données RNA-seq et du fichier hints issu de l’alignement protéique. Ensuite, l’outil Annotation_automatique.snake a été utilisé pour filtrer spécifiquement les informations des introns, et générer un fichier de hints introniques qui a été fourni à Braker. L’outil Braker génère un fichier d’annotation gff3 (General Feature Format) contenant la position et la nature de tous les éléments génomiques identifiés dans chaque génome (gène, transcrit, exon, intron …). </p>
# Augustus
<p style="text-align:justify";>Lors d’une des étapes subséquentes de ce projet, la présence des effecteurs AVR connus a été utilisée pour contrôler la qualité de l’annotation réalisée par Braker, ce qui a permis de montrer que les effecteurs dépourvus d’intron semblaient être ignorés par Braker, qui ne prend en compte que les fichiers hints intronique et n’identifie donc pas les gènes sans région intronique. Cependant, les gènes AVR connus et les effecteurs en général ne possèdent souvent pas d’intron, et sont donc absents de l’annotation par Braker. C’est pourquoi en complément de l’annotation Braker, l’outil Augustus seul a été lancé.</p>
<p style="text-align:justify";>L’outil Augustus a été utilisé avec le fichier contenant l’ensemble des hints, à la place du fichier de hints concernant introns seuls qui a été utilisé avec Braker. Le fichier gff3 généré par Augustus est fusionné avec le fichier gff3 issu de Braker. L’outil Braker étant plus spécifique et sensible (sauf pour l’identification des gènes ne comportant pas d’introns, d’où l’utilisation d’Augustus), les informations issues du fichier gff3 de l’outil Braker sont conservées et les informations des éléments génomiques issues d’Augustus, qui ne sont pas identifiées par Braker, sont ajoutées. Cette fusion de fichiers gff3 est réalisée par le script mergeBraker_augustus.py. Les éléments contenus dans les fichiers obtenus (gènes, transcrits) sont ensuite renommés pour homogénéiser la nomenclature des gènes. Cette homogénéisation est notamment réalisée pour la construction du pangénome mais aussi pour l’intégration de toutes ces données dans un Genome Browser en cours de construction dans l’équipe. Nous avons choisi une nomenclature intuitive dans laquelle les identifiants des gènes sont composés des initiales de l’espèce, du nom de l’isolat et d’un numéro de gène. Les gènes sont numérotés de 10 en 10, ce qui laisse neufs indices de libre entre chaque gène, en prévision de possibles besoins futurs d’insérer de nouveaux modèles de gènes entre deux gènes déjà identifiés. Le script renameGFF.py a été écrit pour effectuer cette modification du fichier gff3.</p>
<p style="text-align:justify";>A partir des fichiers d’annotation finale, les séquences protéiques et nucléiques utilisées dans la suite du projet ont été extraites à l’aide du script gff2fasta.pl, qui utilise les informations du fichier d’annotation pour récupérer les identifiants et les séquences des transcrits dans le fichier d’assemblage. Ce script permet aussi de rajouter la longueur du transcrit et sa position dans l’assemblage dans la description de chaque séquence.</p>