Bioinformatics : DNA and protein sequence analysis

lbrmc2201  2026-2027  Louvain-la-Neuve

Bioinformatics : DNA and protein sequence analysis
4.00 crédits
30.0 h + 15.0 h
Q1
Enseignants
Cobbaut Mathias; Stenuit Benoît (coordinateur(trice));
Préalables
Notions de base en biochimie et en biologie moléculaire.
Thèmes abordés
La bio-informatique désigne l'ensemble des concepts et des techniques nécessaires au traitement de l'information biologique et à son interprétation. Ce cours introductif décrit :
- les bases de données où sont conservées les séquences nucléotidiques et polypeptidiques
- les concepts et les outils informatiques qui sont nécessaires à l'analyse des séquences de l'ADN ou des protéines encodées (identification des régions codantes, recherche de ressemblances ou de motifs conservés, relations évolutives)
- les concepts et les outils informatiques utilisés pour la prédiction de structures secondaires de l'ARN et la détection des traverses membranaires des protéines
- certains outils statistiques développés pour l'interprétation des résultats
Acquis
d'apprentissage

A la fin de cette unité d’enseignement, l’étudiant est capable de :

1 a. Contribution de l'activité au référentiel AA (AA du programme)
Cohérence des AA cours en regard de ceux du programme
1.1, 1.2, 1.3
3.1, 3.2, 3.4, 3.5, 3.6
b. Formulation spécifique pour cette activité des AA du programme
A la fin de cette activité, l'étudiant est capable d'identifier les outils informatiques (logiciels, base de données) les plus appropriés pour résoudre un problème scientifique, lié à l'analyse des séquences d'ADN ou de protéine, c'est-à-dire :
- Expliquer les concepts théoriques sous-jacents aux outils bio-informatiques
-Consulter les bases de données, expliquer comment l'information y est organisée, et identifier leurs avantages et inconvénients respectifs
- Confirmer ou réfuter les résultats d'analyse et les prédictions disponibles ; le cas échéant, proposer des analyses informatiques plus performantes ou rigoureuses
-Élaborer une méthodologie d'analyse complète à partir d'une séquence inconnue
 
Contenu
  1. Introduction à la bioinformatique et aperçu des principaux concepts
  2. Les principales bases de données dédiées aux séquences nucléiques et protéiques, aux structures 3D des protéines, aux motifs conservés, aux familles de protéines et aux organismes
  3. Comparaison de séquences : dot plots, alignements globaux et locaux par programmation dynamique, matrices de score
  4. Recherche de séquences similaires dans les bases de données, méthodes fondées sur les mots (word-based matching), tables de hachage et statistiques des scores
  5. Alignements multiples de séquences et découverte de motifs (patterns, profils, modèles cachés de Markov)
  6. Inférence phylogénétique : approches phénétiques et cladistiques
  7. Analyses à haut débit de métagénomes et de (méta-)transcriptomes (RNA-seq)
Méthodes d'enseignement
Les compétences visées par le cours seront développées à l'aide d'exposés magistraux, incluant des exemples concrets d'analyse de séquence, et à l'aide d'exercices encadrés à réaliser individuellement ou en groupe, en salle informatique. 
Modes d'évaluation
des acquis des étudiants
Dans le cadre de ce cours, l'évaluation finale repose sur deux modalités :
1. une évaluation continue certificative (35 % de la note finale), comprenant :
  • des exercices et devoirs réalisés au cours du quadrimestre et évalués par M. Cobbaut (note A : 10 % de la note finale, soit 2 points sur 20) ;
  • un devoir avec rapport écrit évalué par B. Stenuit (note B : 25 % de la note finale, soit 5 points sur 20) ; 
2. une évaluation écrite organisée en session et portant sur les aspects théoriques du cours (note C : 65 % de la note finale, soit 13 points sur 20).
L'évaluation vise à apprécier à la fois la compréhension des principes algorithmiques de l'analyse de séquences et des méthodes de prédiction, la capacité à sélectionner les outils bioinformatiques les plus appropriés, l'interprétation critique et l'analyse statistique des résultats obtenus, ainsi que la capacité à appliquer les méthodes présentées au cours.
La note finale est calculée comme la somme des notes obtenues pour les composantes A, B et C, correspondant respectivement à 10 %, 25 % et 65 % de la note finale.
Les énoncés des questions et des exercices sont rédigés en anglais. Les étudiant.e.s ont le choix entre le français et l'anglais pour leurs réponses.
Autres infos
Ce cours est donné en anglais. 
Ressources
en ligne
Moodle
Bibliographie
Des copies papier des diaporamas et le manuel pour les exercices sont disponibles sur Moodle.
Le cours ne fait appel à aucun support particulier qui serait payant et jugé obligatoire. Les ouvrages Bioinformatics de Mount (CSHL press) et Bioinformatics and functional genomics de Pevsner sont conseillés pour un apprentissage plus approfondi
Support de cours
  • Bioinformatics sequence and genome analysis D. Mount
  • Bioinformatics and functional genomics by Pevsner
Faculté ou entité
en charge


Programmes / formations proposant cette unité d'enseignement (UE)

Intitulé du programme
Sigle
Crédits
Prérequis
Acquis
d'apprentissage
Master [120] en biochimie et biologie moléculaire et cellulaire

Master [120] en statistique, orientation biostatistiques

Master [60] en sciences biologiques

Master [120] : bioingénieur en chimie et bioindustries