Bioinformaticien · Data Scientist · Orléans, France

Romain
Kpakou.

J'analyse des données biologiques à grande échelle et conçois des pipelines reproductibles — du séquençage haut débit à la modélisation moléculaire.

Diplômé — 2026 Bioinfo · Biostat · Bio Comp.
Disponible Immédiatement
Mobilité National · International
Scroll
01 — À propos

À l'intersection du vivant et de la donnée.

Profil
Manifeste
Approche

Je travaille là où la biologie rencontre l'infrastructure : analyse de données NGS, modélisation moléculaire par deep learning, pipelines reproductibles en environnement HPC.

Diplômé d'un Master en Bioinformatique, Biostatistique et Biologie Computationnelle à Nantes Université, je me suis spécialisé dans l'analyse de données biologiques à grande échelle. J'ai conçu des pipelines automatisés en Python et R, déployés sous Docker et Singularity, et exploité des clusters HPC pour des projets allant du calling de variants à la dynamique moléculaire.

À l'aise autant côté développement que côté interprétation, j'aime les projets où la rigueur méthodologique sert une vraie question scientifique. Je cherche aujourd'hui à mettre ces compétences au service d'équipes ambitieuses en biotech, pharma, recherche ou industrie scientifique.

3
Stages
en bioinfo
9
Projets
réalisés
284
Patients
analysés
02 — Compétences

Une stack complète, du shell au cluster.

Programmation
Bioinfo · NGS
Stats · ML
Infrastructure
/01

Programmation

Python R SQL Bash Oracle JavaScript C/C++
/02

Bioinformatique & NGS

samtools bcftools STAR AnnotSV Snakemake Nextflow Bioconductor Seurat edgeR / DESeq2
/03

Data Science & ML

pandas scikit-learn numpy PyTorch TensorFlow scipy statsmodels PCA · t-SNE Modèles linéaires/mixtes Analyse de survie Stats bayésienne
/04

Modélisation structurale

AlphaFold3-Multimer AMBER CPPTRAJ PyMOL VMD SenseNet Cytoscape RMSD · RMSF
/05

Infrastructure & Cloud

Docker Singularity Git / GitLab CI HPC · Slurm AWS GCP Linux REST APIs
/06

Visualisation & BI

Streamlit Dash Power BI matplotlib seaborn plotly ggplot2 Tableau
03 — Parcours

Quatre années, deux pays, un fil conducteur.

2019 → 2026
Togo · France
Lomé · Nantes · Orléans
Mars 2026 — Sept. 2026 · Stage

Bioinformaticien — Dynamique moléculaire des LIM Kinases

ICOA UMR7311 · Université d'Orléans

Analyse de trajectoires de dynamique moléculaire (AMBER, CPPTRAJ) et cartographie de réseaux allostériques. Modélisation de complexes protéiques par deep learning (AlphaFold3-Multimer) et analyse des interfaces de dimérisation. Pipeline Bash/Python pour l'analyse comparative multi-systèmes en environnement HPC.

AMBER AlphaFold HPC SenseNet
2024 — 2026 · Master

M2 Bioinformatique, Biostatistique & Biologie Computationnelle

Nantes Université — diplômé ingénieur bioinformaticien

Spécialisation en analyse de données biologiques à grande échelle, méthodes statistiques avancées, machine learning et modélisation. Sept projets appliqués sur données réelles (variants structuraux, RNA-seq, single-cell, miRNA, réseaux métaboliques).

Avril 2025 — Juin 2025 · Stage

Bioinformaticien — Analyse de séquences de Nanofitines

AFFILOGIC · Nantes

Conception d'une application web Python/Streamlit pour l'analyse de séquences : pipeline de prétraitement, réduction dimensionnelle (PCA, t-SNE), clustering, identification de positions conservées via logos de séquences. Architecture modulaire conteneurisée Docker, déployable cloud.

Python Streamlit Docker PCA · t-SNE
2022 — 2024 · Licence

Licence Biologie Cellulaire & Moléculaire

Nantes Université
Sept. — Nov. 2021 · Stage

Stagiaire — Biologie médicale

Laboratoire CHP-Notse · Togo

Analyses biochimiques et immunologiques (ELISA, PCR), prélèvements sanguins, contrôle qualité en environnement clinique.

2019 — 2022 · Licence Pro

Licence Professionnelle Analyse Biomédicale

Université de Lomé · Togo — spécialisation biologie moléculaire
04 — Projets

Sélection de projets appliqués — données réelles.

Académiques
Stages · Open source
2024 → 2026
/ 01 Génomique clinique

Variants structuraux & CNV dans un panel de gènes cardiaques

Détection et priorisation de CNV dans 7 gènes associés aux cardiomyopathies et arythmies (TTN, MYH7, LMNA...), méthodologie reprise d'une analyse clinique originale (284 patients, non publiable) et démontrée ici sur le callset public 1000 Genomes : filtrage régional, annotation fonctionnelle (API Ensembl VEP), priorisation par impact et fréquence populationnelle.

bedtools · bcftools Ensembl VEP 1000 Genomes (GRCh37) R Markdown
/ 02 RNA-seq · ENCODE

Épissage alternatif dans des gènes cardiovasculaires

Jonctions d'épissage candidates dans 5 gènes cardiovasculaires (TTN, RBM20, SCN5A...), à partir de BAM RNA-seq publics ENCODE (ventricule et oreillette gauches). Extraction régionale samtools, jonctions via regtools, comparaison aux exons connus (API Ensembl) pour isoler les candidates non décrites, filtrées par support en lectures — 103 candidates fiables sur 2173 jonctions détectées.

samtools · regtools Ensembl REST ENCODE (GRCh38) R Markdown
/ 03 Stage R&D

Classification de séquences sans alignement

Application Python/Streamlit de classification de séquences protéiques sans alignement préalable, méthodologie développée en stage (Affilogic, séquences propriétaires) et démontrée ici sur des séquences publiques. Vectorisation Sequence Graph Transform (SGT), réduction dimensionnelle PCA → t-SNE, clustering interactif et logos de séquence par cluster. Conteneurisée (Docker).

Python · Streamlit SGT · scikit-learn Docker PCA · t-SNE
/ 04 Stage M2 · HPC

Dynamique moléculaire des LIM Kinases

Analyse de trajectoires de simulations à grande échelle (AMBER, CPPTRAJ) et cartographie de réseaux allostériques. Modélisation de complexes protéiques par deep learning (AlphaFold3-Multimer), analyse des interfaces de dimérisation. Pipeline comparatif multi-systèmes en HPC.

AMBER · CPPTRAJ AlphaFold3-Multimer SenseNet · Cytoscape HPC · Singularity
/ 05 Systems biology

Réseaux métaboliques adipocytaires

Identification de modes phénotypiques le long de la différenciation adipocytaire humaine (RNA-seq public, 5 stades), validés par les marqueurs adipogéniques canoniques (PPARG, FABP4...). Enrichissement GO/KEGG et reconstruction d'un réseau d'interaction fonctionnelle (STRING-db) révélant les enzymes de lipogenèse comme hubs centraux.

R · DESeq2 g:Profiler · STRING-db PCA · Réseaux Docker
/ 06 microRNA · Conservation

Conservation de microARN cardiaques et choix de modèle animal

Profil de conservation automatisé (miRBase, 160 espèces) pour 5 myomiRs cardiaques et let-7a comme référence. Alignement MAFFT, score d'identité vs humain, classification taxonomique (API NCBI) et recommandation de modèle animal par famille — la souris ressort pour 4 miARN sur 6.

Python · R MAFFT · miRBase NCBI Taxonomy Pipeline automatisé
/ 07 Génomique des populations · GWAS

Pipeline WGS→GWAS reproductible chez l'abeille noire

Pipeline Nextflow DSL2 de bout en bout (16 modules) appliqué à Apis mellifera mellifera, sous-espèce native d'Europe sous pression de conservation : QC, alignement BWA-MEM2, variant calling GATK Best Practices, filtrage, annotation SnpEff, génétique des populations (PLINK2, ADMIXTURE, FST/LD/π) et GWAS (modèle mixte GEMMA), jusqu'au rapport HTML automatisé. Conteneurisé, CI GitHub Actions.

Nextflow DSL2 GATK · BWA-MEM2 PLINK2 · GEMMA · ADMIXTURE Docker · CI/CD
/ 08 Single-cell · RNA-seq

Pipeline scRNA-seq modulaire et analyse PBMC 3k

Pipeline Nextflow DSL2 reproductible pour l'analyse single-cell 10X Genomics (QC, PCA, clustering Louvain/UMAP, marqueurs différentiels, annotation cellulaire automatisée, trajectoires Slingshot), validé sur le jeu PBMC 3k : 9 populations immunitaires annotées sur 2 638 cellules et reconstruction de la différenciation lymphocytaire T.

Nextflow DSL2 · Seurat UMAP · Slingshot Annotation automatisée Rapport HTML dynamique
/ 09 Biologie des réseaux · Génétique

Priorisation de gènes par réseau multicouche

Priorisation de gènes candidats par marche aléatoire avec redémarrage (MultiXrank) sur réseau PPI multicouche (STRING, par canal de preuve), appliquée à la cardiomyopathie dilatée et à la SLA. Validation leave-one-out : rang médian 325 et 90 sur ~19 400 candidats (hasard ≈ 9 700), spécificité confirmée entre les deux maladies.

MultiXrank · RWR STRING · Orphanet Python Validation supervisée
05 — Contact

Une opportunité, un projet ambitieux,
ou simplement échanger ?

Écrivez-moi
kpakouromain@gmail.com
Téléphone
+33 7 53 44 36 53
Localisation
Orléans, France · Mobilité nationale & internationale
Disponibilité
Disponible immédiatement
Email Télécharger CV LinkedIn GitHub Téléphone