Apache Hadoop est un ensemble de logiciels libres (fondation Apache) qui répartit le stockage et le calcul de très gros volumes de données sur des dizaines ou des centaines de serveurs ordinaires. Il a popularisé la notion de data lake et reste présent dans de nombreuses grandes entreprises, souvent aux côtés de Spark et du cloud.
Qu'est-ce que Hadoop ?
Créé au milieu des années 2000 à partir des travaux publiés par Google sur son système de fichiers distribué et sur MapReduce, Hadoop repose sur une idée simple : plutôt que d'envoyer les données vers un calculateur puissant, on envoie le calcul là où les données sont stockées. Chaque fichier est découpé en blocs, répliqués sur plusieurs machines : la panne d'un serveur ne fait perdre aucune donnée.
- HDFS : le système de fichiers distribué, qui découpe et réplique les données.
- YARN : le gestionnaire qui attribue processeurs et mémoire aux traitements.
- MapReduce : le modèle de calcul d'origine, aujourd'hui souvent remplacé par Apache Spark, plus rapide.
- L'écosystème : Hive (requêtes SQL), HBase (base NoSQL), Kafka (flux de données)…
À quoi sert Hadoop en entreprise ?
- Centraliser des données hétérogènes (journaux applicatifs, capteurs, transactions) dans un data lake
- Lancer des traitements par lots sur des téraoctets de données : calculs d'indicateurs, nettoyage, agrégations
- Préparer les jeux de données utilisés pour entraîner des modèles d'apprentissage automatique
- Conserver un historique long à moindre coût, sur du matériel standard ou dans le cloud
Aujourd'hui, beaucoup d'organisations migrent vers des services cloud ou des architectures « lakehouse ». Comprendre Hadoop reste utile : les principes (stockage distribué, réplication, calcul parallèle) sont les mêmes, et de nombreux systèmes en production l'utilisent encore.
Hadoop et l'intelligence artificielle
Un modèle d'IA ne vaut que par ses données. Les briques Big Data comme Hadoop et Spark servent à collecter, nettoyer et transformer les données brutes avant l'entraînement. C'est le travail du Data Engineer et de l'ingénieur MLOps, en appui du Data Scientist.
Compétences à acquérir
- Comprendre l'architecture d'un cluster et les principes de réplication
- Manipuler HDFS et interroger les données en SQL (Hive)
- Écrire des traitements distribués avec Spark (PySpark)
- Choisir entre stockage Big Data, base relationnelle ou NoSQL selon le besoin
Apprendre Hadoop chez LiveCampus
Mastère Ingénieur en science des données spécialisé en apprentissage automatique
Hadoop et Spark font partie des technologies étudiées dans ce Mastère, qui couvre toute la chaîne de la donnée : collecte, stockage Big Data, transformation, analyse et apprentissage automatique. Il prépare au titre RNCP 39586 de niveau 7 (Bac+5), délivré par YNOV.
Prérequis : une certification de niveau 6 (Bac+3) dans un domaine en lien. Format : 100 % à distance, cours en direct, en alternance ou en formation initiale.
Questions fréquentes
Hadoop est-il encore utilisé ?
Oui, notamment dans les grandes entreprises qui ont construit leur data lake dans les années 2010. Beaucoup migrent vers le cloud ou Spark, mais les principes d'Hadoop restent la base du traitement distribué.
Quelle différence entre Hadoop et Spark ?
Hadoop fournit surtout le stockage distribué (HDFS) et la gestion des ressources (YARN). Spark est un moteur de calcul qui traite les données en mémoire, beaucoup plus vite que MapReduce, et qui peut fonctionner sur un cluster Hadoop.
Quels métiers utilisent Hadoop ?
Principalement le Data Engineer, mais aussi l'ingénieur MLOps, le Data Scientist et l'architecte data.

