QCM sur le framework Apache Spark avec des réponses pour la préparation des entretiens d’embauche, tests en ligne, examens et certifications. Ces questions et réponses sur le framework Apache Spark comprennent divers sujets tel que les bases du framework Apache Spark, Hadoop, MapReduce, Requêtes interactives, traitement en flux, ETL, Big Data, etc…. Et sont tirés d’un vrai entretien écrit et certaines parties sont en direct. Cette méthode d’apprentissage systématique préparera facilement toute personne pour réussir son test sur le framework Apache Spark.
1. Est-ce que Spark R utilise MLlib ?
A Oui
B Non
C Peut-être
D Je ne sais pas!
A
MLlib est une bibliothèque de Machine Learning (ML) de Spark. Son objectif est de rendre le Machine Learning pratique, évolutif et facile. À un haut niveau, elle fournit des outils tels que :
Algorithmes ML : algorithmes d’apprentissage courants tels que la classification, la régression, le clustering et le filtrage collaboratif.
Featurisation : extraction, transformation, réduction de la dimensionnalité et sélection des caractéristiques.
Pipelines : outils pour la création, l’évaluation et le réglage des pipelines ML.
Persistance : sauvegarde et chargement des algorithmes, des modèles et des pipelines.
Utilitaires : algèbre linéaire, statistiques, manipulation de données, etc.
2. Vous pouvez connecter un programme R à un cluster Spark à partir de ________
A R Shell
B RStudio
C Rscript
D Tous les programmes ci-dessus
D
Avec SparkR, il est possible de connecter un programme R à un cluster Spark depuis différents environnements, notamment R Shell, RStudio et Rscript. Cette flexibilité permet aux développeurs et aux data scientists d’exécuter des traitements distribués sur Spark en utilisant leur environnement R préféré.
3. Pour un problème de classification multiclasse, quel algorithme n’est pas la solution ?
A Forêts aléatoires (Random Forests)
B Régression logistique
C Arbres de Décision (AD)
D Naive Bayes
B
Les algorithmes populaires qui peuvent être utilisés pour la classification multi-classes comprennent :
Les k-voisins les plus proches.
Arbres de décision.
Naive Bayes.
Forêt aléatoire.
Gradient-Boosted.
Tous les modèles prédictifs de classification ne prennent pas en charge la classification multi-classes.
Les algorithmes tels que la régression logistique a été conçus pour la classification binaire et ne prennent pas en charge de manière native les tâches de classification comportant plus de deux classes.
Une approche permettant d’utiliser les algorithmes de classification binaire pour les problèmes de classification multi-classes consiste à diviser l’ensemble de données de classification multi-classes en plusieurs ensembles de données de classification binaire et à adapter un modèle de classification binaire sur chacun.
4. Pour un problème de régression, quel algorithme n’est pas la solution ?
A Gradient-Boosted Trees
B Arbres de Décision (AD)
C Régression de crête
D Régression logistique
D
L’algorithme de régression logistique est un algorithme de Machine Learning qui est utilisé pour les problèmes de classification binaire, c’est un algorithme d’analyse prédictive et basé sur le concept de probabilité.
5. Lequel des énoncés suivants est VRAIE à propos de DataFrame ?
A Les DataFrames offrent une API plus facile à utiliser que les RDD.
B L’API des DataFrames offre une sécurité au moment de la compilation.
C Les deux A et B
D Aucune de ces réponses
A
Les DataFrame d’Apache Spark fournissent une API de plus haut niveau, plus simple et plus expressive que celle des RDD, ce qui facilite la manipulation des données structurées. En revanche, les DataFrame ne garantissent pas la sécurité de type à la compilation ; cette fonctionnalité est propre aux Dataset (en Scala et Java). C’est pourquoi seule la proposition A est correcte.
6. Lequel des éléments suivants est un outil de la bibliothèque du Machine Learning ?
A Persistance
B Pipelines
C Utilitaires comme l’algèbre linéaire et les statistiques
D Tous les outils ci-dessus
D
La bibliothèque Spark MLlib fournit plusieurs outils pour le Machine Learning, notamment la persistance des modèles, les pipelines pour construire et enchaîner les étapes de traitement, ainsi que des utilitaires tels que l’algèbre linéaire, les statistiques et d’autres composants nécessaires à l’entraînement et à l’évaluation des modèles. Ainsi, les propositions A, B et C sont toutes correctes.
7. MLlib est-il déprécié ?
A Oui
B Non
C Peut-être
D Je ne sais pas!
B
MLlib n’est pas déprécié. La bibliothèque de Machine Learning d’Apache Spark est toujours activement utilisée. En revanche, l’ancienne API MLlib basée sur les RDD est en mode maintenance : elle continue d’être prise en charge, mais n’évolue plus. Les nouveaux développements et les nouvelles fonctionnalités sont désormais concentrés sur l’API basée sur les DataFrame (package spark.ml), qui est la solution recommandée pour créer des pipelines et des modèles de Machine Learning.
8. Lequel des énoncés suivants est FAUX pour Apache Spark ?
A Il fournit une API de haut niveau en Java, Python, R et Scala.
B Il peut être intégré à Hadoop et peut traiter les données HDFS existantes.
C Spark est un framework open source écrit en Java.
D Spark est 100 fois plus rapide que Bigdata Hadoop.
C
Cette affirmation est fausse, car Apache Spark est principalement écrit en Scala, et non en Java. Il fournit des API de haut niveau en Scala, Java, Python et R, s’intègre facilement avec Hadoop pour traiter les données stockées dans HDFS, et peut être jusqu’à 100 fois plus rapide que Hadoop MapReduce pour certaines charges de travail grâce au traitement en mémoire.
9. Lequel des énoncés suivants est VRAIE pour Spark SQL ?
A C’est le noyau de Spark
B Il fournit une plateforme d’exécution pour toutes les applications Spark.
C Il permet aux utilisateurs d’exécuter des requêtes SQL/HQL sur Spark.
D Il permet d’exécuter des applications interactives et d’analyse de données puissantes sur des données en direct.
C
Spark SQL est le module d’Apache Spark dédié au traitement des données structurées. Il permet d’exécuter des requêtes SQL et HiveQL (HQL) sur des données stockées dans différents formats (Hive, Parquet, JSON, CSV, etc.) en utilisant les DataFrame et Dataset. Les autres propositions décrivent respectivement Spark Core (A et B) et Spark Streaming / Structured Streaming (D).
10. Lequel des énoncés suivants est VRAIE pour Spark core ?
A C’est le noyau de Spark
B Il permet aux utilisateurs d’exécuter des requêtes SQL/HQL sur Spark.
C Il s’agit d’une bibliothèque scalable de machine learning qui offre des performances.
D Améliore considérablement les performances des algorithmes itératifs.
A
Spark Core est le noyau d’Apache Spark. Il fournit les fonctionnalités essentielles du framework, telles que la gestion des RDD, la planification des tâches, la gestion de la mémoire, la tolérance aux pannes et l’exécution distribuée sur un cluster. Les autres modules de Spark, comme Spark SQL, MLlib, GraphX et Spark Streaming, reposent tous sur Spark Core.