Les technologies du Big Data



Documents pareils
Formation Cloudera Data Analyst Utiliser Pig, Hive et Impala avec Hadoop

Panorama des solutions analytiques existantes

HADOOP ET SON ÉCOSYSTÈME

Groupe de Discussion Big Data Aperçu des technologies et applications. Stéphane MOUTON

Fouillez facilement dans votre système Big Data. Olivier TAVARD

Programmation parallèle et distribuée

AVRIL Au delà de Hadoop. Panorama des solutions NoSQL

Cartographie des solutions BigData

Surmonter les 5 défis opérationnels du Big Data

BIG DATA en Sciences et Industries de l Environnement

20 ans du Master SIAD de Toulouse - BigData par l exemple - Julien DULOUT - 22 mars ans du SIAD -"Big Data par l'exemple" -Julien DULOUT

La dernière base de données de Teradata franchit le cap du big data grâce à sa technologie avancée

Déploiement d une architecture Hadoop pour analyse de flux. françois-xavier.andreu@renater.fr

Bases de données documentaires et distribuées Cours NFE04

Pentaho Business Analytics Intégrer > Explorer > Prévoir

Big Data : utilisation d un cluster Hadoop HDFS Map/Reduce HBase

Stephan Hadinger, Sr. Mgr Solutions Architecture, AWS. Salon du Big Data 11 mars 2015

Les participants repartiront de cette formation en ayant une vision claire de la stratégie et de l éventuelle mise en œuvre d un Big Data.

Programmation parallèle et distribuée

Ricco Rakotomalala R.R. Université Lyon 2

L écosystème Hadoop Nicolas Thiébaud Tuesday, July 2, 13

Organiser vos données - Big Data. Patrick Millart Senior Sales Consultant

CNAM Déploiement d une application avec EC2 ( Cloud Amazon ) Auteur : Thierry Kauffmann Paris, Décembre 2010

Hadoop, Spark & Big Data 2.0. Exploiter une grappe de calcul pour des problème des données massives


Introduction Big Data

Les journées SQL Server 2013

Bases de données documentaires et distribuées Cours NFE04

Big Data. Cyril Amsellem Consultant avant-vente. 16 juin Talend

Introduction à MapReduce/Hadoop et Spark

MapReduce. Nicolas Dugué M2 MIAGE Systèmes d information répartis

Offre formation Big Data Analytics

Les bases de données relationnelles

11/01/2014. Le Big Data Mining enjeux et approches techniques. Plan. Introduction. Introduction. Quelques exemples d applications

Labs Hadoop Février 2013

Anticiper et prédire les sinistres avec une approche Big Data

Big Data Concepts et mise en oeuvre de Hadoop

M2 GL UE DOC «In memory analytics»

Business Intelligence avec Excel, Power BI et Office 365

Les quatre piliers d une solution de gestion des Big Data

Entreprise et Big Data

Document réalisé par Khadidjatou BAMBA

Big data et données géospatiales : Enjeux et défis pour la géomatique. Thierry Badard, PhD, ing. jr Centre de Recherche en Géomatique


Business Intelligence, Etat de l art et perspectives. ICAM JP Gouigoux 10/2012

Technologies Web. Ludovic Denoyer Sylvain Lamprier Mohamed Amine Baazizi Gabriella Contardo Narcisse Nya. Université Pierre et Marie Curie

Big Data On Line Analytics

R+Hadoop = Rhadoop* Des logiciels libres complémentaires, une implémentation, une réponse au nouveau paradigme du bigdata!

Big Data. Concept et perspectives : la réalité derrière le "buzz"

Drupal : Optimisation des performances

La rencontre du Big Data et du Cloud

Amazon Elastic MapReduce (Amazon EMR)

VirtualScale L expert infrastructure de l environnement Open source HADOOP Sofiane Ammar sofiane.ammar@virtualscale.fr

DOSSIER SOLUTION CA ERwin Modeling. Comment gérer la complexité des données et améliorer l agilité métier?

MapReduce. Malo Jaffré, Pablo Rauzy. 16 avril 2010 ENS. Malo Jaffré, Pablo Rauzy (ENS) MapReduce 16 avril / 15

Introduction aux algorithmes MapReduce. Mathieu Dumoulin (GRAAL), 14 Février 2014



Suite Jedox La Business-Driven Intelligence avec Jedox

DEMARRER UN PROJET BIGDATA EN QUELQUES MINUTES GRACE AU CLOUD

Guide de référence pour l achat de Business Analytics

NoSQL. Introduction 1/23. I NoSQL : Not Only SQL, ce n est pas du relationnel, et le contexte. I table d associations - Map - de couples (clef,valeur)

Formation continue. Ensae-Ensai Formation Continue (Cepe)

Business Intelligence

Projet Xdata. Cinequant, Data Publica, EDF, ESRI, Hurence, INRIA, Institut Mines Telecom, La Poste, Orange, Veolia

NoSQL. Introduction 1/30. I NoSQL : Not Only SQL, ce n est pas du relationnel, et le contexte. I table d associations - Map - de couples (clef,valeur)

Quels choix de base de données pour vos projets Big Data?

CENTAI : Big Data & Big Analytics Réunion DGPN / Thales Octobre 2013

Programme ASI Développeur

Big Graph Data Forum Teratec 2013

BIG DATA. Veille technologique. Malek Hamouda Nina Lachia Léo Valette. Commanditaire : Thomas Milon. Encadré: Philippe Vismara

Masses de données. 1. Introduction 2. Problématiques 3. Socle de formation (non présenté) 4. Liens avec Formation INSA

Cloud Computing Maîtrisez la plate-forme AWS - Amazon Web Services

Analytics Platform. MicroStrategy. Business Intelligence d entreprise. Self-service analytics. Big Data analytics.

Hadoop, les clés du succès

Présentation du module Base de données spatio-temporelles

BIG DATA et DONNéES SEO

Tables Rondes Le «Big Data»

DÉPLOIEMENT DE QLIKVIEW POUR DES ANALYSES BIG DATA CHEZ KING.COM

OFFRE MDB Service & Architecture Technique. MyDataBall Saas (Software as a Service) MyDataBall On Premise

SQL Server 2012 et SQL Server 2014

Vos experts Big Data. Le Big Data dans la pratique

4 Exemples de problèmes MapReduce incrémentaux

Technologie, méthode et applications du Big Data.

NoSQL. Etat de l art et benchmark

Windows Azure. Principales fonctions

Vérifier la qualité de vos applications logicielle de manière continue

LE BIG DATA. TRANSFORME LE BUSINESS Solution EMC Big Data

Analytics & Big Data. Focus techniques & nouvelles perspectives pour les actuaires. Université d Eté de l Institut des Actuaires Mardi 8 juillet 2014

Big Data, un nouveau paradigme et de nouveaux challenges

Cette première partie pose les enjeux de la BI 2.0 et son intégration dans le SI de l entreprise. De manière progressive, notre approche situera le

PostgreSQL, le cœur d un système critique

Cassandra chez Chronopost pour traiter en temps réel 1,5 milliard d événements par an

UNIFIED D TA. architecture nouvelle génération pour une restauration garantie (assured recovery ) que les données soient sur site ou dans le cloud

BIG Data et R: opportunités et perspectives

UE 8 Systèmes d information de gestion Le programme

Architectures d implémentation de Click&DECiDE NSI

Guide de référence pour l achat de Business Analytics

Transcription:

Les technologies du Big Data PRÉSENTÉ AU 40 E CONGRÈS DE L ASSOCIATION DES ÉCONOMISTES QUÉBÉCOIS PAR TOM LANDRY, CONSEILLER SENIOR LE 20 MAI 2015 WWW.CRIM.CA

TECHNOLOGIES: DES DONNÉES JUSQU'À L UTILISATEUR Source: SAP 2

TECHNOLOGIES: LES PRINCIPAUX COMPOSANTS Source: Thales 3

LA BASES DE DONNÉES RELATIONNELLE, ESPÈCE MENACÉE? ACID Propriétés garantissant la fiabilité des transactions Plus difficile à garantir lorsque distribué Source: Wikibooks La base de données relationnelle S adapte mal aux capacités de stockage et de traitement modernes Schémas fixes, peu agiles Mise à l échelle verticale (plus gros serveurs) Presque toutes ACID cependant Source: ixwebhosting.mobi 4

UNE ALTERNATIVE, LE NOSQL Motivations Technique: mise à l échelle horizontale Financière: alternative aux solutions propriétaires Agilité: évolution rapide des technos Particularités des bases NoSQL Applications en ligne, en production Nouveaux types et structures de données Parfait pour les méthodes agiles Source: couchdb Les modèles de données Document: tout usage, flexible Ø Élimine le besoin de joindre des tables Graph: Nœuds, liens, propriétés Ø Plus facile de modéliser les relations Clé-valeur: applications ciblées Ø Haute-performance par mise à l échelle 5

HADOOP ET LE MAP-REDUCE Apache Hadoop Cadriciel pour stocker et traiter des données massives de façon distribuée OpenSource, avec distributions commerciales (Cloudera, Hortonworks) Composants principaux Ø HDFS: système de fichier Ø YARN: gestion des requêtes Ø MapReduce: traitement parallèle MapReduce Diviser pour conquérir! Réparti les données en blocs indépendants Peu efficace pour les tâches itératives et interactives Source: MongoDB MAP: conversion par division des données d entrée et distribution aux noeuds REDUCE: récupération des résultats et combinaison pour le nœud maître. 6

L ACCÈS AUX DONNÉES Apache Hive HQL: syntaxe similaire au SQL Rend Hadoop plus accessible, car HQL transformées en MapReduce Ligne de commande, JDBC, ODBC ou applications C++, Python, Java, etc. Apache Pig Language PigLatin pour flots de données complexes Étendu par Java, Ruby ou autres langages de script Composant permettant de bâtir des applications d affaires ETL (Extract, Transform, Load) E: Bases de données, XML, CSV, JSON, logs T: Sélectionner, trier, joindre, aggréger L: Mise-à-jour, publication, archive Hive et Pig pour le ETL Hive conçu pour les entrepots, mais peut être lent Plus petite courbe d apprentissage pour Hive Pig conçu pour le ETL En général, Pig plus puissant Source: analyticsengines.com 7

L INFONUAGIQUE S EN MÊLE Plateformes infonuagiques Solutions commerciales matures, par exemple Amazon EC2 Ø Choix du type d instances (CPU, MEM, stockage, OS, etc.) Ø Paiement à l usage, à la demande, réservées, ponctuelles, etc. La plus connue dans le libre est OpenStack Calcul, stockage, réseautique, sécurité, quotas, administration, télémétrie, etc. MapReduce comme service Déploiement et gestion d instances Hadoop: un défi Solution Amazon: Ø Données massives d entrée dans S3, résultats vers S3 Ø Elastic MapReduce (EMR): Hadoop, Spark, Hive, Pig Solution OpenStack, projet Sahara: Ø «Analytics as a Service» Ø Accès par API REST ou dans l interface de gestion OpenStack Ø Simplification du flot de travail Source: hadoopshere.com 8

LE TRAITEMENT EN MÉMOIRE Source: SAP Traitement VIP en temps réel pour larges blocs de données Limite le goulot d étranglement E/S, parallélisme des cœurs du CPU, emploi des caches, puis de la RAM Souvent employé en contexte BI temps réel (rapports, indicateurs, tableaux de bord) 9

APACHE SPARK, LE NOUVEL ÉLÈVE MODÈLE Source: SQLstream.com Spark, un cadriciel de traitement unifié et tout usage En mémoire (100x plus rapide que Hadoop?) API Java, Scala et Python, avec shell interactif Support de MapReduce, SQL et HDFS Flux (micro-batch, fenêtre temporelle) Apprentissage machine 10

L APPRENTISSAGE MACHINE Apprendre pour prédire Classifier Regrouper Détecter Estimer Décider Réduire Comment? Supervisé Ø Voici les entrées et les sorties, quelles sont les règles? Non supervisé Ø Voici les données, quelles structures vois-tu? Techniques Réseaux de neurones (deep learning) Arbres de décision Algorithmes génétiques Etc. Source: frontiersin.org Source: Sharif University 11

PAR OÙ COMMENCER? Source: Dlib.net 12

LA VISUALISATION Source: jinfonet.com Source: d3js.org 13

L ANALYTIQUE VISUELLE Source: Tamara Munzer, UBC 14

L OMNIPRÉSENCE DU GÉOSPATIAL Source: GeoMesa 15

DÉSILLUSIONNÉS DU BIG DATA? Source: Gartner 16

LA RÉALITÉ VIRTUELLE ET L IMMERSION Source: Los Alamos National Laboratory L ingénierie de l avenir? Tirer profit du cerveau humain pour détecter, déduire, comprendre Emploi de tout le corps pour interagir Environnements collaboratifs et immersifs Simulations et modélisations de systèmes complexes Source: Monash University 17

UNE NOUVELLE RACE D ORDINATEURS Le calculateur quantique Exit les bits (1 OU 0), voici le qbit (1 ET 0 à la fois) La machine peut simultanément considérer toutes les combinaisons possibles Le problème est exprimé en termes de contraintes sur les qbits; la réponse fixe les qbits dans un état stable L optimisateur idéal? Meilleure route, meilleure répartition, meilleur état, meilleur arrangement Complément du CPU comme co-processeur Source: Dwave Source: creondai.com.br 18

WWW.CRIM.CA Tom Landry Conseiller senior Équipe Vision et Imagerie CRIM Centre de recherche informatique de Montréal Tom.Landry@crim.ca Suivez-nous Dialoguez avec nous Suivez-nous #CRIM_ca wwwcrimca Le CRIM est un centre de recherche appliquée en TI qui développe, en mode collaboratif avec ses clients et partenaires, des technologies innovatrices et du savoir-faire de pointe, et les transfère aux entreprises et aux organismes québécois afin de les rendre plus productifs et plus compétitifs localement et mondialement. Le CRIM dispose de quatre équipes de recherche en TI de calibre mondial qui œuvrent principalement dans les domaines des interactions et interfaces personne-système, de l analytique avancée et de la science et technologie du logiciel. Détenteur d une certification ISO 9001:2008, son action s inscrit dans les politiques et stratégies pilotées par le ministère de l'économie, de l'innovation et des Exportations (MEIE), son principal partenaire financier. Principal partenaire financier Tous droits réservés 2015 CRIM. 405, avenue Ogilvy, bureau 101, Montréal (Québec) H3N 1M3/514 840-1234/1 877 840-2746