Tables Rondes Le «Big Data»

Documents pareils
Cartographie des solutions BigData

L écosystème Hadoop Nicolas Thiébaud Tuesday, July 2, 13

HADOOP ET SON ÉCOSYSTÈME

Me#re le Big Data sur la carte : défis et avenues rela6fs à l exploita6on de la localisa6on

Programmation parallèle et distribuée

Big Data Concepts et mise en oeuvre de Hadoop

20 ans du Master SIAD de Toulouse - BigData par l exemple - Julien DULOUT - 22 mars ans du SIAD -"Big Data par l'exemple" -Julien DULOUT

Déploiement d une architecture Hadoop pour analyse de flux. françois-xavier.andreu@renater.fr

Programmation parallèle et distribuée (Master 1 Info )

Programmation parallèle et distribuée

Fouillez facilement dans votre système Big Data. Olivier TAVARD

Introduction à MapReduce/Hadoop et Spark

Big data et données géospatiales : Enjeux et défis pour la géomatique. Thierry Badard, PhD, ing. jr Centre de Recherche en Géomatique

Fouille de données massives avec Hadoop

Big Data : utilisation d un cluster Hadoop HDFS Map/Reduce HBase

Big Data, un nouveau paradigme et de nouveaux challenges

Panorama des solutions analytiques existantes

Big Data. Cyril Amsellem Consultant avant-vente. 16 juin Talend

MapReduce. Malo Jaffré, Pablo Rauzy. 16 avril 2010 ENS. Malo Jaffré, Pablo Rauzy (ENS) MapReduce 16 avril / 15

Labs Hadoop Février 2013

BIG DATA en Sciences et Industries de l Environnement

Les journées SQL Server 2013

Offre formation Big Data Analytics

Big Data. Les problématiques liées au stockage des données et aux capacités de calcul

BI dans les nuages. Olivier Bendavid, UM2 Prof. A. April, ÉTS

Ricco Rakotomalala R.R. Université Lyon 2

API04 Contribution. Apache Hadoop: Présentation et application dans le domaine des Data Warehouses. Introduction. Architecture

Les technologies du Big Data

Groupe de Discussion Big Data Aperçu des technologies et applications. Stéphane MOUTON

NoSQL. Introduction 1/30. I NoSQL : Not Only SQL, ce n est pas du relationnel, et le contexte. I table d associations - Map - de couples (clef,valeur)

Document réalisé par Khadidjatou BAMBA

Les participants repartiront de cette formation en ayant une vision claire de la stratégie et de l éventuelle mise en œuvre d un Big Data.

Sommaire. 3. Les grands principes de GFS L architecture L accès de fichier en lecture L accès de fichier en écriture Bilan

Prototypage et évaluation de performances d un service de traçabilité avec une architecture distribuée basée sur Hadoop

Acquisition des données - Big Data. Dario VEGA Senior Sales Consultant

Introduc)on à Map- Reduce. Vincent Leroy

Le BigData, aussi par et pour les PMEs

Transformez vos données en opportunités. avec Microsoft Big Data

Formation Cloudera Data Analyst Utiliser Pig, Hive et Impala avec Hadoop

WD et le logo WD sont des marques déposées de Western Digital Technologies, Inc, aux États-Unis et dans d'autres pays ; absolutely WD Re, WD Se, WD

SpagoBI: la seule suite décisionnelle 100% open source, complète et flexible


Hadoop, les clés du succès

Business Intelligence, Etat de l art et perspectives. ICAM JP Gouigoux 10/2012

Big Data et l avenir du décisionnel

NoSQL. Introduction 1/23. I NoSQL : Not Only SQL, ce n est pas du relationnel, et le contexte. I table d associations - Map - de couples (clef,valeur)

Dix bonnes raisons de choisir ExpressCluster en environnement virtualisé

Vos experts Big Data. Le Big Data dans la pratique

MapReduce. Nicolas Dugué M2 MIAGE Systèmes d information répartis

MapReduce et Hadoop. Alexandre Denis Inria Bordeaux Sud-Ouest France ENSEIRB PG306

Big Data. Concept et perspectives : la réalité derrière le "buzz"


Projet Xdata. Cinequant, Data Publica, EDF, ESRI, Hurence, INRIA, Institut Mines Telecom, La Poste, Orange, Veolia

Les enjeux du Big Data Innovation et opportunités de l'internet industriel. Datasio 2013

Transformation IT de l entreprise BIG DATA, MÉTIERS ET ÉVOLUTION DES BASES DE DONNÉES

Anticiper et prédire les sinistres avec une approche Big Data

VirtualScale L expert infrastructure de l environnement Open source HADOOP Sofiane Ammar sofiane.ammar@virtualscale.fr

Les quatre piliers d une solution de gestion des Big Data

Big Data? Big responsabilités! Paul-Olivier Gibert Digital Ethics

Surmonter les 5 défis opérationnels du Big Data

Cassandra chez Chronopost pour traiter en temps réel 1,5 milliard d événements par an

ÉCOLE DE TECHNOLOGIE SUPÉRIEURE UNIVERSITÉ DU QUÉBEC RAPPORT DE PROJET PRÉSENTÉ À L ÉCOLE DE TECHNOLOGIE SUPÉRIEURE

Organiser vos données - Big Data. Patrick Millart Senior Sales Consultant

NewPoint IT Consulting BIG DATA WHITE PAPER. NewPoint Information Technology Consulting

Implémentation parallèle de certains algorithmes de fouille de données avec le framework MapReduce

Livre. blanc. Solution Hadoop d entreprise d EMC. Stockage NAS scale-out Isilon et Greenplum HD. Février 2012

Hadoop : une plate-forme d exécution de programmes Map-Reduce

Big Graph Data Forum Teratec 2013

Hadoop : une plate-forme d exécution de programmes Map-Reduce

Devenez un virtuose de Google. Atelier en informa5que présenté par Dominic P. Tremblay

Bases de données documentaires et distribuées Cours NFE04

À PROPOS DE TALEND...

Big Data Jean-Michel Franco

Ecole des Hautes Etudes Commerciales HEC Alger. par Amina GACEM. Module Informatique 1ière Année Master Sciences Commerciales

Introduction Big Data

Hadoop dans l entreprise: du concept à la réalité. Pourquoi et comment?

Notre catalogue E- forma8ons Management E- LEARNING CENTRE DE FORMATION INFORMATIQUE ET MANAGEMENT. Plateforme E- learning :

Titre : La BI vue par l intégrateur Orange

DEMARRER UN PROJET BIGDATA EN QUELQUES MINUTES GRACE AU CLOUD

DÉPLOIEMENT DE QLIKVIEW POUR DES ANALYSES BIG DATA CHEZ KING.COM

Monétisation des données : comment identifier de nouvelles sources de revenus au sein des Big data?

1 Actuate Corporation de données. + d analyses. + d utilisateurs.

FORUM NTIC BIG DATA, OPEN DATA Big Data: les challenges, les défis

BIGDATA AN 3 : UNE NOUVELLE ERE DE B.I.

LES SOLUTIONS DE MESSAGERIE ET BUREAUTIQUE PROFESSIONNELLES

Le Pôle ORACLE d ITS-Overlap. Platinum Partner

Pentaho Business Analytics Intégrer > Explorer > Prévoir

Quels choix de base de données pour vos projets Big Data?

Les bases de données relationnelles

AVRIL Au delà de Hadoop. Panorama des solutions NoSQL

BIG DATA. Veille technologique. Malek Hamouda Nina Lachia Léo Valette. Commanditaire : Thomas Milon. Encadré: Philippe Vismara

Performances Veille. Système d Information. Semaine 25 du 18 au 24 juin Numéro 228

BI SWISS FORUM (ecom / SITB)

LES SOLUTIONS OPEN SOURCE RED HAT

Cassandra et Spark pour gérer la musique On-line

IBM Software Big Data. Plateforme IBM Big Data

HÉBERGEMENT CLOUD & SERVICES MANAGÉS

Analytics & Big Data. Focus techniques & nouvelles perspectives pour les actuaires. Université d Eté de l Institut des Actuaires Mardi 8 juillet 2014

R+Hadoop = Rhadoop* Des logiciels libres complémentaires, une implémentation, une réponse au nouveau paradigme du bigdata!

Le BIG DATA????? Big Buzz? Big Bang? Big Opportunity? Big hype? Big Business? Big Challenge? Big Hacking? Gérard Peliks planche 2

Transcription:

Tables Rondes Le «Big Data» 2012-2013 1

Plan Introduc9on 1 - Présenta9on Ingensi 2 - Le Big Data c est quoi? 3 - L histoire 4 - Le monde du libre : Hadoop 5 - Le système HDFS 6 - Les algorithmes distribués : Map Reduce 7 - Hbase : La base NoSQL 2012-2013 2

Ingensi, team du groupe Cyrès Ingensi est une division du groupe Cyrès spécialisée dans le traitement et l analyse temps réel de gros volumes de données. Ce>e division est animée par Christophe Cerqueira (directeur de projets) et Guillaume Polaert (Responsable R&D). Les 3 pôles complémentaires du Groupe CYRES : Architectures à la demande et services hébergés dans le Cloud. Leader Français de la messagerie CollaboraTve Exchange. Consultants confirmés et experts de la data : DBA Oracle et PostgreSQL, ETL- EAI, ODI, Business Intelligence Agence de communicaton digitale spécialisé dans les solutons mobiles et 2.0 Quelques expertses clés Spécialiste en intégraton de données avec des outls EAI/ETL/ELT (ODI, Talend, etc.) Infogérance de milliers de comptes Exchange/ Sharepoint Mise en place d outls alternatfs de reportng et de «datavizual9on» comme Tableau Soaware 3 datacenters, disponibilité garan9e 99,9% SécurisaTon des données, cer9fica9on PCI- DSS Level 1 Visa & Mastercard pour NORDPAY Partenariat DELL - Ingensi Complémentarité : offre globale de services et de support autour de la soluton Cloudera (Hadoop) Acteurs Majeur de la fourniture d infrastructures de machines Hautes Performances pour les solutons Big Data 3

1- Ingensi, notre vision du Big Data Lancement du projet Ingensi en septembre 2009, CréaTon d une équipe R&D (Lauréat JCEF- 37 en 2011) Constat De plus en plus de difficultés à traiter les données et canaliser les flux entrants Sauvegarde et resttuton de l informaton de plus en plus complexes Coût des solutons éditeurs croissant (Oracle, Microsoa, etc.) Maturité des «pure- players» de l Internet (Google, Yahoo, Facebook, etc.) ObjecTfs du projet Structurer une offre de services et de conseils autour des Big Data et de l écosystème Hadoop Mise à dispositon d une offre SaaS pour le traitement ponctuel et/ou économique de grands volumes de données CréaTon d un pôle de compétences et de formatons autour Hadoop Offre de services Ingensi Sensibilisa9on des acteurs informatques aux problématques «Big Data» et aux solutons adaptées RéalisaTon de «Proof Of Concept» et de maque>e DéfiniTon des architectures techniques/ fonctonnelles FormaTons et support (Cloudera) AdministraTon et optmisaton d un cluster Hadoop SoluTons : Mahout (Analyse),Hive (BI),HBase (NoSQL) La R&D, au cœur de l offre Partenariat avec l université de Tours Mise en place d une thèse Volonté de créer un pôle «français» contributeur des solutons Hadoop Projet Européen pour construire un Cluster de 1600 Cores 4

2 - Big Data, solu9on au data déluge? Quelques chiffres 1,8 ze`aoctets en 2011 soit une pile de blu- ray qui ferait 7 fois le tour de la Terre 1 60% de croissance/an des volumes d informa9ons 5% pour les budgets informa9ques 2 Un Boeing produit 20 To/heure de données 2 250 milliards d emails envoyés par jour (80 % de spam) 3 72h de vidéos déposées par minute sur Youtube Les systèmes actuels sont incapables de gérer de telles quanttés : 80% 95% de l informa9on est «non- structurée» 4 de l informa9on est non- exploitée 4 (1) IDC, 2011 - (2) Gartner, 2011 - (3) Radica7 Group, 2009 - (4) Forrester, 2011 Début d une nouvelle ère 5

2 - Big Data, préparer et an9ciper Les solutons actuelles répondent mal (pas) aux problématques liées, avec un TCO élevé (Exadata d Oracle, Netezza d IBM, etc.) Les applicatons doivent changer Pour Dimensionnées à l échelle de la planète Flux de données complexes, multples et en temps réel Agilité à tous les niveaux : analyse, stockage, resttuton Trer profit de ses données mais également de celles qui sont à portée de main, répondre à des besoins qui pour le moment n étaient pas adressables et tout ça en temps réel 6

2 - Big Data, trois «V» Les solutons mises en œuvre doivent répondre aux 3 «V» dans leur globalité Volume SaturaTon des systèmes actuels avec toujours plus de données Vélocité Quel délai pour prendre une décision à partr de l informaton collectée? Variété Intégrer une multtude de formats différents provenant d une multtude de sources de données BIG DATA 7

3 - L histoire : le Big Data, Google : Le système de fichier GFS Pour stocker son Index Grandissant Quelle solu4on pour Google? U4lisa4on d un SGBDR? è Problème de distribu4on des données è problème du nombre d u4lisateurs è problème de Vitesse du moteur de recherche InvenTon d un nouveau système Propriétaire : GFS ( Google File Système en 2003) 8

3 - L histoire : le Big Data, Google : Le système de fichier GFS

3 - L histoire : le Big Data, Comment exploiter ce système de fichier? La no4on de Big Data est in4mement lié à la capacité de traitements de gros volumes è Un nouvel Algorithme a été mis au point. Le premier ArTcle a été publié en 2004 : Jeffrey Dean and Sanjay Ghemawat MapReduce : Simplified Data Processing on Large Clusters C est un algorithme inventé par Google, Inc afin de distribuer des traitements sur un ensemble de machines avec le système GFS Google possède aujourd'hui plus de 1 000 0000 de serveurs interconnectés dans le monde 10

3 - L histoire : le Big Data, Google et les autres ü Contributeur de l implémenta9on Libre ( Dugg Kelng) ü Les pures players de l internet ont choisi d u9liser ces algos distribués. ( HDFS et MAPREDUCE) - Facebook - TwiIer - LinkedIn -. 11

Le monde du Libre : Hadoop 12

4 - Big Data, solu9on Apache Hadoop Hadoop Projet ini9é par les pure- players de l Internet (Yahoo, Facebook, Twi>er) dès 2008 Inspiré des travaux de Google Libre, fonda9on Apache Enrichit chaque jour par de nombreuses sociétés dédiées : Cloudera, Hortonworks, etc. 2 concepts clés HDFS : Stockage économique et extensible, pour de grandes quanttés d informaton bénéficiant d une haute tolérance aux pannes MapReduce : Algorithme de traitements parallèles et distribués des données. Écosystème riche Mahout : machine- learning (dataming, clustering) HBase : base de données temps- réel NoSQL Hive : traitement batch analytque BI 3 éditeurs (Cloudera, Hortonworks, MapR) 13

5 - HDFS, système de fichiers distribués ObjecTfs et principes Stocker de grandes quanttés d informaton à moindre coût» u9lisa9on de serveurs courants Idéalement des fichiers volumineux Haute tolérance aux pannes» donnée répliquée 3 fois sur 3 serveurs géographiquement distants Stockage extensible à volonté» ajout à chaud de serveurs pour augmenter les capacités de stockage et de traitement de l architecture Techniquement HDFS namenode : serveur maître. Cartographie des blocs de données sur le cluster. Vital pour la plateforme datanode : stocker localement les blocs de données. Informe le namenode de son état «via un ba>ement de cœur» toutes les secondes. Possibilité de définir sa positon géographique (site de données, rack) pour que le namenode contrôle au mieux les différents emplacements des blocs de données 14

6 - MapReduce, algorithme de traitement des données Principe Traitement divisé en tâche lesquelles sont traitées en parallèle : MAP Synthèse et agrégaton des traitements : REDUCE Les traitements sont effectués là où la donnée est stockée (sur chaque serveur) Techniquement Service«jobtracker» coordonne l exécuton du traitement. Découpe et affecte chaque tâche aux tasktracker. Service «tasktracker» responsable de l exécuton de la tâche localement. Si une tâche échoue, le jobtracker la relance sur un autre serveur. 15

7- HBase, base de données NoSQL temps réel Pourquoi? Nécessité d un mode «temps réel» pour le système Hadoop. Le mode batch ne convient pas à toutes les applicatons Concepts clés Base de données NoSQL en «mode colonne» GesTon des transactons simple Déploiement à grande échelle sur un très grand nombre de serveurs ParTTonnement automatque des tables par l ajout de serveur (region server) ModélisaTon des données orientée «recherche» Usages Stockage et recherche de n importe quel type de données (PDF, photos, document word, etc.). Données accessibles via de nombreuses API Stockage dénormalisé des données InserTon et recherche en temps réel via une série de méthode Recherche très rapide (concept «in memory») 16

INGENSI Groupe Cyrès 19-21 rue Édouard Vaillant 37000 Tours Tél : 02 47 68 48 50 contact@ingensi.com 17