La nona tecnologia
Big Data
Dare la definizione di Big Data non è semplice tanto che Dan Ariely scriverà: “Big Data is like teenage sex: everyone talks about it, nobody really knows how to do it, everyone think severy one else is doing it, so everyone claims they are doing it…”
Una definizione univoca, chiara e comunemente accettata attualmente non esiste. Il parere di esperti fornisce definizione differenti e molti concordano sulla inadeguatezza delle definizioni attuali, tuttavia una parte rilevante di loro descrive i big utilizzando il modello delle 5V.
La definizione più comune attualmente usata di Big Data è: “sono quei dati che superano la portata degli ambienti hardware e degli strumenti software di uso comune per acquisirli, gestirli ed elaborarli entro un tempo trascorso tollerabile per gli utenti”
Possiamo provare a definire i big data come un importante concetto legato ai dati che non rispecchia la normale struttura dei database tradizionali, sono costituiti da tecnologie diverse tra loro (Hadoop, HDFS, NoSQL, MongoDB…) utilizzate contemporaneamente per estrarre valore da dati che sarebbero stati considerati inutili precedentemente.
I Big Data vengono creati aggregando enormi volumi di dati provenienti da fonti diversi e disponibili in formati differenti (foto, video, click e commenti sui social, acquisti negli store online, dati GPS, dati di produzione, delle vendite…).
Generalmente a Big Data vengono descritti con il modello delle 5+1V:
1. Volume: oggigiorno i dati vengono generati continuamente e in volumi enormi anche automaticamente da svariati dispositivi (telefoni cellulari, PC, sensori…) che non sarebbe possibile generare con le tecnologie tradizionali.
2. Velocità: sempre grazie ai nuovi dispositivi e alle nuove tecnologie la velocità con cui i dati vengono generati è sempre maggiore, le tecniche di analisi dati devono essere in grado di analizzarli in tempo reale.
3. Varietà: come è già stato scritto, la varietà dei dati è molto vasta, proprio perché le fonti sono differenti tra loro. Nelle analisi classiche si hanno a disposizione dati strutturati mentre in campo Big Data possono essere presenti sia dati strutturati che non strutturati.
4. Veridicità: la veridicità dei dati è sempre stato un problema, con i Big Data diventa ancora più difficile riuscire a garantire che i dati “dicano il vero”, nel dubbio un dato dovrebbe essere scartato secondo il principio “bad data is worse than no data”.
5. Variabilità: i dati sono molti, provenienti da fonti diverse e da contesti differenti. Il loro significato può variare e nell’analisi bisogna tenere conto di questa loro mutevolezza.
6. Valore: è l’aspetto fondamentale, avere a disposizioni pool enormi di dati e analisi non serve a nulla se non possono generare valore. Le tecniche di analisi devono essere in grado di estrapolare gli aspetti che rendono utilizzabili e in grado di generare valore.
Non è possibile processare i Big Data con le tecniche tradizionali e da soli i Big Data hanno poco valore, per poterlo estrapolare dai Big Data si utilizzano delle tecniche chiamate “Big Data Analytics”.
Si possono distinguere quattro tipi di analisi a valore crescente:
1. Analisi descrittiva: l’analisi descrittiva è il tipo di analisi più semplice e veloce e fornisce informazioni di valore inferiore rispetto alle altre forme di analisi. Tramite queste tecniche si forniscono informazioni sullo stato presente e passato di processi o aree funzionali aziendali, sono utili poiché permettono di imparare dal passato.
2. Analisi predittiva: sono tecniche più avanzate che cercano di fornire informazioni su cosa accadrà in futuro tramite una stima o una probabilità, per esempio si può cercare di capire per quali prodotti si avrà più richiesta o quali segmenti di mercato saranno in crescita.
3. Analisi prescrittiva: sono analisi molto avanzate esse propongono soluzioni ai decision-maker, fornisce una spiegazione di cosa sta succedendo, del perché sta succedendo e fornisce delle possibili soluzioni.
4. Analisi automatizzate: sono le più avanzate, esse sono in grado di implementare le soluzioni proposte.
Le ultime tre tipologie prendono il nome di “Advanced Analytics”.
Le competenze necessarie per lavorare in ambito Big Data riguardano diversi settori e sono svariate:
- programmazione, chi si occupa di Big Data deve conoscere i principali linguaggi di programmazione (Java, Python, R…)
- conoscenza del Machine Learning sia a livello di modelli matematico-statistici che a livello di algoritmi propri del ML
- capacità di gestire dati strutturati o non strutturati provenienti da fonti interne e esterne e i relativi software e tool collegati
- conoscenza del settore in cui opera l’azienda e il suo business per riuscire a capire quali devono essere gli obiettivi principali dell’analisi
- conoscenza di tecniche di rappresentazione dei dati, i risultati delle analisi interesseranno aree diverse e persone che non hanno conoscenza di analisi (manager, capi area, management…) e devono quindi essere presentati in maniera chiara e comprensibile anche da chi non ha conoscenze tecniche
Gli ambiti di applicazione dei Big Data sono molti, riguardano sia tematiche sociali (ottimizzazione dei flussi di turismo, medicina, gestione della pubblica amministrazione…) sia tematiche aziendali e finanziarie.
I Big Data sono impiegati dai biologi nello studio del genoma, infatti grazie ad essi è possibile generare enormi dataset composti da centinaia di migliaia di dati per scoprire marcatori genetici di malattie rare e trovare associazioni tra malattie e rare varianti di sequenze.
Anche le neuroscienze stanno sfruttando i Big Data, molte malattie (Alzheimer, la schizofrenia, depressione, ansia…), sono messe in relazione con le reti di connettività cerebrale. Capire l'organizzazione del lavoro della rete del cervello è importante per comprendere gli aspetti organici di queste malattie. Grazie ai Big Data e alle tecniche di analisi, è possibile confrontare e studiare un numero elevatissimo di immagini del cervello provenienti dalle fMRI per ottenere importanti informazioni, ciò è impensabile con le tecniche di analisi classiche.
Il settore economico-finanziario ricorre sempre più spesso ai Big Data per operare analisi multivariate di centinaia di variabili, per ottimizzare i portfolio e per il risk management.
Nel settore industriale per ora i Big Data sono stati utilizzati principalmente per:
- aumentare l’engagement con il cliente
- realizzare prodotti e servizi personalizzati
- aumentare le vendite
- diminuire il time to market
- espandere l’offerta di nuovi prodotti e servizi e ottimizzare quella attuale
- diminuire i costi
- cercare di individuare nuovi mercati
Altri usi connessi ai Big Data sono: sicurezza informatica, medicina personalizzata, “digital humanities”.
I Big Data sono un settore in continua evoluzione, emergono costantemente nuovi usi e le tecniche si evolvono velocemente andando di pari passo con l’evoluzione delle tecnologie e degli aspetti a loro legati come:
- Machine Learning
- Nuove architetture per l’analisi di dati, specialmente nuovi sistemi open source (come Hadoop)
- Cloud, specialmente l’ottimizzazione dell’hybrid cloud per questioni relative alla sicurezza dei dati
- Data monetization, ovvero la capacità di trasformare i dati in denaro e investimenti
- Categorie
- Industria 4.0

