1. 什麼是大數據要簡單通俗點的解釋
這是一個非常好的問題,作為一名大數據從業者,我來回答一下。
在當前的大數據時代,不僅IT(互聯網)行業的人需要了解大數據相關知識,傳統行業的從業者和普通大學生也都應該了解一定的大數據知識,在產業互聯網和新基建計劃的推動下,未來大數據技術將全面開始落地應用,大數據也將重塑整個產業結構。
了解大數據首先要從大數據的概念開始,不同於人工智慧概念,大數據概念還是相對比較明確的,而且大數據的技術體系也已經趨於成熟了。解釋大數據概念,可以從數據自身的特點入手,然後進一步從場景、應用和行業來逐漸展開。
大數據自身的特點往往集中在五個方面,分別是數據量、數據結構多樣性、數據價值密度、數據增長速度和可信度,對於這五個維度的理解和認知,是了解大數據概念的關鍵。當然,隨著大數據技術的發展和在行業領域的應用,關於數據自身的維度也有了一定程度的擴展,這些擴展本身也是對大數據概念的一種豐富和完善。
數據量大是大數據的一個重要特徵,但是數據量本身是一個匯集的概念,並不是只有很大的數據才稱為大數據,傳統信息系統所產生的「小數據」也是大數據的一個重要組成部分,這一點一定要有清晰的認知。當前從大數據的數據來源來看,主要集中在三個渠道,包括互聯網、物聯網和傳統信息系統,物聯網數據當前占據的比例比較大,相信在5G時代,物聯網將依然是大數據的主要數據來源。
數據結構多樣性是大數據的另一個重要特點,不同於創新信息系統(ERP)當中的數據,大數據的數據類型是非常復雜的,既有結構化數據,也有非結構化數據和半結構化數據,這對於傳統的數據處理技術提出了巨大的挑戰,這也是推動大數據技術產生的一個重要原因。在工業互聯網時代,大數據的數據結構多樣性會進一步得到體現,這對於數據價值化過程也提出了新的挑戰。
數據價值密度往往是衡量數據價值的重要基礎,相對於傳統的信息系統來說,大數據當中的數據價值密度是比較低的,這就需要有更快速和便捷的方式,來完成數據的價值化提取過程,而這也正是當前大數據平台所關注的核心能力之一。實際上,早期的Hadoop、Spark平台之所以能夠脫穎而出,一個重要的原因就是其數據處理(排序)速度比較快。
數據增長速度快是大數據的另一個重要表現,通常傳統信息系統的數據增量是可以預測的,或者說增長速度是可控的,但是在大數據時代,數據增長速度已經大大突破了傳統數據處理所能承載的極限。數據增長是一個相對的概念,相對於消費互聯網來說,產業互聯網所帶來的數據增量可能會更加客觀,因此產業互聯網時代會進一步打開大數據的價值空間。
最後,大數據還有一個特點就是數據本身的真實性,大數據時代所帶來的一個重要副作用就是數據真假難辨,這也是當前大數據技術所要重點解決的問題之一。從當前大型互聯網平台所採用的方法來看,通常是技術和管理相結合的方式,比如通過為用戶認證就能夠解決一部分數據的真實性(專業性)問題。
如果有互聯網、大數據、人工智慧等方面的問題,或者是考研方面的問題,都可以在評論區留言,或者私信我!
博士時候就是做大數據。
最通俗一點就是很多條數據。
我們做大數據研究呢,就是高效的處理數據,對未來做一些預測,建議等。
例如,全中國人大多數都是10點睡覺。睡覺前看一看手機。那我們做推廣時候,就可以選擇9點半的時間。
大數據沒有什麼特別神秘的地方,就是數據多一點。
大數據這個詞其實流行了很久了,與我們的生活息息相關,並不陌生,現在我們生活中的大平台基本上都用到大數據,淘寶,拼多多,美團,滴滴等都用到大數據,如今大數據基本上無處不在。
一、大數據是什麼意思
大數據(big data),IT行業術語,是指無法在一定時間范圍內用常規軟體工具進行捕捉、管理和處理的數據集合,是需要新處理模式才能具有更強的決策力、洞察發現力和流程優化能力的海量、高增長率和多樣化的信息資產。
二、大數據特徵
容量(Volume):數據的大小決定所考慮的數據的價值和潛在的信息;
種類(Variety):數據類型的多樣性;
速度(Velocity):指獲得數據的速度;
可變性(Variability):妨礙了處理和有效地管理數據的過程。
真實性(Veracity):數據的質量。
復雜性(Complexity):數據量巨大,來源多渠道。
價值(value):合理運用大數據,以低成本創造高價值。
三、大數據的 歷史 發展
人類誕生以來,數據就開始膨脹,時代交替,工業革命,互聯網時代,5G時代,人工智慧時代,都是數據的一次次發展,數據的不斷精準,加快了人類的新陳代謝,大數據推動 歷史 發展。
四、大數據意義
大數據的價值體現在以下幾個方面:
1、對大量消費者提供產品或服務的企業可以利用大數據進行精準營銷;
2、做小而美模式的中小微企業可以利用大數據做服務轉型;
3、面臨互聯網壓力之下必須轉型的傳統企業需要與時俱進充分利用大數據的價值。
4、各大領域的科研需要大數據,加快技術變革和換代如醫療,環保,公共政府服務
5、航空航天,軍事領域因為大數據也會得到突飛猛進的提升。
生活工作中所有的流水賬信息就是大數據,在信息化時代,它通過特定模式的整合、分析,使人得到對自己有用的、有指導性的結論。參加工作時講台塑數字化、表單化、信息化,一晃二十年了,應該就是大數據的雛形,但那會信息化能力不足,沒人這么稱呼。管理是千變萬幻,主線未變,大數據也僅僅是一種方法,只是更符合形勢,更有效。小名流水賬,大名大數據。
舉個例子,大數據記錄了一個愛抽煙的男人。晚上一般是先抽煙以後刷牙。有一天男士刷了牙以後抽煙。第二天app開始推送了tt。根據兩天的記錄了刷牙到抽煙的時間,第三天app推送了加厚版的tt。一個半月後某天記錄到男人一直抽煙,便推送了某家專科醫院。再過了一個月,發現男人再無抽煙,推送了鉑爵旅拍。
從前有個大爺,在證券公司車庫上班,給證券公司大戶、老闆看守車,這么一個工作。
這位大爺特別喜歡炒股,他也不會技術分析,什麼基本面分析!每當呢,車庫裡面的車停的非常少的時候,這位大爺就買進股票,這大爺也不知道什麼股票好,什麼股票不好,就隨便買,等車庫裡面的車停的越來越多了,每次都停滿了的時候,這位大爺就買出股票。每次都能賺到錢!!!
這就是非常簡單的大數據,大爺利用車庫里車的多少來判斷市場的火熱程度,人棄我取,等到全民炒股的時候,市場就會出現泡沫,這時候離「崩盤」也就不遠了
大數據通俗的解釋就是海量的數據,顧名思義,大就是多、廣的意思,而數據就是信息、技術以及數據資料,合起來就是多而廣的信息、技術、以及數據資料。
大數據簡單的說就是市場調研的升級版。包括騰訊,阿里巴巴等這些具有大量用戶的公司,對其客戶在其平台的所有行為發布的所有內容進行採集分類和分析。而這些數據有分成共性和個性。從所有人中採集出共性有助於發覺商機,了解客戶痛點,更好地推出客戶滿意的產品,比如很多化妝品公司就會跟淘寶購買數據從而研發出更貼合市場需求的產品。而從你個人採集的數據屬於個性,系統會通過你個人的數據採集進行相對於的推薦和改變,也就是我們經常說的ai智能,例子像我們的淘寶現在都是千人千面,每人手機打開的淘寶推薦的東西都不一樣,這些就是大數據的效果。
大數據通俗來說就是有個機器,把你生活中的點點滴滴都記錄下來,形成一種特定的形式!
大數據簡單來說:就是海量的信息!不論用途,不論方向,就是簡單地信息收集,參數收集,所有這些匯總起來就是大數據。大數據,不是隨機樣本,而是所有數據!
而大數據分析,就是針對這些信息進行識別,再進行分類,將其有事件變為數據化,概率化,然後應用於各種商業用途。
以上是對大數據簡單地解讀。那麼大數據的意義何在呢?
隨著大數據的發展,企業的技術研發、應用和落地在前期就能獲得預期,能避免很多無所謂的浪費,以便於將有限的資源集中到開發更適合時代的企業產業。
商業決策可以通過數據分析來獲取更為准確的信息和方向,最終能幫助決策者能更為准確直觀的指導業務實踐。
人工智慧離不開數據。隨著人工智慧的發展,數據能模擬的更加人性化,也更個人化,也更適合於各種不同場景的應用。大數據的價值在於它是目前解決這個時代更新最有效的方法。
但對於我個人而言,比較抵觸過度的大數據和互聯網,原因如下:
一、當各類app通過我的使用習慣,推薦各種我搜索過一次的各種商業廣告時,我會有種隱私被人冒犯的憤怒;
二、當你在使用各類軟體時,都會被要求提供個人信息以便於獲得更好的用戶體驗,這無形中增加了個人數據泄露的風險;
三、當數據化盛行,似乎人性變得無處安放;
四、一旦行業固化,人們想要突破階層將變得不可能,擁有大量數據的將遙遙領先,後發的行人,將一輩子連望其項背的資格都沒有,可以預見 社會 將會成為一潭死水,毫無興趣和生機。
2. 大數據和數據大集中有什麼區別和聯系
大數據實質是數據量到了一定程度,怎麼獲取、處理和分析的事情。其他問題比回如數據中心怎麼建設、是否採用答數據大集中的形式可以說和大數據的實質關系不大。大數據使用的數據可以是集中的一處拿來的,更可能是分布在多地或者一地的多處的。
數據大集中是一種建設模式。意思主要是不搞分級分地區的部署,而把數據中心統一在一處。比如銀行的中國南北兩大數據中心、稅務部門的大集中建設,這樣資料庫在物理上是位於一處匯總的(當然為了數據安全,可有異地備份),對銀行和稅務等部門來說,便於提取和統計,特別是便於總行總局之類的上級部門直接拿到各地業務數據。
所以我的感覺是,兩者關系不大。主要看業務類型和上級要求吧。特別需要統一匯總和管理數據的,或者運維力量集中保障高可用高安全的,採用數據大集中適合。大數據,只有能獲取和挖掘數據,隨意怎麼玩。當然,如果數據是集中存放的話,更方便大數據平台拿和用。
3. 大數據的定義是什麼
大數據並抄不只是數據量大而已,它是數據存儲+分布式調度+數據分析的結合
大數據是指無法在一定時間范圍內用常規軟體工具進行捕捉、管理和處理的數據集合,是需要新處理模式才能具有更強的決策力、洞察發現力和流程優化能力的海量、高增長率和多樣化的信息資產,簡單來說大數據就是海量的數據,就是數據量大、來源廣、種類繁多(日誌、視頻、音頻),大到PB級別,現階段的框架就是為了解決PB級別的數據。
大數據的7大特徵:海量性,多樣性,高速性,可變性,真實性,復雜性,價值性
隨著大數據產業的發展,它逐漸從一個高端的、理論性的概念演變為具體的、實用的理念。
很多情況下大數據來源於生活。
比如你點外賣,准備什麼時候買,你的位置在哪,商家位置在哪,想吃什麼……這都是數據,人一多各種各樣的信息就越多,還不斷增長,把這些信息集中,就是大數據。
大數據的價值並不是在這些數據上,而是在於隱藏在數據背後的——用戶的喜好、習慣還有信息。
4. 什麼是大數據
大數據技術具有「5V」特徵:Volume(體量大)、Variety(多樣性)、Velocity(變化快)、Veracity(准確性)、Value(價值大)。在維克托·邁爾-舍恩伯格及肯尼斯·庫克耶編寫的《大數據時代》中大數據指不用隨機分析法(抽樣調查)這樣捷徑,而採用所有數據進行分析處理。
大數據(big data),或稱巨量資料,指的是所涉及的資料量規模巨大到無法透過主流軟體工具,在合理時間內達到擷取、管理、處理、並整理成為幫助企業經營決策更積極目的的資訊。
實用意義:
現在的社會是一個高速發展的社會,科技發達,信息流通,人們之間的交流越來越密切,生活也越來越方便,大數據就是這個高科技時代的產物。阿里巴巴創辦人馬雲來台演講中就提到,未來的時代將不是IT時代,而是DT的時代,DT就是Data Technology數據科技,顯示大數據對於阿里巴巴集團來說舉足輕重。
有人把數據比喻為蘊藏能量的煤礦。煤炭按照性質有焦煤、無煙煤、肥煤、貧煤等分類,而露天煤礦、深山煤礦的挖掘成本又不一樣。與此類似,大數據並不在「大」,而在於「有用」。價值含量、挖掘成本比數量更為重要。對於很多行業而言,如何利用這些大規模數據是贏得競爭的關鍵。
以上內容參考:網路-大數據
5. 什麼是大數據,大數據的的基本特徵是什麼
大數據(big data),是指無法在可承受的時間范圍內用常規軟體工具進行捕捉、管理和處理的數據 *** 。 1. 數據量大,TB,PB,乃至EB等數據量的數據需要分析處理。 2. 要求快速響應,市場變化快,要求能及時快速的響應變化
大數據(Big Data)是指「無法用現有的軟體工具提取、存儲、搜索、共享、分析和處理的海量的、復雜的數據 *** 。」業界通常用4個V(即Volume、Variety、Value、Velocity)來概括大數據的特徵。
一是數據體量巨大(Volume)。截至目前,人類生產的所有印刷材料的數據量是200PB(1PB=210TB),而歷史上全人類說過的所有的話的數據量大約是5EB(1EB=210PB)。當前,典型個人計算機硬碟的容量為TB量級,而一些大企業的數據量已經接近EB量級。
二是數據類型繁多(Variety)。這種類型的多樣性也讓數據被分為結構化數據和非結構化數據。相對於以往便於存儲的以文本為主的結構化數據,非結構化數據越來越多,包括網路日誌、音頻、視頻、圖片、地理位置信息等,這些多類型的數據對數據的處理能力提出了更高要求。
三是價值密度低(Value)。價值密度的高低與數據總量的大小成反比。以視頻為例,一部1小時的視頻,在連續不間斷的監控中,有用數據可能僅有一二秒。如何通過強大的機器演算法更迅速地完成數據的價值「提純」成為目前大數據背景下亟待解決的難題。
四是處理速度快(Velocity)。這是大數據區分於傳統數據挖掘的最顯著特徵。
社群營銷,是基於圈子、人脈概念而產生的營銷模式。通過將有共同興趣愛好的人聚集在一起,將一個興趣圈打造成為消費家園。
可以通過大數據預測進行組建社群為企業做宣傳搞活動,讓社群形成一個宣傳途徑或者一個小的發布平台,不過性質的社群,依賴於群主對群的組織和維護能力。
作為一名工作兩年多的大數據系統研發師,之前在北京老男孩教育學習了四個多月的大數據,總結我學習和工作兩年來對大數據的理解,從具體的應用上,也大概可以分為三類。一是決策支持類的二是風險預警類的第三種是實時優化類的從三個維度,我個人對大數據在各行業應用的可能性做了一個定位,但這個定位還是非常定性和粗略的,具體可能還需要對行業有更多的大數據應用的探討和探索。我也是看書學的,但是效果很慢。
「大數據」是指以多元形式,許多來源搜集而來的龐大數據組,往往具有實時性。
大數據(big data,mega data),或稱巨量資料,指的是需要新處理模式才能具有更強的決策力、洞察力和流程優化能力的海量、高增長率和多樣化的信息資產。
大數據的5V特點:Volume(大量)、Velocity(高速)、Variety(多樣)、Value(價值密度)、Veracity(真實性)。
第一,Volume(大量),數據體量巨大。從TB級別,躍升到PB級別。
第二,Variety(多樣),數據類型繁多,如前文提到的網路日誌、視頻、圖片、地理位置信息,等等。
第三,Value(價值密度),價值密度低。以視頻為例,連續不間斷監控過程中,可能有用的數據僅僅有一兩秒。
第四,Velocity(高速),處理速度快。1秒定律。最後這一點也是和傳統的數據挖掘技術有著本質的不同。物聯網、雲計算、移動互聯網、車聯網、手機、平板電腦、PC以及遍布地球各個角落的各種各樣的感測器,無一不是數據來源或者承載的方式。
所以通俗來說,大數據就是通過各種不同渠道收集到的大量數據,堆積起來幫助做決策分析的數據組
那麼什麼是大數據呢技術?大數據的概念是什麼呢?本文就為大家詳細解讀大數據的構成、模型和未來大數據發展方向: 大數據概念: 隨著每天互聯網上海量數據的產生,數據分析尤其顯得重要。所謂大數據技術,就是從各種各樣類型的數據中,快速獲得有價值信息的能力。 大數據產生的原因: 大數據時代的來臨是由數據豐富度決定的。首先是社交網路興起,互聯網上每天大量非結構化數據的出現。另外,物聯網的數據量更大,加上移動互聯網能更准確、更快地收集用戶信息,比如位置、生活信息等數據。從這些數據每天增加的數量來說,目前已進入大數據時代。 大數據書籍推薦: 一、《大數據-正在到來的數據革命.以及它如何改變 *** .商業與我們的生活》 大數據浪潮,洶涌來襲,與互聯網的發明一樣,這絕不僅僅是信息技術領域的革命,更是在全球范圍啟動透明 *** 、加速企業創新、引領社會變革的利器。 二、《大數據——大價值、大機遇、大變革(全彩)》 從實證的角度探討了大數據對社會和商業智能的影響,能否對大數據進行處理、分析與整合將成為提升企業核心競爭力的關鍵,什麼是大數據技術?既是一場大機遇,也將引發一場大變革!
要提一下魔據的數據不錯的
大數據(big data),或稱海量資料,指的是所涉及的資料量規模巨大到無法通過目前主流軟體工具,在合理時間內達到擷取、管理、處理、並整理成為幫助企業經營決策更積極目的的資訊。
4V特徵:Volume(大量)、Velocity(實時)、Variety(多樣)、Value(價值)。
大數據已經成為各類大會的重要議題,管理人士們都不願錯過這一新興趨勢。毫無疑問,當未來企業嘗試分析現有海量信息以推動業務價值增值時,必定會採用大數據技術。
大數據(BigData)是指「無法用現有的軟體工具提取、存儲、搜索、共享、分析和處理的海量的、復雜的數據 *** 。」業界通常用4個V(即Volume、Variety、Value、Velocity)來概括大數據的特徵。
數據體量巨大(Volume)。截至目前,人類生產的所有印刷材料的數據量是200PB,而歷史上全人類說過的所有的話的數據量大約是5EB(1EB=210PB)。
數據類型繁多(Variety)。相對於以往便於存儲的以文本為主的結構化數據,非結構化數據越來越多,包括網路日誌、音頻、視頻、圖片、地理位置信息等,這些多類型的數據對數據的處理能力提出了更高要求。
價值密度低(Value)。價值密度的高低與數據總量的大小成反比。如何通過強大的機器演算法更迅速地完成數據的價值「提純」成為目前大數據背景下亟待解決的難題。
處理速度快(Velocity)。大數據區分於傳統數據挖掘的最顯著特徵。根據IDC的「數字宇宙」的報告,預計到2020年,全球數據使用量將達到35.2ZB。
-------------------------------------------
社交網路,讓我們越來越多地從數據中觀察到人類社會的復雜行為模式。社交網路,為大數據提供了信息匯集、分析的第一手資料。從龐雜的數據背後挖掘、分析用戶的行為習慣和喜好,找出更符合用戶「口味」的產品和服務,並結合用戶需求有針對性地調整和優化自身,就是大數據的價值。
所以,建立在上述的概念上我們可以看到大數據的產業變化:
1大數據飛輪效應所帶來的產業融合和新產業驅動
2信息獲取方式的完全變化帶來的新式信息聚合
3信息推送方式的完全變化帶來的新式信息推廣
4精準營銷
5第三方支付——小微信貸,線上眾籌為代表的互聯網金融帶來的全面互聯網金融改革
6產業垂直整合趨勢以及隨之帶來的產業生態重構
7企業改革以及企業內部價值鏈重塑,擴大的產業外部邊界
8 *** 及各級機構開放,透明化,以及隨之帶來的集中管控和內部機制調整
9數據創新帶來的新服務
6. 大數據概述及基本概念
大數據的定義首先,還是要重新審視大數據的定義。
行業里對大數據的定義有很多,有廣義的定義,也有狹義的定義。
廣義的定義,有點哲學味道——大數據,是指物理世界到數字世界的映射和提煉。通過發現其中的數據特徵,從而做出提升效率的決策行為。
狹義的定義,是技術工程師給的——大數據,是通過獲取、存儲、分析,從大容量數據中挖掘價值的一種全新的技術架構。
相比較而言,我還是喜歡技術定義,哈哈。
大家注意,關鍵詞我都在上面原句加粗了哈!
要做什麼?——獲取數據、存儲數據、分析數據
對誰做?——大容量數據
目的是什麼?——挖掘價值
獲取數據、存儲數據、分析數據,這一系列的行為,都不算新奇。我們每天都在用電腦,每天都在干這個事。
例如,每月的月初,考勤管理員會獲取每個員工的考勤信息,錄入Excel表格,然後存在電腦里,統計分析有多少人遲到、缺勤,然後扣TA工資。
但是,同樣的行為,放在大數據身上,就行不通了。換言之,傳統個人電腦,傳統常規軟體,無力應對的數據級別,才叫「大數據」。
2.大數據,到底有多大?
我們傳統的個人電腦,處理的數據,是GB/TB級別。例如,我們的硬碟,現在通常是1TB/2TB/4TB的容量。
TB、GB、MB、KB的關系,大家應該都很熟悉了:
1 KB = 1024 B (KB - kilobyte)
1 MB = 1024 KB (MB - megabyte)
1 GB = 1024 MB (GB - gigabyte)
1 TB = 1024 GB (TB - terabyte)
而大數據是什麼級別呢?PB/EB級別。
大部分人都沒聽過。其實也就是繼續翻1024倍:
1 PB = 1024 TB (PB - petabyte)
1 EB = 1024 PB (EB - exabyte)
只是看這幾個字母的話,貌似不是很直觀。我來舉個例子吧。
1TB,只需要一塊硬碟可以存儲。容量大約是20萬張照片或20萬首MP3音樂,或者是671部《紅樓夢》小說。
1PB,需要大約2個機櫃的存儲設備。容量大約是2億張照片或2億首MP3音樂。如果一個人不停地聽這些音樂,可以聽1900年。
1EB,需要大約2000個機櫃的存儲設備。如果並排放這些機櫃,可以連綿1.2公里那麼長。如果擺放在機房裡,需要21個標准籃球場那麼大的機房,才能放得下。
阿里、網路、騰訊這樣的互聯網巨頭,數據量據說已經接近EB級。
EB還不是最大的。目前全人類的數據量,是ZB級。
1 ZB = 1024 EB (ZB - zettabyte)
2011年,全球被創建和復制的數據總量是1.8ZB。
而到2020年,全球電子設備存儲的數據,將達到35ZB。如果建一個機房來存儲這些數據,那麼,這個機房的面積將比42個鳥巢體育場還大。
數據量不僅大,增長還很快——每年增長50%。也就是說,每兩年就會增長一倍。
目前的大數據應用,還沒有達到ZB級,主要集中在PB/EB級別。
大數據的級別定位:1 KB = 1024 B (KB - kilobyte)
1 MB = 1024 KB (MB - megabyte)
1 GB = 1024 MB (GB - gigabyte)
1 TB = 1024 GB (TB - terabyte)
1 PB = 1024 TB (PB - petabyte)
1 EB = 1024 PB (EB - exabyte)
1 ZB = 1024 EB (ZB - zettabyte)
3.數據的來源
數據的增長,為什麼會如此之快?
說到這里,就要回顧一下人類社會數據產生的幾個重要階段。
大致來說,是三個重要的階段。
第一個階段,就是計算機被發明之後的階段。尤其是資料庫被發明之後,使得數據管理的復雜度大大降低。各行各業開始產生了數據,從而被記錄在資料庫中。
這時的數據,以結構化數據為主(待會解釋什麼是「結構化數據」)。數據的產生方式,也是被動的。如果你對大數據開發感興趣,想系統學習大數據的話,可以戳我加入大數據技術學習交流群,私信管理員即可免費領取開發工具以及入門學習資料
第二個階段,是伴隨著互聯網2.0時代出現的。互聯網2.0的最重要標志,就是用戶原創內容。
隨著互聯網和移動通信設備的普及,人們開始使用博客、facebook、youtube這樣的社交網路,從而主動產生了大量的數據。
第三個階段,是感知式系統階段。隨著物聯網的發展,各種各樣的感知層節點開始自動產生大量的數據,例如遍布世界各個角落的感測器、攝像頭。
經過了「被動-主動-自動」這三個階段的發展,最終導致了人類數據總量的極速膨脹。
4.大數據的4Vs
行業里對大數據的特點,概括為4個V。前面所說的龐大數據體量,就是Volume(海量化)。除了Volume之外,剩下三個,分別是Variety、Velocity、Value。
我們一個一個來介紹。
Variety(多樣化)
數據的形式是多種多樣的,包括數字(價格、交易數據、體重、人數等)、文本(郵件、網頁等)、圖像、音頻、視頻、位置信息(經緯度、海拔等),等等,都是數據。
數據又分為結構化數據和非結構化數據。
從名字可以看出,結構化數據,是指可以用預先定義的數據模型表述,或者,可以存入關系型資料庫的數據。
例如,一個班級所有人的年齡、一個超市所有商品的價格,這些都是結構化數據。
而網頁文章、郵件內容、圖像、音頻、視頻等,都屬於非結構話數據。
在互聯網領域里,非結構化數據的佔比已經超過整個數據量的80%。
大數據,就符合這樣的特點:數據形式多樣化,且非結構化數據佔比高。
Velocity(時效性)
大數據還有一個特點,那就是時效性。從數據的生成到消耗,時間窗口非常小。數據的變化速率,還有處理過程,越來越快。例如變化速率,從以前的按天變化,變成現在的按秒甚至毫秒變化。
我們還是用數字來說話:
就在剛剛過去的這一分鍾,數據世界裡發生了什麼?
Email:2.04億封被發出
Google:200萬次搜索請求被提交
Youtube:2880分鍾的視頻被上傳
Facebook:69.5萬條狀態被更新
Twitter:98000條推送被發出
12306:1840張車票被賣出
……
怎麼樣?是不是瞬息萬變?
Value(價值密度)
最後一個特點,就是價值密度。
大數據的數據量很大,但隨之帶來的,就是價值密度很低,數據中真正有價值的,只是其中的很少一部分。
例如通過監控視頻尋找犯罪分子的相貌,也許幾TB的視頻文件,真正有價值的,只有幾秒鍾。