1. 大數據入門書籍有哪些
當年互聯網瘋狂發展的時候,很多人在觀望和猶豫中錯過了這班順風車(沒有盡早開個淘寶店,腸子都悔青了好幾遍呢)。如今,同樣的橋段上演,大數據時代,堅決不能再無動於衷!
於是,你著急,你迷茫,你很方……除了平時要加班加點的搬磚,牙縫里擠出來的的閑碎時間都貢獻給度娘了,「小白如何學習大數據」,「大數據入門書籍有哪些」……
1:<大數據時代>
這是學習大數據必讀的一本書,也是最系統的關於大數據概念的一本書,由維克托·邁爾-舍恩伯格和肯尼斯·庫克耶編寫,主要介紹了大數據理念和生活工作及思維變革的關系。
它被包括寬頻資本董事長田朔寧、知名IT評論人謝文等專業讀者鑒定為「大數據領域最好的著作沒有之一,一本頂一萬本」。有這么好嗎?看完自己評價吧。這本書對這個大規模產生、分享和應用數據的新的大時代進行了闡述和釐清,作者圍繞「要全體不要抽樣、要效率不要絕對精確、要相關不要因果」三大理念,通過數十個商業和學術案例,剖析了萬事萬物數據化和數據復用挖掘的巨大價值。
2:<爆發>
由巴拉巴西編寫,主要講了在一個歷史故事的連續講述中,了解大數據的概念實質。從大數據的歷史開始,能更深入的了解大數據的發展歷程。
巴拉巴西整本書講述的大數據根本目的,是預測。他甚至有零有整地判斷,人類行為93%是可以預測的。打個比方,千百年前人類無法如今天般准確預測天氣,以致某些大致預測的行為都被認為是「通神」,其實核心在於對天氣數據的海量佔有和分析能力。但假如全人類的所有基礎及行為數據全部被佔有全部能分析呢?比如通過智能終端LBS功能採集全部運動軌跡、通過金融系統採集所有支付記錄、通過SNS採集所有社會關系和通過郵件、文檔、社會視頻監控和自我視頻監測採集所有言行記錄,24小時,每分每秒,一生,全地球70億人,那會如何?
3:<大數據>
由徐子沛編寫,看美國政府在大數據開放上的進程與反復,算是個案。如果能夠基本了解這三本的觀點,出門有底氣,見人腰桿直,不再被忽悠。
全書講述的,是大數據在美國政府管理中的應用,以及美國政府運行方式大數據變革的歷史與斗爭,其實也是故事性的。從奧巴馬上台就頒布《信息公開法案》,到設立第一個美國政府首席信息官開始,講述美國政府與民間在社會數據公開的斗爭史,以及美國社會管理向大數據思維轉變的過程。首先,這算是一個最詳實的案例;其次,這代表的不是某種管理方式變革,深處是對民主運行機制的變革與進步。說好了,這本書用心良苦,遠遠超越科普技術領域;說壞了,其心可誅。有一段,民間斗爭,逼迫奧巴馬公布所有每日白宮全部日程,包括接見了誰、談話的全部內容,這不就是個人大數據全公開在公眾人物上的應用嗎?這可比現在所謂官員公開財產的要求高了幾十倍——這要求政府全部行為、全部數據、全部公開,全體公眾隨時可查——技術和成本上其實已經可以做到或至少努力接近——如果不這么做,不止是落後問題而是真正的其心可誅了。
4:<大數據基礎與應用>
由陳明編寫。看名字就知道,入門級別拯救小白的書。這本書共17章,第1章是對大數據的簡單概述,第2章介紹大數據研究的方法論,第3、8、9、14章介紹大數據的生態環境,第17章介紹數據科學的內容,剩下的章節是本書重點,介紹大數據技術及應用方法。
身處大數據大環境下,身邊的人經常討論資料庫、數據可視化、大數據預處理等等。這些詞聽得多了會讓人產生錯覺——自己已經知道裡面的門道了。但事實上還是個「門外漢」。
舉個例子,沒有人肯在上千人規模的講座上專門花半個小時教你怎樣進行數據清洗。本書專門列了一章,詳細介紹大數據預處理技術,包括數據清洗的實現方式,從步驟到檢驗,都做了用心的闡述。諸如此類,數據挖掘、大數據流式計算、Hadoop、NoSQL等等都從最基礎的點做了詳細介紹。耐心看完這些,再往深處進階就不會那麼吃力了。
5:<一本書讀懂大數據>
進入大數據時代,讓數據開口說話將成為司空見慣的事情,本書將從大數據時代的前因後果講起,全面分析大數據時代的特徵、企業實踐的案例、大數據的發展方向、未來的機遇和挑戰等內容,展現一個客觀立體、自由開放的大數據時代。
5:<集體智慧編程>
入門,淺顯易懂,裡面每一章都是一個案例,但是很方便,有具體的代碼,用來入門最好。
6:<社交網路的數據挖掘>
專門做社交網路的數據挖掘,案例很豐富,有代碼。
7:<數據可視化之美>
致力於介紹各種可視化方案。
8:<鮮活的數據>
比較簡單的可視化,不過內容豐富,有代碼。
9:<數據挖掘導論完整版>
看完上述的書,對大數據產生很大的興趣,已經初步入門了,現在開始理論方面的學習,數據挖掘入門教程,個人覺得寫的很好,目前正在研究這本書,努力。。。
10:<統計學習方法>
這本書比較深,剛開始看的就是這一本,不過太深,看到一半,准備在導論看完之後,在看這本書提升一下自己。
11:<鳥哥私房菜—基礎篇>
作為一個計算機專業linux那是必學的,而且Hadoop是建立在Linux基礎上的,不求多麼的精通,但是基礎的操作要學會。
如果是沒有任何編程語言基礎的想入行大數據的話,是必須要學習java基礎的,雖然大數據支持很多開發語言,但是企業用的最多的還是java,接下來學習數據結構,關系型資料庫,linux系統操作,有了基礎之後,在進入大數據學習,可以給小白學習的體系。
第一階段
COREJAVA(加**的需重點熟練掌握,其他掌握)
Java基礎**
數據類型
運算符、循環
演算法
順序結構程序設計
程序結構
數組及多維數組
面向對象**
構造方法、控制符、封裝
繼承**
多態**
抽象類、介面**
常用類
集合Collection、list**
HashSet、TreeSet、Collection
集合類Map**
異常
File
文件/流**
數據流和對象流**
線程(理解即可)
網路通信(理解即可)
第二階段
數據結構
關系型資料庫
Linux系統操作
Linux操作系統概述
安裝Linux操作系統
圖形界面操作基礎
Linux字元界面基礎
字元界面操作進階
用戶、組群和許可權管理
文件系統管理
軟體包管理與系統備份
Linux網路配置
(主要掌握Linux操作系統的理論基礎和伺服器配置實踐知識,同時通過大量實驗,著重培養學生的動手能力。使學生了解Linux操作系統在行業中的重要地位和廣泛的使用范圍。在學習Linux的基礎上,加深對伺服器操作系統的認識和實踐配置能力。加深對計算機網路基礎知識的理解,並在實踐中加以應用。掌握Linux操作系統的安裝、命令行操作、用戶管理、磁碟管理、文件系統管理、軟體包管理、進程管理、系統監測和系統故障排除。掌握Linux操作系統的網路配置、DNS、DHCP、HTTP、FTP、SMTP和POP3服務的配置與管理。為更深一步學習其它網路操作系統和軟體系統開發奠定堅實的基礎。與此同時,如果大家有時間把javaweb及框架學習一番,會讓你的大數據學習更自由一些)
重點掌握:
常見演算法
資料庫表設計
SQL語句
Linux常見命令
第三階段
Hadoop階段
離線分析階段
實時計算階段
重點掌握:
Hadoop基礎
HDFS
MapRece
分布式集群
Hive
Hbase
Sqoop
Pig
Storm實時數據處理平台
Spark平台
若之前沒有項目經驗或JAVA基礎,掌握了第一階段進入企業,不足以立即上手做項目,企業需再花時間與成本培養;
第二階段掌握扎實以後,進入企業就可以跟著做項目了,跟著一大幫人做項目倒也不用太擔心自己能不能應付的來,當然薪資不能有太高的要求;
前兩個階段都服務於第三階段的學習,除了熟練掌握這些知識以外,重點需要找些相應的項目去做,不管項目大小做過與沒有相差很多的哦!掌握扎實後可直接面對企業就業,薪資待遇較高!
2. 有什麼好的大數據書籍推薦嗎
1、舍恩伯格的《大數據時代》;
2、巴拉巴西的《爆發》;
3、塗子沛的《大數據》
這幾本書都不錯,可以看看!
3. 數據挖掘從入門到進階 要看什麼書
推薦:Jiawei Han的《數據挖掘概念與技術》、Ian H. Witten 的《數據挖掘實用機器學習技術》、Pang-Ning Tan的《數據挖掘導論》、Matthew A. Russell的《社交網站的數據挖掘與分析》、Anand Rajaraman的《大數據》。
數據挖掘通常與計算機科學有關,並通過統計、在線分析處理、情報檢索、機器學習、專家系統(依靠過去的經驗法則)和模式識別等諸多方法來實現上述目標。數據挖掘是一種決策支持過程,它主要基於人工智慧、機器學習、模式識別、統計學、資料庫、可視化技術等。
高度自動化地分析企業的數據,作出歸納性的推理,從中挖掘出潛在的模式,幫助決策者調整市場策略,減少風險,作出正確的決策。知識發現過程由以下三個階段組成數據准備、數據挖掘、結果表達和解釋。數據挖掘可以與用戶或知識庫交互。
數據挖掘是通過分析每個數據,從大量數據中尋找其規律的技術,主要有數據准備、規律尋找和規律表示三個步驟。數據准備是從相關的數據源中選取所需的數據並整合成用於數據挖掘的數據集。數據挖掘的任務有關聯分析、聚類分析、分類分析、異常分析、特異群組分析和演變分析等。
4. 推薦一本關於大數據,數據分析類似的書籍
1、《Hadoop權威指南》
現在3.1版本剛剛發布,但官方並不推薦在生產環境使用。作為hadoop的入門書籍,從2.x版本開始也不失為良策。
本書從Hadoop的緣起開始,由淺入深,結合理論和實踐,全方位地介紹Hadoop這一高性能處理海量數據集的理想工具。剛剛更新的版本中,相比之前的版本增加了介紹YARN , Parquet , Flume, Crunch , Spark的章節,非常適合於Hadoop 初學者。
2、《Learning Spark》
《Spark 快速大數據分析》是一本為Spark 初學者准備的書,它沒有過多深入實現細節,而是更多關註上層用戶的具體用法。不過,本書絕不僅僅限於Spark 的用法,它對Spark 的核心概念和基本原理也有較為全面的介紹,讓讀者能夠知其然且知其所以然。
3、《Spark機器學習:核心技術與實踐》
以實踐方式助你掌握Spark機器學習技術。本書採用理論與大量實例相結合的方式幫助開發人員掌握使用Spark進行分析和實現機器學習演算法。通過這些示例和Spark在各種企業級系統中的應用,幫助讀者解鎖Spark機器學習演算法的復雜性,通過數據分析產生有價值的數據洞察力。
5. 有哪些關於雲計算,大數據,物聯網的書籍值得推薦
關於大數據書籍有以下基本了參考看:
1.大數據預測
2.大數據時代
3.大數據分析:決勝互聯網金融時代
4.為數據而生:大數據創新實踐
5.爆發:大數據時代預見未來的新思維
6. 市面上大數據的書不少,如果只挑一本,哪本值得推薦
市場上大數據的說不少,但是你要挑一本的話,其實我還是覺得你在網路上選擇一些自己可以公開的數據。因為每個人需要的每個程度的書是不一樣的,你可以選擇購買一些書的電子版本。電子版本反而比書籍會更好一點。
7. 大數據怎麼學
大數據零基礎系統學習,這里給你分享一條入門學習路線——
第一步:培養對於大數據的基本認知
大數據是什麼,大數據未來的發展方向和應用場景有哪些,想要入行做大數據,先對培養其基本的行業背景知識是很有必要的。推薦可以看一些相關書籍,例如《大數據時代》、《數據之美》等。
第二步:大數據技術理論知識學習
零基礎小白能不能學懂大數據,能不能形成系統的技術體系,這一步很關鍵。
1、Java:主要為Java的標准版JavaSE。另外,JDBC是一定要掌握的,因為它關繫到Java與資料庫的連接。
2、Linux:因為大數據相關軟體都是在Linux上運行的,所以Linux要學習的扎實一些,大數據軟體的運行環境和網路環境配置會常常用到。
3、Hadoop:這個是必學的,核心組件HDFS、MapRece和YARN,還有生態圈的常用組件。
4、Oozie:用於管理你的Hive或者MapRece、Spark腳本,還能檢查你的程序是否執行正確。
5、python:用於編寫網路爬蟲。
6、Kafka:比較好用的消息隊列工具,數據吞吐量很大。
7、Spark:用來彌補基於Hadoop中MapRece處理數據速度上的缺點,特別適合做迭代運算。
學完這些技術框架之後,最好還要有相應的項目來做實戰練習,鞏固對理論知識的掌握,能夠實際去完成一個大數據項目周期當中的所有環節,這樣才能在就業市場上獲得更大的競爭優勢。
8. 入門數據分析行業可以看哪些書
1、統計學
《赤裸裸的統計學》
理由:了解學習統計學的意義,在日常生活中統計學有什麼用?也可以當成一本科普書。
《深入淺出統計學》
理由:零基礎可以輕松愉快的學會,書裡面有通俗易懂的案例,圖文並茂,學習統計學不會那麼枯燥。
《商務與經濟統計》
理由:適合有基礎的人看,可以深入了解統計學。零基礎看這本書會有些困難。
2、SQL
《SQL基礎教程》
理由:零基礎入門,通俗易懂,裡面的案例也很貼合實際應用。
《SQL必知必會》
理由:有基礎的可以把這本書當作一本字典來使用,遇到問題了,可以查找對應的內容。
3、業務知識
電商行業:《數據化管理:洞悉零售及電子商務運營》
游戲行業:《游戲數據分析實戰》
網站:《網站分析實戰》
HR行業 《人力資源與大數據分析》
金融行業:《消費金融真經:個人貸款業務全流程指南》
其他行業:國外作者肖恩的《增長黑客》
關於入門數據分析行業可以看哪些書,青藤小編就和您分享到這里了。如果您對大數據工程有濃厚的興趣,希望這篇文章可以為您提供幫助。如果您還想了解更多關於數據分析師、大數據工程師的技巧及素材等內容,可以點擊本站的其他文章進行學習。
9. 大神,關於大數據處理方面的書籍有推薦嗎
《大數據處理之來道》作者:自何金池
分析比較了當下流行的大數據處理技術的優劣及適用場景,包括Hadoop、Spark、Storm、Dremel、Drill等,詳細分析了各種技術的應用場景和優缺點;同時闡述了大數據下的日誌分析系統,重點講解了ELK日誌處理方案;最後分析了大數據處理技術的發展趨勢,重點從各種技術的起源、設計思想、架構等方面闡述大數據處理之道。
10. 有什麼比較好的大數據入門的書推薦
比較好的大數據入門的書有《大數據日知錄:架構與演算法》。
《大數據日知錄:架構與演算法》是2014年電子工業出版社出版的圖書,作者是張俊林。《大數據日知錄:架構與演算法》從架構與演算法的角度全面梳理了大數據存儲與處理的相關技術。大數據技術具有涉及的知識點異常眾多且正處於快速演進發展過程中等特點。
其技術點包括底層的硬體體系結構、相關的基礎理論、大規模數據存儲系統、分布式架構設計、各種不同應用場景下的差異化系統設計思路、機器學習與數據挖掘並行演算法以及層出不窮的新架構、新系統等。
主要介紹
本書對眾多紛繁蕪雜的相關技術文獻和系統進行了擇優汰劣並系統性地對相關知識分門別類地進行整理和介紹,將大數據相關技術分為大數據基礎理論、大數據系統體系結構、大數據存儲。
以及包含批處理、流式計算、互動式數據分析、圖資料庫、並行機器學習的架構與演算法以及增量計算等技術分支在內的大數據處理等幾個大的方向。通過這種體系化的知識梳理與講解,相信對於讀者整體和系統地了解、吸收和掌握相關的技術有很大的幫助與促進作用。