uci機器學習資料庫_大數據分析工具詳盡介紹&數據分析演算法

㈠如何獲取大數據信息

一、公開資料庫
常用數據公開網站：

UCI：經典的機器學習、數據挖掘數據集，包含分類、聚類、回歸等問題下的多個數據集。很經典也比較古老，但依然活躍在科研學者的視線中。

國家數據：數據來源中華人民共和國國家統計局，包含了我國經濟民生等多個方面的數據，並且在月度、季度、年度都有覆蓋，全面又權威。

亞馬遜：來自亞馬遜的跨科學雲數據平台，包含化學、生物、經濟等多個領域的數據集。

figshare：研究成果共享平台，在這里可以找到來自世界的大牛們的研究成果分享，獲取其中的研究數據。

github：一個非常全面的數據獲取渠道，包含各個細分領域的資料庫資源，自然科學和社會科學的覆蓋都很全面，適合做研究和數據分析的人員。

二、利用爬蟲可以獲得有價值數據
這里給出了一些網站平台，我們可以使用爬蟲爬取網站上的數據，某些網站上也給出獲取數據的API介面，但需要付費。

1.財經數據，2.網貸數據；3.公司年報；4.創投數據；5.社交平台；6.就業招聘；7.餐飲食品；8.交通旅遊；9.電商平台；10.影音數據；11.房屋信息；12.購車租車；13.新媒體數據；14.分類信息。

三、數據交易平台
由於現在數據的需求很大，也催生了很多做數據交易的平台，當然，出去付費購買的數據，在這些平台，也有很多免費的數據可以獲取。

優易數據：由國家信息中心發起，擁有國家級信息資源的數據平台，國內領先的數據交易平台。平台有B2B、B2C兩種交易模式，包含政務、社會、社交、教育、消費、交通、能源、金融、健康等多個領域的數據資源。

數據堂：專注於互聯網綜合數據交易，提供數據交易、處理和數據API服務，包含語音識別、醫療健康、交通地理、電子商務、社交網路、圖像識別等方面的數據。

四、網路指數
網路指數：指數查詢平台，可以根據指數的變化查看某個主題在各個時間段受關注的情況，進行趨勢分析、輿情預測有很好的指導作用。除了關注趨勢之外，還有需求分析、人群畫像等精準分析的工具，對於市場調研來說具有很好的參考意義。同樣的另外兩個搜索引擎搜狗、360也有類似的產品，都可以作為參考。

阿里指數：國內權威的商品交易分析工具，可以按地域、按行業查看商品搜索和交易數據，基於淘寶、天貓和1688平台的交易數據基本能夠看出國內商品交易的概況，對於趨勢分析、行業觀察意義不小。

友盟指數：友盟在移動互聯網應用數據統計和分析具有較為全面的統計和分析，對於研究移動端產品、做市場調研、用戶行為分析很有幫助。除了友盟指數，友盟的互聯網報告同樣是了解互聯網趨勢的優秀讀物。

五、網路採集器
網路採集器是通過軟體的形式實現簡單快捷地採集網路上分散的內容，具有很好的內容收集作用，而且不需要技術成本，被很多用戶作為初級的採集工具。

造數：新一代智能雲爬蟲。爬蟲工具中最快的，比其他同類產品快9倍。擁有千萬IP，可以輕松發起無數請求，數據保存在雲端，安全方便、簡單快捷。

火車採集器：一款專業的互聯網數據抓取、處理、分析，挖掘軟體，可以靈活迅速地抓取網頁上散亂分布的數據信息。

八爪魚：簡單實用的採集器，功能齊全，操作簡單，不用寫規則。特有的雲採集，關機也可以在雲伺服器上運行採集任務。

㈡大數據分析工具詳盡介紹&數據分析演算法

大數據分析工具詳盡介紹&數據分析演算法

1、 Hadoop

Hadoop 是一個能夠對大量數據進行分布式處理的軟體框架。但是 Hadoop 是以一種可靠、高效、可伸縮的方式進行處理的。Hadoop 是可靠的，因為它假設計算元素和存儲會失敗，因此它維護多個工作數據副本，確保能夠針對失敗的節點重新分布處理。Hadoop 是高效的，因為它以並行的方式工作，通過並行處理加快處理速度。Hadoop 還是可伸縮的，能夠處理 PB 級數據。此外，Hadoop 依賴於社區伺服器，因此它的成本比較低，任何人都可以使用。
Hadoop是一個能夠讓用戶輕松架構和使用的分布式計算平台。用戶可以輕松地在Hadoop上開發和運行處理海量數據的應用程序。它主要有以下幾個優點：
⒈高可靠性。Hadoop按位存儲和處理數據的能力值得人們信賴。
⒉高擴展性。Hadoop是在可用的計算機集簇間分配數據並完成計算任務的，這些集簇可以方便地擴展到數以千計的節點中。
⒊高效性。Hadoop能夠在節點之間動態地移動數據，並保證各個節點的動態平衡，因此處理速度非常快。
⒋高容錯性。Hadoop能夠自動保存數據的多個副本，並且能夠自動將失敗的任務重新分配。
Hadoop帶有用 Java 語言編寫的框架，因此運行在 Linux 生產平台上是非常理想的。Hadoop 上的應用程序也可以使用其他語言編寫，比如 C++。
2、 HPCC
HPCC，High Performance Computing and Communications（高性能計算與通信）的縮寫。1993年，由美國科學、工程、技術聯邦協調理事會向國會提交了「重大挑戰項目：高性能計算與通信」的報告，也就是被稱為HPCC計劃的報告，即美國總統科學戰略項目，其目的是通過加強研究與開發解決一批重要的科學與技術挑戰問題。HPCC是美國實施信息高速公路而上實施的計劃，該計劃的實施將耗資百億美元，其主要目標要達到：開發可擴展的計算系統及相關軟體，以支持太位級網路傳輸性能，開發千兆比特網路技術，擴展研究和教育機構及網路連接能力。
該項目主要由五部分組成：
1、高性能計算機系統（HPCS），內容包括今後幾代計算機系統的研究、系統設計工具、先進的典型系統及原有系統的評價等；
2、先進軟體技術與演算法（ASTA），內容有巨大挑戰問題的軟體支撐、新演算法設計、軟體分支與工具、計算計算及高性能計算研究中心等；
3、國家科研與教育網格（NREN），內容有中接站及10億位級傳輸的研究與開發；
4、基本研究與人類資源（BRHR），內容有基礎研究、培訓、教育及課程教材，被設計通過獎勵調查者-開始的，長期的調查在可升級的高性能計算中來增加創新意識流，通過提高教育和高性能的計算訓練和通信來加大熟練的和訓練有素的人員的聯營，和來提供必需的基礎架構來支持這些調查和研究活動；
5、信息基礎結構技術和應用（IITA ），目的在於保證美國在先進信息技術開發方面的領先地位。
3、 Storm
Storm是自由的開源軟體，一個分布式的、容錯的實時計算系統。Storm可以非常可靠的處理龐大的數據流，用於處理Hadoop的批量數據。Storm很簡單，支持許多種編程語言，使用起來非常有趣。Storm由Twitter開源而來，其它知名的應用企業包括Groupon、淘寶、支付寶、阿里巴巴、樂元素、Admaster等等。
Storm有許多應用領域：實時分析、在線機器學習、不停頓的計算、分布式RPC（遠過程調用協議，一種通過網路從遠程計算機程序上請求服務）、 ETL（Extraction-Transformation-Loading的縮寫，即數據抽取、轉換和載入）等等。Storm的處理速度驚人：經測試，每個節點每秒鍾可以處理100萬個數據元組。Storm是可擴展、容錯，很容易設置和操作。
4、 Apache Drill
為了幫助企業用戶尋找更為有效、加快Hadoop數據查詢的方法，Apache軟體基金會近日發起了一項名為「Drill」的開源項目。Apache Drill 實現了 Google』s Dremel.
據Hadoop廠商MapR Technologies公司產品經理Tomer Shiran介紹，「Drill」已經作為Apache孵化器項目來運作，將面向全球軟體工程師持續推廣。
該項目將會創建出開源版本的谷歌Dremel Hadoop工具（谷歌使用該工具來為Hadoop數據分析工具的互聯網應用提速）。而「Drill」將有助於Hadoop用戶實現更快查詢海量數據集的目的。
「Drill」項目其實也是從谷歌的Dremel項目中獲得靈感：該項目幫助谷歌實現海量數據集的分析處理，包括分析抓取Web文檔、跟蹤安裝在Android Market上的應用程序數據、分析垃圾郵件、分析谷歌分布式構建系統上的測試結果等等。
通過開發「Drill」Apache開源項目，組織機構將有望建立Drill所屬的API介面和靈活強大的體系架構，從而幫助支持廣泛的數據源、數據格式和查詢語言。
5、 RapidMiner
RapidMiner是世界領先的數據挖掘解決方案，在一個非常大的程度上有著先進技術。它數據挖掘任務涉及范圍廣泛，包括各種數據藝術，能簡化數據挖掘過程的設計和評價。
功能和特點
免費提供數據挖掘技術和庫
100%用Java代碼（可運行在操作系統）
數據挖掘過程簡單，強大和直觀
內部XML保證了標准化的格式來表示交換數據挖掘過程
可以用簡單腳本語言自動進行大規模進程
多層次的數據視圖，確保有效和透明的數據
圖形用戶界面的互動原型
命令行（批處理模式）自動大規模應用
Java API（應用編程介面）
簡單的插件和推廣機制
強大的可視化引擎，許多尖端的高維數據的可視化建模
400多個數據挖掘運營商支持
耶魯大學已成功地應用在許多不同的應用領域，包括文本挖掘，多媒體挖掘，功能設計，數據流挖掘，集成開發的方法和分布式數據挖掘。
6、 Pentaho BI
Pentaho BI 平台不同於傳統的BI 產品，它是一個以流程為中心的，面向解決方案（Solution）的框架。其目的在於將一系列企業級BI產品、開源軟體、API等等組件集成起來，方便商務智能應用的開發。它的出現，使得一系列的面向商務智能的獨立產品如Jfree、Quartz等等，能夠集成在一起，構成一項項復雜的、完整的商務智能解決方案。
Pentaho BI 平台，Pentaho Open BI 套件的核心架構和基礎，是以流程為中心的，因為其中樞控制器是一個工作流引擎。工作流引擎使用流程定義來定義在BI 平台上執行的商業智能流程。流程可以很容易的被定製，也可以添加新的流程。BI 平台包含組件和報表，用以分析這些流程的性能。目前，Pentaho的主要組成元素包括報表生成、分析、數據挖掘和工作流管理等等。這些組件通過 J2EE、WebService、SOAP、HTTP、Java、JavaScript、Portals等技術集成到Pentaho平台中來。 Pentaho的發行，主要以Pentaho SDK的形式進行。
Pentaho SDK共包含五個部分：Pentaho平台、Pentaho示例資料庫、可獨立運行的Pentaho平台、Pentaho解決方案示例和一個預先配製好的 Pentaho網路伺服器。其中Pentaho平台是Pentaho平台最主要的部分，囊括了Pentaho平台源代碼的主體；Pentaho資料庫為 Pentaho平台的正常運行提供的數據服務，包括配置信息、Solution相關的信息等等，對於Pentaho平台來說它不是必須的，通過配置是可以用其它資料庫服務取代的；可獨立運行的Pentaho平台是Pentaho平台的獨立運行模式的示例，它演示了如何使Pentaho平台在沒有應用伺服器支持的情況下獨立運行；
Pentaho解決方案示例是一個Eclipse工程，用來演示如何為Pentaho平台開發相關的商業智能解決方案。
Pentaho BI 平台構建於伺服器，引擎和組件的基礎之上。這些提供了系統的J2EE 伺服器，安全，portal，工作流，規則引擎，圖表，協作，內容管理，數據集成，分析和建模功能。這些組件的大部分是基於標準的，可使用其他產品替換之。
7、 SAS Enterprise Miner
§ 支持整個數據挖掘過程的完備工具集
§ 易用的圖形界面,適合不同類型的用戶快速建模
§ 強大的模型管理和評估功能
§ 快速便捷的模型發布機制, 促進業務閉環形成
數據分析演算法
大數據分析主要依靠機器學習和大規模計算。機器學習包括監督學習、非監督學習、強化學習等，而監督學習又包括分類學習、回歸學習、排序學習、匹配學習等（見圖1）。分類是最常見的機器學習應用問題，比如垃圾郵件過濾、人臉檢測、用戶畫像、文本情感分析、網頁歸類等，本質上都是分類問題。分類學習也是機器學習領域，研究最徹底、使用最廣泛的一個分支。
最近、Fernández-Delgado等人在JMLR（Journal of Machine Learning Research，機器學習頂級期刊）雜志發表了一篇有趣的論文。他們讓179種不同的分類學習方法（分類學習演算法）在UCI 121個數據集上進行了「大比武」（UCI是機器學習公用數據集，每個數據集的規模都不大）。結果發現Random Forest（隨機森林）和SVM（支持向量機）名列第一、第二名，但兩者差異不大。在84.3%的數據上、Random Forest壓倒了其它90%的方法。也就是說，在大多數情況下，只用Random Forest 或 SVM事情就搞定了。
KNN
K最近鄰演算法。給定一些已經訓練好的數據，輸入一個新的測試數據點，計算包含於此測試數據點的最近的點的分類情況，哪個分類的類型佔多數，則此測試點的分類與此相同，所以在這里,有的時候可以復制不同的分類點不同的權重。近的點的權重大點，遠的點自然就小點。詳細介紹鏈接
Naive Bayes
樸素貝葉斯演算法。樸素貝葉斯演算法是貝葉斯演算法裡面一種比較簡單的分類演算法，用到了一個比較重要的貝葉斯定理，用一句簡單的話概括就是條件概率的相互轉換推導。詳細介紹鏈接
樸素貝葉斯分類是一種十分簡單的分類演算法，叫它樸素貝葉斯分類是因為這種方法的思想真的很樸素，樸素貝葉斯的思想基礎是這樣的：對於給出的待分類項，求解在此項出現的條件下各個類別出現的概率，哪個最大，就認為此待分類項屬於哪個類別。通俗來說，就好比這么個道理，你在街上看到一個黑人，我問你你猜這哥們哪裡來的，你十有八九猜非洲。為什麼呢？因為黑人中非洲人的比率最高，當然人家也可能是美洲人或亞洲人，但在沒有其它可用信息下，我們會選擇條件概率最大的類別，這就是樸素貝葉斯的思想基礎。
SVM
支持向量機演算法。支持向量機演算法是一種對線性和非線性數據進行分類的方法，非線性數據進行分類的時候可以通過核函數轉為線性的情況再處理。其中的一個關鍵的步驟是搜索最大邊緣超平面。詳細介紹鏈接
Apriori
Apriori演算法是關聯規則挖掘演算法，通過連接和剪枝運算挖掘出頻繁項集，然後根據頻繁項集得到關聯規則，關聯規則的導出需要滿足最小置信度的要求。詳細介紹鏈接
PageRank
網頁重要性/排名演算法。PageRank演算法最早產生於Google,核心思想是通過網頁的入鏈數作為一個網頁好快的判定標准，如果1個網頁內部包含了多個指向外部的鏈接，則PR值將會被均分，PageRank演算法也會遭到LinkSpan攻擊。詳細介紹鏈接
RandomForest
隨機森林演算法。演算法思想是決策樹+boosting.決策樹採用的是CART分類回歸數,通過組合各個決策樹的弱分類器,構成一個最終的強分類器,在構造決策樹的時候採取隨機數量的樣本數和隨機的部分屬性進行子決策樹的構建,避免了過分擬合的現象發生。詳細介紹鏈接
Artificial Neural Network
「神經網路」這個詞實際是來自於生物學，而我們所指的神經網路正確的名稱應該是「人工神經網路（ANNs）」。
人工神經網路也具有初步的自適應與自組織能力。在學習或訓練過程中改變突觸權重值，以適應周圍環境的要求。同一網路因學習方式及內容不同可具有不同的功能。人工神經網路是一個具有學習能力的系統，可以發展知識，以致超過設計者原有的知識水平。通常，它的學習訓練方式可分為兩種，一種是有監督或稱有導師的學習，這時利用給定的樣本標准進行分類或模仿；另一種是無監督學習或稱無為導師學習，這時，只規定學習方式或某些規則，則具體的學習內容隨系統所處環境（即輸入信號情況）而異，系統可以自動發現環境特徵和規律性，具有更近似人腦的功能。

㈢這個UCI資料庫（http://archive.ics.uci.e/ml/ ）怎麼使用，可以詳細點呼，不甚感激

貌似是數據源，matlab模擬實驗時可以從這里下載輸入數據

導航:首頁 > 編程大全 > uci機器學習資料庫

uci機器學習資料庫

與uci機器學習資料庫相關的資料

友情鏈接