顯示具有 技術-BigData-Book 標籤的文章。 顯示所有文章
顯示具有 技術-BigData-Book 標籤的文章。 顯示所有文章

2013年6月22日 星期六

[書摘] 大數據 - 第三章- 雜亂


圖片來源:博客來


知名物理學家課耳文勛爵(Lord Kelvin)主張測量就是瞭解,這也變成科學的依據:要能夠量化,記錄,還得呈現出可重複的驗證。不過到了1920年量子力學 - 測不準原理的出現推翻了全面完整測量事物的夢想,

所以面對資料我們要改變的第二種心態就是 - 開始容忍種種不精確

很多時候"越多",會比"品質越好"更重要 ,由於我們收集技術精確性會受到物理性質限制,與技術限制,所以我們必須改以透過增加取樣頻率,增加收集資料量來克服這些問題。

也就是說,巨量資料的概念,就讓數據的重點從精確走向可能性。 (阿~又是機率和統計~)

案例連結:

1. 自然語言處理 - 在這個領域已經證明資料的量比品質還重要

對於所有的Machine Learning 的研究來說,都會遇到一個問題,是要把資源投給改善更好的演算法,還是要收集更多的資料?這結果也由Googel 證實,Google 人工智慧專家諾威格等人,在一篇名為"資料的非理性效果"文中提到:簡單的模型,加上大量的資料,就會打敗很複雜,但是資料較少的模型。


2. 拋棄昂貴費時的精確資料收集方式 - PriceStats  

MIT教授創業的公司,透過網路抓取全美超過50項產品價格,現在更是蒐集超過70個國家,數百名零售商銷售的產品價格,來分析消費者物價指數(CPI),雖然充滿了混亂和不乾淨的資料,但是即時性與準確度已經超越官方公布的數據。


圖片來源:PriceStats 





3. 資料庫設計的改變 - NoSQL崛起

在這個章節罩慣例有提到 Hadoop 的技術(但是描述怪怪的 --> 與過去的關聯式資料庫相比,Hadoop輸出的結果比較不準確....=_=?)


應用案例 - ZestFinance

這間由前Google 資訊長所成立的公司,透過許多過去信用評分公司認為相對不重要的指標來判斷是否要提供小額短期貸款。

圖片來源:ZestFinance



心得:

心態與觀念改變的確很重要,但是前提是要有相對應的技術能量(數學與分析能力)去處理,否則縱使擁有越多的資料,還是無法挖掘出有價值的東西...



2013年6月16日 星期日

[書摘] 大數據 - 第二章- 更多的資料

圖片來源:博客來

前一陣子寫了一篇關於BigData的基本問題 - 到底要多大?要多快? 原本嘗試著要用物理性質的角度來思考到底多大才算是大數據,何時才需要使用不同於傳統的技術?

但是看了這本書才看了第二章馬上就給我不同的思考角度,首先他先說明巨量資料是關於三種思維的改變:
  1. 是要針對特定主題分析龐大資歷料整理的能力,而不是退而求其次分析較小的資料集
  2. 願意接受真實資料會雜亂不清的事實,而不是一味追求精確
  3. 要更看重相關性,而不是追求難以捉摸的因果關係

針對第一點, 他不是用一般傳統的4V去解釋Big Data,他是用如何處理資料的角度來解釋何謂Big Data。

在這章節給Big Data (巨量資料) 下了一個定義:
巨量資料的"巨量"不是絕對、而是相對的概念,指的是要有完整的資料集。 

在過去因為受到收集與計算技術的限制,難以全面性的收集資料,所以統計學才因此誕生,而其中最核心的方法就是在抽樣,不過統計學家也證實要提高抽樣的準確度,最好的方式並非增加樣本術,而是要做到隨機抽樣 (不過要如何設計一個好的隨機抽樣永遠都是一個難題,而且會有局限性)

因此真正得巨量資料判斷標準,在於是否使用隨機抽樣*, 也就是說就算全部的資料(樣本=母體)資料量不一定很龐大,但是不再使用抽樣的方法去操作資料就是所謂的巨量資料。


不過第三點就很值得玩味,作者舉了Google 流感,與Jobs DNA定序的例子,指出很多時候我們只要能透過全面資料運算,看到有這樣的模式/現象,其實就足夠了,不一定要去追求為什麼會有這樣的現象/模式或是嘗試去了解它們交互關係原理是什麼。

(謎之音:找到能賺錢的價值就夠了,至於原因上帝知道就夠了~)

圖片來源:Only God knows

(謎之音:看樣子這大數據這本書比雲端時代的殺手級應用:Big Data海量資料分析 有內容多了,也多了一份哲理在~:P  就讓我們繼續看下去....)

延伸閱讀:
[1] 抽樣方法
[2] 抽樣與代表性 (Sampling and representativeness)