2015年10月21日 星期三
Tableau Public 初體驗
之前在趨勢做Data Market Platform 的時候就聽過Tableau,但是都沒有實際體驗過,只知道是一套強大但是不便宜的Big Data Visualization Tools,直到最近公司內的技術分享後,才真的花時間去玩他,發先真的做的很不錯!
Tableau public (free SaaS)版本 的概念就跟之前在趨勢作Data market Place 的概念類似(但是UI 強太多了...Orz..)
Free 版的tableau 可以允許你匯入excel , text file 和 ODate (Azure Market place 販賣的資料),然後你可以在你的Desktop app 上分析資料畫圖,如果你要存檔就只能儲存到他提供給你的cloud 空間share 給別人。
2014年5月1日 星期四
Social Media Monitoring and Analytic - 輿情監控分析系統
以商業價值來說,這些工具可以幫助企業(or 政府)收集網路上顧客/民眾所談論的內容(輿情),進而達到:
- 找出流行趨勢脈動與可以炒作的議題
- 了解客戶對於企業/品牌 的意見,做出改善
- 面對危機(抹黑,負評)如何迅速的做出反應(滅火)
既然有商機當然就會有很多創業家投入研發相關的產品,國外還每年都會有相關的文章整理出實用的工具與比較如:
- Top 10 social media analytics tools: The VentureBeat index
- 2014 Best Social Media Monitoring Review REVIEWS AND COMPARISONS
2014年4月9日 星期三
What is Similarity Digests?
這麼硬的題目,當然要來點有趣的圖片,
前幾天收到教育訓練的通知信,題目是 Similarity Digests: Hashes for data mining and big data,一看到是跟Data mining 和Big data 有關就立馬報名了(自動乎看不懂意思的Similarity Digests)......沒想到這才是痛苦的開始,因為內容跟Big Data ...至少跟我想像的不太一樣。
傳統的檔案比較通常使用MD5,SHA1..等,但是這是用來比較兩個檔案是否一樣,所以只要有改一點點東西,這兩個檔案的Hash值就會完全不一樣,但是如果我們想要了解這兩個檔案的相似程度呢?這時候就要使用 Similarity Digests,它主要的用途用來比較兩份個檔案的相似程度,包含執行檔,圖檔(非壓縮格式),文字檔...等,不過當然還是有其限制和適用範圍。
2013年12月22日 星期日
[書摘] 精準預測 - (1)
如果要了解這個作者,建議可以先看作者在TED也有演講:納特希爾弗:種族背景會影響選票嗎? ,可以對這位作者有個初步了解。
話說討論Big Data 通常會以 4V (Volume、Velocity、Variety、Veracity) 的面象來檢視,而精準預測這本書我覺得應該屬於在討論Veracity(真實性)的範疇,正如書名的副標題,如何從巨量的雜訊中看出重要的訊號。我們如何才能把我們的判斷運用到資料上,又不致於屈服於自己的偏見?整本書的核心問題就是 - 預測,如何做出更好的預測?
這不是一本在對於Big Data 歌功頌德 - Big Data 怎麼改變世界,怎麼幫你賺大錢的書,這是一本科普的書,是本告訴我們在大學時期所學的機率 、統計..等學科到底是怎麼用在真實的世界做預測。
圖片來源:In Data We Trust
如同In Data We Trust 這篇文章裡說的,利用Data 在做任何預測前,都應該先問幾個問題:
- What is (are) your hypothesis(es)?
- What are your biases?
- What is the sample size?
- What is the data source?
- How good are your customer measures?
第一章 - 慘烈的預測失誤
以2008年金融海嘯房事泡沫為例,解釋無視錯誤的假設,使用錯誤的方法,如何造成慘烈的預測失誤。
未知而不自知 (unknow unknow)的危險,也就是那些我們根本察覺不到的風險。而比這更大的威脅,可能只有哪種我們以為自己可以控制,卻控制不了的風險。在後者的狀況中,我們不只愚弄自己,我們錯誤的信心更可能會膨脹,以評等機構而言,錯誤的信心更感染了整個金融體系。 [可能出錯的是和不可能出錯的事,兩者之間最主要的差別在於,不可能出錯的事一旦出錯,結果常常讓人搞不清楚狀況,無法修補] - p41
第二章 - 你比電視名嘴還聰明嘛?
跟股票預測一樣,所謂的政治預測名嘴,其實跟猴子設飛鏢的結果是差不多,但是這代表真的不能預測嘛?作者在這個章節舉出兩種分析預測家的人格:
- 刺蝟 [獵人] - 相信偉大的想法Big Idea,相信可以用一個類似物理定義的自然法則預測分析所有事
- 狐狸 [採集者] - 相信許多小想法,對問題會用各式各樣的手段來處理,他們比較能包容細微差別,不確定性,複雜的局面和異議。
而節目比較愛的名嘴幾乎都是刺蝟,而真正能預測準確的卻往往是狐狸,那什麼是狐狸的思考原則?
- 用機率思考(不管是政治還是其他領域都是機率,沒有絕對數字只有可能範圍)
- 今天的預測就是你餘生的第一個預測 (事實改變的時候,就該改變想法)
- 尋求共識 (刺蝟都愛說出大膽出戶意料的預測,其實根據證據顯示:集團預測比單獨預測準確 - 檢視多元觀點)
第三章 - 我在乎的只有輸贏
本章節算是"魔球"這本書發表之後的後續Update,老實說我不太看棒球,也不太了解,但是至少看過魔球的電影,於是在腦袋終究留下刻板印象,這是球探與統計專家的戰爭,可能越來越多老球探工作不保,但真的是這樣嘛?
其實魔球出版後的十年,從2004年紅襪隊在相隔86年之後贏得第一次世界大賽冠軍,就是同時注重統計與球探的融合方式。
此外這個章節也解答了我一個問題,為什麼棒球比較容易透過統計機率預測:
棒球提供的資料集也許是全世界最豐富的:過去一百四十年來在大聯盟球場上發生的事差不多全部都有人見則而精準的記錄下來,每年在大聯盟還有數百位球員在打球。同時,雖然棒球是團隊運動,但是棒球又是用非常有條理的方式進行:投手輪值投球,打者案打擊續輪流,他們要位自己大部分的統計數字負責。比較少會牽涉到複雜性與非線性的問題,要理出因果關係比較容易。
不過因為不愛看棒球,所以看到這張真的沒啥fu~:P
第四章 - 多年來你一直告訴我們雨是綠的
這章節在講氣象預測,首先先引用拉普拉斯假設(Laplace's Demon):
我們可以將宇宙現在的狀況,是為過去的果與未來的因。有智慧的人在某個時間會知道所有推動自然的力量,還有構成自然所有物體的位置,如果人的智慧大到足以將所有這些資料拿來分析,那麼就能把宇宙最大的星體和最小的原子所有的運動包含在一條單一的公式裡,對這樣有智慧的人來說,沒有什麼是無法確定的,而未來就如同過去,在他眼前一如現在。而如同量子物理學家所證實,人類試辦不到的,我想也唯有神才辦的到~:p 不過氣象卻是在分子發生的Level 不是在原子(量子物理層次),所以稍稍的修改拉普拉斯假設的話是可以達到的,這也就是現在氣象預測嘗試在做的事。
氣象分析就把從真實世界觀測到的數據(除了三為空間+ 時間),以矩陣的方式來加以運算,而電腦隨著摩爾定律也越來越快,為什麼預測氣象仍然這麼難呢?因為混沌理論:
- 系統是動態的 - 這表示系統某個時間點的行為表現會影響其未來的行為表現
- 系統是非線性的 - 這表示他們遵守的事等比級數的關係,不是等差的關係。
這也解釋了我們對於天氣預報的疑問:如果氣象預報員說明天降雨機率40%,解釋這句話的方式之一就是在他的各次模擬中,有40%出現風雨,而其他60%(用的是稍稍不同的初始參數)則沒有。
此外預報員另一個武器就是視覺化的圖表+ 經驗,可以彌補電腦的不足或過於保守的預測,就算隨著電腦越來越進步,這些預報員的經驗可以讓降雨量預測改善25%,溫度預測10%。
有趣的是氣象是科學預測成功的故事,而且還是比較例外的例子,不是常態....囧rz..
這本書真的又厚又硬...:P
To be continued....
2013年3月21日 星期四
關於Data analystis 線上課程
圖片來源:pcconlinecourses
在這個年代,只有想不想學或是有沒有時間學,而沒有學不學的到這件事了...Orz..
(其實還是有學不會的可能~XD) 有興趣的可以參考看看
Standford University - Machine Learning
https://www.coursera.org/course/ml
Toronto University - Neural Networks for Machine Learning
https://www.coursera.org/course/neuralnets
Washington University - Machine Learning
https://www.coursera.org/course/machlearning
Washington University - Introduction to Data Science
https://www.coursera.org/course/datasci
Johns Hopkins University - Data Analysis
https://www.coursera.org/course/dataanalysis
Johns Hopkins University - Computing for Data Analysis (by R)
https://www.coursera.org/course/compdata
Statistics
https://www.udacity.com/course/st095
Online Education in Analytics, Data Mining and Data Science
http://www.kdnuggets.com/education/online.html
2012年9月30日 星期日
[筆記] 從推薦系統到Apache Mahout
Source: apache-mahout
最近閒暇之餘在研究一個題目 - 推薦系統,怎麼會想要研究這個題目呢?因為鳥先生最近熱血於規劃他的美食推薦系統(不過那又是另一個故事了),而我們的分工方式就是他負責前端,我負責後端,結果這個恐怖的推薦系統似乎就落到我頭上!? 推薦系統.....一點概念也沒有,於是乎上網搜尋了相關資訊,看到了這篇"How to build a recommender system presentation" 。看完了整個發毛,遙想當年統計學低空掠過,畢業後就還給老師了,上了研究所去旁聽machine learning,也因為統計學早就還給老師了所以整個鴨聽雷...囧rz...
直到今天看到了一個影片,就突然喚醒了我的記憶 (隨著年紀增長記憶力越來越低落...)
(老外真的都很會做一些淺顯易懂的影片~:P)
Mahout ! 就是那道光,於是我又想起了今年Java Two 王建興大師演講的題目似乎就是在介紹利用Mahout實作的推薦系統[1] (原諒我到處趕場,就是沒聽到這場),然後才發現一系列他寫的關於推薦系統的文章[2][3][4],其中這一段真是打動我的心啊
當站在Mahout的肩膀來開發推薦系統時,你會發現,過去我們在開發推薦系統或機器學習的應用中,最耗費時間的環節之一,也就是開發這些演算法甚至是打 造應用程式框架,突然間都消除了。而且,更重要的是,和你一起競爭的開發者或團隊,也都站在和你一樣的立足點上一起出發,因為大家都可以憑藉著 Mahout的力量,立即得到這一切,開發應用程式的關鍵和瓶頸似乎轉移了。
不過這是大師的觀點,對於我們這種Machine Learning 小白,看完文章後只有劉姥姥進大觀園的感覺,除了驚嘆Mahout 的強大外,更暗自覺得不妙(要新學的東西也太多了吧....囧),因為Mahout被建造的目的主要是提供Machine Learning 所需要的各種演算法引擎(推薦只是Machine Learning 的子集),所以除了推薦系統外(Mahout中專指協同過濾式的推薦),更提供分類演算法、群集演算法、模式探勘(Pattern Mining)、降維(Dimension Reduction),以及向量相似度(Vector Similarity)....等[5]各種演算法引擎。所以說這就好像進到了蝙蝠俠的武器庫裡,擁有各式各樣殺傷力強大的武器,但在使用前還是得先去了解每個武器的特性,適合使用的場合,不然只會浪費了這麼好的武器,甚至還會被後座力傷到。
所以在使用前似乎應該先服用coursera 的線上課程,有個基礎的了解?
- Machine Learning - Standford
- Web Intelligence and Big Data - Indian Institute of Technology Delhi
除了了解原理外,所以接下來該怎麼玩?
1. 利用Mahout 單機板模是學習使用這些工具與API
2. 架設單機版 Hadoop 嘗試讓 Mahout 的程式能在上面跑
3. 如果要進入Production ,我想最方便的方法就是讓程式跑在 AWS Elastic MapReduc 上
很好...看樣子有得忙了...
延伸閱讀:
IBM - Mahout 介紹
Reference:
[1] 沙中撈金術﹣談開放原始碼的推薦系統
[2] 適合現實應用的混合推薦系統
[3] 以人數與內容特徵建立推薦系統
[4] 憑藉推薦系統來活化長尾的部分
[5] 大象背上的男人:Mahout
訂閱:
文章
(
Atom
)






