2016年9月23日 星期五

第一步:決定計畫的方向

開始一邊工作一邊上課後時間安排緊湊了許多,人生中也遇到些大事,不過我還是希望能至少紀錄些研讀資料科學遇到的問題與心得。


設定計畫的架構
在業界,商場,工場或其他職場,一份報告的嚴謹度可以比學術等級更高或更低。(廢話)比方說,石墨烯的製成,在業界需要足以成為製品的產量跟品質,在學界重視的則可依研究目標而定。業界對於分析的結果檢視有時則可能不如學界謹慎,雖然這並不是好事,但確實可以大幅提升對於市場的反應速度。但是兩者都遵照一定的步驟來確保結果是可信,可以衡量的,以避免資源的浪費。同理,自己的計畫也應該有一個好的研究架構,去構築自己的產品,檢視其表現與價值。至於在那之上是否有商業價值我要看目標如何設定。

設定目標-闡述方法及衡量標準-研究並取得資料-(處理資料-衡量成果)-討論與改進。

其中括弧的部分也許需要重複多次...一個要點是在每個步驟是否有明確地闡述目標,討論可行的執行方式,並提出選擇現行做法的理由。步驟結束後往往可以藉由檢視最初的敘述來確認是否有正確執行並達到目標。沒有達到目標也不需要刪掉報告重來,試誤也可以成為一個經驗。

接下來每個步驟都可以遇到許多問題,我選擇做的計畫目的除了做出成品外也冀望能做為自己得到不同經驗的契機:除了分析美國高等教育機構的花費與表現,我也同時在思考kaggle上TalkingData的競賽,現在公司可能使用得到的履歷閱讀機器人雖然因爲隱私性問題可能無法成行,所以我正在構思一個打桌遊的AI。當我看到許多人使用deep learning與神經網絡在判讀圖像時,我詢問Udacity論壇關於自己的畢業報告題目是否過淺,論壇導師也告訴我:不一定非要本世紀最具突破性的想法才可以。話雖如此,我還是有思考嘗試做一個圖像辨識AI並使用RasberryPi的攝影機去做一個辨識我自己臉孔的機器人。

作為一個半路出家,對於工具掌握還不深不淺的人,我認為設定一個自己覺得追得到但是還摸不到的目標是維持動力的一個方式。對於這門技藝逐漸掌握的時候,同樣的計畫架構可以通用到更寬廣的架構吧。


2016年5月24日 星期二

Data Science的用途與方向

Data Science現下最受矚目的應用莫過於Machine Learning,而AlphaGo前一陣子的比賽更是這門學科一個極佳的宣傳。雖然術業有專攻,但至少在machine learning的應用上大多不是單一學門的成就,不少研究都是由特化過的專門知識經過跨領域合作不斷重複補足修正才達到了如今的成過。唸過人類的學習理論後再來看機械學習,有些可以沿用的概念也有些容易被混淆的部分,下面就以我自己學習心理學時留下的基礎來描述機械學習的方向。

人類學習的重點是在資訊的存取,現在機械學習的應用則著重在客觀資料的決策行為上。機械在資訊儲存,提取,以及處理的機能上已經超過人類的能力了,而機械學習則是利用其性能:運算出基於客觀資料下做出的理性判斷,分析海量資料中可能存在的關聯因素,找出最佳化行動的模式。下面我試著舉三個例子做參考。

假設我們要找出創業成功的方程式,在設定好成功的定義後(比方說損益比)可以藉由既存資料找出關鍵的因素,而當一間新創公司的資料進來後,我們可以把相關參數丟進訓練好的電腦中,讓它計算出這間公司是否會符合我們成功的定義。

或是當手中有一大堆資料,可以透過一些運算找出具有關鍵性卻被忽略的部分。這個過程或許會需要更多專業知識來輔佐,並需要足夠的簡報技巧以創造出市場價值。我現在可以想到的是如The Big Short(大賣空)裡預測到次級房貸將崩盤並乘勢製造出新商品一般。(所以也是有可能遇到資料作假或是暗地操盤導致成果不如預期)

最貼近一般生活的莫過於我們用google map設定目的地時,它會依照現在路況及各路段時速計算出最快路線供駕駛參考。

機械學習大約分成 supervised learning, unsupervised learning, reinforced learning三種,上面我試著各舉了一個例子,爾後再詳述各學習方式的細節。

所以人腦應該會有更多時間和資源來做更高階的策略規劃...吧


2016年5月13日 星期五

契機

我從小算是一個懶惰的孩子,而一個月前在有力的心靈支持下決定開始自學Data Science了。只帶著一些粗淺的認識就打算把人生一部分投下去的原因是不想讓自己停留在固定的領域裡。 這邊主要想留下一個沒基礎的人慢慢累積經驗的紀錄,以便將來自我審視或有幸做為他人借鏡。

Data Science是一門跨領域學科,跟我大學主修的心理學一樣是與許多業界有所重疊的知識/技術。然而Data Science在2016年的現在可說是股價高漲,除了許多人掛在嘴上的Big Data,心理學界曾經帶領過的AI發展,在人類圍棋棋士與人工智能對戰敗北的里程碑下又多了幾分令人目眩的吸引力。

以我現有的基礎知識來解釋,Data Science是藉由處理與分析資料來理解甚至建構模型以預測事件的技術,老實說也存在有一段時日了。然而在資訊量爆漲的情況下,人們發現在那一山蒐集來的資訊裡可能藏了價值連城的寶物或藏寶圖,於是有人開始重視如何挖掘,整理,組合成我們需要的成品,更甚者,讓大量的資料告訴我們想也沒想過的關聯性。

統計數學能力,coding能力,專業知識大概是走這行必須注意的幾個方向。而我,則是樣樣皆鬆...