【資料分析】資料分析與機器學習流程(Data Analysis Process & Machine Learning Process)

在進行資料分析之前,最重要的就是釐清自己的研究流程,簡單的介紹資料分析與機器學習會使用到的研究流程,讓大家可以清楚知道自己的分析步驟,並說明兩種研究上的相同與相異處,在完成了第一次的流程之後,也能視自己的需求在不同的環節進行優化唷!

資料分析流程(Data Analysis Process):

這裡的資料分析指的是想要分析某個商業上的問題,透過資料和統計方法來評估和解釋數據資料,在其中找到有效的方法來解決商業上的難題,而在商業分析上的流程為:

  1. 定義商業目標明確的定義想解決的商業問題。
  2. 蒐集資料: 收集與問題相關所需要的資料,資料的來源可能會是公司內部(例如財務報表)或是外部資料(例如市場調查、競爭分析等)。
  3. 數據清理和預處理: 處理缺失值等不完整資料,後續進行資料轉換或縮放等格式轉換。
  4. 探索性資料分析(EDA): 通過統計圖表和視覺化工具進行資料的探索性分析,用來理解資料原始的分佈、相關性或趨勢。
  5. 建立模型與評估模型選擇適當的統計模型或機器學習方法,最終評估模型的性能。
  6. 模型解釋和優化: 分析模型的結果,進行模型的解釋和持續優化。
  7. 制定模型建議與策略: 基於分析的結果,制定具體的建議和策略,以實現業務目標。
  8. 持續監控和評估: 實施模型的實施計劃後,定期監控結果,進行評估和調整。

機器學習流程(Machine Learning Process):

  1. 定義問題類型: 定義問題屬於監督式學習、非監督式學習還是強化學習等等問題的種類。
  2. 資料準備: 將資料進行預處理,包含缺失資料處理等等,進行資料轉換或縮放格式轉換。
  3. 選擇模型: 選擇合適的機器學習模型,例如決策樹、支持向量機、神經網絡等。
  4. 訓練與驗證模型: 使用訓練資料擬合模型,調整模型的權重和參數,並驗證模型的性能。
  5. 測試模型: 使用測試資料來評估模型的泛化能力,確保模型的預測仍有相當的能力。
  6. 模型解釋和優化: 解釋模型的預測結果與表現,持續進行模型的優化,提高預測準確性。
  7. 部署模型: 把模型應用於實際環境中,以解決現實世界的問題。

比較兩種分析流程的共通之處

看完了資料分析流程與機器學習流程的架構後,可以發現兩著之間的相同處有:

  • 定義問題
  • 蒐集和準備資料
  • 建立模型、驗證模型
  • 模型解釋和優化

所以可以發現,所有的分析在最一開始最重要的事情一定就是定義問題,明確定義出問題後,就可以開始蒐集資料,資料蒐集完成後,將蒐集的資料進行預處理和格式的轉換,最後選擇適合的模型來進行建模,並針對建立模型後的結果進行解釋和持續性的優化,也就是身為資料分析工作者每天會面對到的挑戰。

其實機器學習只是在資料分析當中的其中一種分析方法,另外還有其他像是統計、金融、數學等等的模型,在這因為麥特是使用機器學習進行研究的,所以會針對機器學習的研究流程來跟大家說明。

在上述有提到的幾個步驟,後續麥特會在別篇文章當中進一步的示範給大家看,我是如何進行每一個環節的任務,其中有以下幾點:

  • 數據清理和預處理
  • 探索性資料分析
  • 特徵工程
  • 建立模型
  • 評估模型
  • 模型解釋和優化

希望本篇的內容可以幫助到第一次認識資料分析流程的讀者,來了解基本的資料分析&機器學習流程,希望可以將自身在機器學習領域的知識分享給大家,一起在有趣的資料當中探險吧 !

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *