Duke AI PM 學習筆記 (四):從決策樹到 Transformer,拆解演算法地圖與訓練機制
Originally published on Medium
Photo by Steve A Johnson on Unsplash
📚Coursera: https://www.coursera.org/specializations/ai-product-management-duke
這份筆記整理結合了我的個人筆記與課程教材中的核心概念,期望能有效幫助大家更有系統化地掌握機器學習模型的內部運作、訓練機制與深度學習架構的要點:
一、 演算法工具箱:從線性模型到決策樹
根據任務目標與數據特性的不同,主要分為以下兩大類工具:
1. 線性模型 (Linear Models):
- 二元分類:利用 Sigmoid 函數將輸出轉換為 0 到 1 之間的機率值,用以判斷屬於特定類別的可能性。
- 多元分類:利用 Softmax 函數處理多個類別的預測(例如:判斷影像中是貓、狗還是熊),並確保所有類別的預測機率總和為 1。
2. 樹狀模型 (Tree Models):
- 決策樹 (Decision Trees):透過一系列「是/否」的問句邏輯來縮小標籤範圍(例如:是否有角、顏色區分等)。
- 優勢:具備極佳的可解釋性(Explainability),便於向利害關係人解釋模型做出決策的依據。
二、 模型是如何「學習」的?核心訓練機制
理解訓練過程的三個關鍵步驟,有助於評估模型無法收斂的技術瓶頸:
1. 前向傳播 (Forward Propagation):
- 機制:將數據輸入模型,由左至右(從輸入層經過隱藏層,最後到達輸出層),經由各層加權(輸入數據 $X$ 與權重 $W$ 相乘加總)並透過激活函數(Activation Function)處理,產生初步預測值 $\hat{y}$。
- 目的:作為訓練的第一步(Step 1),根據目前的權重計算出一個預測結果,以得知當前模型的表現。
2. 損失函數與梯度計算 (Cost Function & Gradient):
- 機制:透過損失函數衡量預測值與真實值(Target)之間的差距(即誤差),並計算出減少該誤差的梯度方向。
3. 梯度下降與反向傳播 (Gradient Descent & Backpropagation):
- 反向傳播:訓練後期的關鍵步驟(Step 3)。將總誤差由右往左(從輸出層往回推向輸入層)分配給網路中每一層的神經元權重,計算出損失函數對每個權重的梯度。
- 權重更新:利用學習率(Learning rate)配合梯度下降調整權重大小。若學習率過小會導致收斂速度極慢;過大可能導致梯度震盪而無法收斂
補充:在神經網路的訓練過程中,前向傳播(Forward Propagation)與 反向傳播(Backpropagation)是兩個方向相反且目的不同的核心步驟。
📊 前向傳播 vs 反向傳播 核心功能比較表:
| 面向 | 前向傳播 (Forward) | 反向傳播 (Backpropagation) |
|---|---|---|
| 流程方向 | 輸入資料 → 隱藏層 → 輸出結果 | 從輸出誤差反推 → 隱藏層 → 輸入層 |
| 核心任務 | 根據當前權重計算預測結果 | 根據誤差計算各權重的影響程度(梯度) |
| 關鍵技術 | 矩陣運算、激活函數(ReLU, Sigmoid 等) | 鏈式法則(Chain Rule)、梯度下降 |
| 輸出內容 | 預測值 ( \hat{y} ) | 每個權重的更新方向與幅度 |
| 對產品的意義 | 提供模型推論能力(Inference) | 提升模型準確度(Training / Optimization) |
| 直覺理解 | 模型「做決策」的過程 | 模型「檢討並修正錯誤」的過程 |
總結:前向傳播決定了模型「現在想什麼」; 反向傳播則是告訴模型「剛剛錯在哪裡」,並透過梯度下降來修正權重,讓下一次的前向傳播能更準確。
三、 深度學習架構:影像與文字的處理利器
針對非結構化數據,神經網路(Neural Networks)為目前的技術主流:
1. 卷積神經網路 (CNN) — — 影像處理:
- 機制:利用滑動過濾器 (Sliding Filter) 在圖像上捕捉局部特徵模式。
- 特徵學習:在訓練過程中,過濾器會自動學習如何識別從低階(如邊緣、形狀)到高階(如具體物體)的特徵。
2. 自然語言處理 (NLP) — — 文字處理:
- 詞嵌入 (Word Embeddings):將單字轉換為數值向量,用以捕捉單字間的語義關係(例如:學習「study」與「learn」在空間上的接近程度)。
- Transformer (Attention 機制):目前的領先架構,透過「注意力機制」衡量序列中不同詞彙之間的關聯強度,廣泛應用於翻譯與文本生成任務。
四、 效率策略:遷移學習 (Transfer Learning)
對於數據量有限、計算資源受限的專案,應考慮導入遷移學習策略:
- 核心概念:利用已經在大規模通用數據集(如包含 1400 萬張圖片的 ImageNet)上訓練完成的模型作為基底。
- 應用方式:保留預訓練模型捕捉通用特徵的能力,僅針對特定任務的小數據集進行微調(Fine-tuning)。
- 商業價值:大幅降低模型訓練成本,減少數據蒐集需求,並縮短產品上線時間(Time-to-Market)。
💡結語:從「黑盒」走向「透明」
了解演算法的選擇與底層訓練機制,能幫助 PM 在產品設計初期預判技術難度與數據需求。深度學習雖具備極致性能,但普遍可解釋性較低;PM 在決定技術路徑與選型時,必須在「模型性能」與「決策透明度」之間做出明智的權衡。
希望這篇筆記能幫助你更理解 AI 模型的訓練。
如果你也對 Machine Learning、GenAI 與 AI Product Thinking 有興趣, 歡迎追蹤我的 Medium,一起學習、一起成長 😊