本文為 iPAS「AI應用規劃師(初級)」科目一「人工智慧基礎概論」CH3.2 資料處理與分析概念 的完整考試筆記整理,涵蓋統計測量數(中央趨勢與分散度)、機率模型、假設檢定名詞、探索性資料分析(EDA)vs 驗證性資料分析(CDA),並附上 10 題章節考古題與解析,適合準備 iPAS AI應用規劃師初級考試的考生複習使用。
CH3.2 資料處理與分析概念
本節架構:統計學是駕馭資料、獲得洞見的指南針:先用中央趨勢與分散度兩類統計測量數描述資料 → 再用機率模型量化抽樣變異、進行假設檢定等統計推論 → 最後依分析目的區分探索性資料分析(EDA)與驗證性資料分析(CDA)。
一、統計測量數:中央趨勢
統計測量數大致包含三種類型:中央趨勢的衡量、分散度的衡量及其他測量數。「中央趨勢」指一組資料的集中位置。
| 統計量 | 定義 | 特性 |
|---|---|---|
| 平均數(Mean) | 所有資料值相加後除以資料個數的「重心」;最常見為算術平均數(Arithmetic Mean) | 計算簡單、易於理解,但容易受極端值影響 |
| 中位數(Median) | 資料按大小排序後,位於正中間的數值 | 不易受極端值影響,更能反映典型水平;但複雜數學運算與統計推斷時較不易操作 |
| 眾數(Mode) | 資料中出現頻率最高的值 | 不受極端值影響,可能有多個或不存在,應用較受限 |
補充:除算術平均數外,還有幾何平均數(Geometric Mean)、調和平均數(Harmonic Mean),但實務上算術平均數因計算簡單更常用。
核心觀念:偏態分布與三個中央趨勢量的關係:
– 對稱分布:平均數、中位數、眾數三者接近。
– 正偏態分布(尾巴向右延伸):平均數 > 中位數。
– 負偏態分布(尾巴向左延伸):平均數 < 中位數。 這是考題常考的判斷方向,容易左右顛倒記錯,建議搭配「尾巴往哪拉,平均數就往哪偏」的口訣記憶。
二、統計測量數:分散度
分散度之衡量統計量用於衡量資料的離散程度,主要用於尋找變異的原因和性質。常見的分散度衡量統計量有:四分位數、全距、四分位距、平均差(Mean Deviation)、變異數(Coefficient of Variation)及標準差(Standard Deviation)等。
| 統計量 | 定義 | 特性/缺點 |
|---|---|---|
| 四分位數(Quartile) | 所有數值由小到大排列並分成四等份,三個分割點位置的數值 | — |
| 全距(Range, R) | 最大值減最小值 | 只考慮兩個極端觀察值,未考慮全體,不能精確反映全體分散情形,且會受極端值影響 |
| 四分位距(IQR, Interquartile Range) | 第三四分位數(Q3)與第一四分位數(Q1)之差 | 代表資料中間 50% 的數據範圍;與全距有一樣的缺點(會受極端值影響) |
| 平均差(Mean Deviation) | 每個觀察值與平均數之間的差距 | 數值越大表示分散程度越高 |
| 標準差(Standard Deviation) | 衡量一組資料分散程度的統計量 | 標準差越大 → 資料點離平均值越遠、分散程度越高;在品質管理中,標準差越大表示產品品質越不穩定、良率越低 |
易錯點:四分位距(IQR)常被誤認為「不受極端值影響」,但官方解析明確指出 IQR 與全距有一樣的缺點,也就是說並不代表資料中所有數據的分散程度,且計算基礎仍來自排序後的分位點,容易在選項中被設計成陷阱(例如「IQR 不受極端值影響」為錯誤敘述)。
三、抽樣變異與機率模型
當我們從母體中抽取樣本進行分析時,由於樣本的隨機性,得到的統計量(如樣本平均數、樣本標準差)與母體參數之間存在差異,這種差異稱為抽樣變異。為了量化這種變異並進行推論,需要引入機率模型(Probability Models):它能刻畫抽樣變異的特性,進而對母體參數做出推斷,並建立框架進行區間估計和假設檢定等統計推論。
四、常見統計方法分類
| 因果關係 | 方法 |
|---|---|
| 無因果關係 | 敘述性統計、複選題分析、(多重)交叉分析、卡方檢定、主成份分析、因素分析、集群分析、(偏)相關分析 |
| 有因果關係 | 二元羅吉斯迴歸、區別分析、迴歸分析、(多變量)變異數分析、偏最小平方迴歸 |
五、假設檢定名詞介紹
假設檢定之流程:猜想(假定)→ 蒐集資料 → 檢定 → 作決策(接受或拒絕猜想)。
統計假設(hypothesis)是指對母體分佈的陳述或推測,即關於母體特性的一種假設性敘述(statement)。
| 名詞 | 說明 |
|---|---|
| 虛無假設(null hypothesis, H0) | 表示不存在顯著效果或差異,通常作為檢定的基準假設 |
| 對立假設(alternative hypothesis, Ha/H1/K) | 與虛無假設相對,表示存在顯著效果或差異 |
| 簡單假設(Simple Hypothesis) | 完全確定母體分佈的所有參數 |
| 複合假設(Composite Hypothesis) | 僅對母體分佈的部分參數作出假設 |
| 統計推論(statistical inference) | 導致接受或拒絕統計假設的步驟 |
| 假設檢定(testing hypothesis) | 基於母體之一組隨機樣本 X,以決定 H0、Ha 中何者該拒絕 |
| 接受域(acceptance region) | 使虛無假設被接受之集合 |
| 拒絕域(rejection region) | 使虛無假設被拒絕之集合。對一檢定,以 C 為拒絕域,即拒絕 H0,若且為若 χ∈C |
| 顯著水準(significance level, α) | α 稱為顯著水準,又稱檢定大小,常取 0.1、0.05 或 0.01 |
| 檢定統計量(test statistic) | 樣本 X 的一個實值函數,以 T=T(X) 表之,用來決定是否接受 H0 |
| p值(p-value) | 在 H0 為真之下,檢定統計量落在比觀測值至少同樣極端的區域之機率,又稱觀測大小 |
統計檢定之可能結果
| H0 為真 | H0 為假 | |
|---|---|---|
| 接受 H0 | 正確 | Type II 錯誤(β) |
| 拒絕 H0 | Type I 錯誤(α) | 正確 |
alpha = P(拒絕 H0 | H0 為真) beta = P(接受 H0 | Ha 為真)
核心觀念:p 值與顯著水準的判斷邏輯:若所得觀測值的 p 值夠小,小於 α,則拒絕虛無假設。例如 p = 0.03 < α = 0.05 時,代表在虛無假設為真的情況下,觀察到目前數據或更極端數據的機率僅 3%,因此拒絕 H0,也就是我們有 1 − α = 95% 的信心認為觀察到的結果並非偶然,而是支持對立假設。同時,顯著水準 α = 0.05 表示我們願意接受 5% 的風險犯 Type I 錯誤(拒絕一個實際為真的虛無假設)。
易錯點:表格中「拒絕 H0」對應「H0 為真」時是 Type I 錯誤(α),「接受 H0」對應「H0 為假」時是 Type II 錯誤(β)——原文表格本身即有此對應關係,作答時務必對齊「H0 真假 × 接受/拒絕」四個象限,不要記反 Type I/Type II。
六、探索性資料分析 vs 驗證性資料分析
根據分析目的,資料分析可大致分為兩類:探索性資料分析(Exploratory Data Analysis, EDA)和驗證性資料分析(Confirmatory Data Analysis, CDA)。
| 項目 | 探索性資料分析(EDA) | 驗證性資料分析(CDA) |
|---|---|---|
| 目的 | 靈活且開放的探索過程,從資料中發現潛在的模式、關係和異常值 | 驗證研究者提出的假設,並進行更深入的挖掘 |
| 使用時機 | 通常在研究初期,對資料特徵尚不熟悉時進行 | EDA 之後,針對已生成的假設做進一步驗證 |
| 常用方法 | 視覺化工具,直觀觀察資料分佈,提出初步假設 | 分類、分群、相關性分析、預測模型;也可能結合定性分析 |
| 產出 | 為後續深入分析提供線索與假設方向 | 對探索階段發現的模式進行更深入挖掘 |
記憶技巧:EDA(探索)在前、CDA(驗證)在後:先「開放式挖掘假設」,再「針對假設做深入驗證」。可對應成「先探路、再驗證」。
🔗 相關名詞卡
平均數|中位數|眾數|四分位數|全距|四分位距|標準差|機率模型|假設檢定|虛無假設|顯著水準|p值|探索性資料分析|驗證性資料分析
📝 章節考題自測(先作答,再點開解答)
Q1. 關於 K 平均法(K-means),下列敘述何者「不」正確?
(A) 希望找出 k 個互不交集的群集 (B) 不同的起始群集中心,可能會造成不同的分群結果 (C) 容易受雜訊與離群值(Outlier)影響其群集中心 (D) 可以處理類別型資料
點我看解答與解析
Ans: (D)
K-means 演算法特性為:隨機選取集群中心、依距離計算、各群質心為代表點、分割式分群、易受離群值影響,且是用於數值型資料的集群方法,並不適合直接處理類別型資料,故 (D) 敘述不正確。
Q2. 在品質管理中,若一產品的生產過程中標準差顯著偏大,通常意味著什麼?
(A) 資料點高度集中,產品質量穩定 (B) 生產過程波動大,產品品質不穩定 (C) 資料無法反映產品實際狀況 (D) 中位數數值高,品質良率較高
點我看解答與解析
Ans: (B)
標準差越大表示數據分散程度越高,在品質管理中意味著產品或過程波動大,進而產品品質不穩定。
Q3. 下列何者「並非」K 平均數(k-means)集群法的特點?
(A) 原理相對其他集群法較為複雜 (B) 可結合其他方法,使用上較為彈性 (C) 在特定情況下,能將集群的任務處理得足夠好 (D) 不適合非球形、數據密度變化大或有離群數據的集群問題
點我看解答與解析
Ans: (A)
K-means 原理相對簡單直觀(而非複雜),常用於估計結果不穩定時作為快速分群方法,故「原理較為複雜」的敘述並非其特點。
Q4. 驗證性資料分析(Confirmatory Data Analysis, CDA)與探索性資料分析(Exploratory Data Analysis, EDA)相比,主要著重於下列哪一項?
(A) 對資料進行初步描述和視覺化 (B) 驗證先前生成的假設並進行深入挖掘 (C) 排除資料中的極端值以提高準確性 (D) 探索數據中潛在的模式和異常
點我看解答與解析
Ans: (B)
驗證性資料分析的重點在於檢驗先前所提出的假設,通常採用分類、分群、相關性分析或預測模型等方法進行深入分析;(A)(D) 屬於探索性資料分析(EDA)的重點。
Q5. 以下哪種情況下,使用中位數來描述資料的集中趨勢最為合適?
(A) 一組考試成績,大部分學生分數集中在 80 分左右 (B) 一組房屋價格數據,其中包含少數豪宅的極端高價 (C) 一組產品銷售量數據,每個產品的銷量差異不大 (D) 一組學生身高數據,呈現出常態分布
點我看解答與解析
Ans: (B)
平均數易受極端值影響,當資料中有極端值時會偏離資料的中心趨勢;中位數不受極端值影響,能更準確地反映資料中心趨勢,特別是在資料分布不對稱或有極端值(如少數豪宅高價)的情況下。
Q6. 一組數據中,如果平均數小於中位數,那麼這組數據的分布可能是下列哪一種?
(A) 對稱分布 (B) 正偏態分布 (C) 負偏態分布 (D) 無法判斷
點我看解答與解析
Ans: (C)
對稱分布:平均數、中位數、眾數通常接近。正偏態分布:資料尾巴向右延伸,平均數 > 中位數。負偏態分布:資料尾巴向左延伸,平均數 < 中位數,符合題意。
Q7. 當我們進行一次假設檢定,得到的 p 值為 0.03,顯著性水準設定為 0.05,以下哪一個敘述是正確的?
(A) 我們有 97%的信心拒絕虛無假設 (B) 我們有 95%的信心拒絕虛無假設 (C) 我們無法拒絕虛無假設 (D) 我們有 5%的機率犯型一錯誤
點我看解答與解析
Ans: (B)
p 值為 0.03 表示,在虛無假設為真的情況下,觀察到目前數據或更極端數據的機率是 3%,也就是這樣的結果非常罕見。顯著性水準設定為 0.05 表示我們願意接受 5% 的風險拒絕一個實際為真的虛無假設(即 Type I Error)。由於 0.03 < 0.05,因此拒絕虛無假設,這意味著我們有 95% 的信心認為觀察到的結果並非偶然,而是支持對立假設。
(D 選項迷惑點:「5% 的機率犯型一錯誤」描述的是顯著水準 α 本身的意義,並非本次檢定結果的直接結論,故本題最適當敘述為 B。)
Q8. 一組資料中,若平均數大於中位數,則這組資料的分布可能是下列哪一種?
(A) 對稱分布 (B) 負偏態分布 (C) 正偏態分布 (D) 無法判斷
點我看解答與解析
Ans: (C)
對稱分布:平均數、中位數、眾數通常接近;負偏態分布:資料尾巴向左延伸,平均數會小於中位數;正偏態分布:資料尾巴向右延伸,平均數會大於中位數,符合題意。
Q9. 下列哪一個敘述關於四分位距(IQR)是正確的?
(A) 四分位距會受到極端值的影響 (B) 四分位距代表資料中所有數據的分散程度 (C) 四分位距是第三四分位數與第一四分位數的差 (D) 四分位距與平均數一樣,容易受到極端值影響
點我看解答與解析
Ans: (C)
四分位距(IQR)是指一組數據中,第三四分位數(Q3)與第一四分位數(Q1)的差,代表資料中間 50% 數據的範圍。
(本題官方解析僅確認 C 為正確定義;需注意課文中另指出「IQR 與全距有一樣的缺點」,但此處官方答案聚焦於 C 的定義敘述本身。)
Q10. 以下哪一種情況最適合用眾數來描述資料的集中趨勢?
(A) 一組學生身高資料,呈現出常態分布 (B) 一組產品銷售量資料,其中一種產品的銷量遠高於其他產品 (C) 一組考試成績資料,大部分學生的分數集中在 80 分左右 (D) 一組房屋價格資料,其中包含少數豪宅的極端高價
點我看解答與解析
Ans: (B)
眾數代表資料中出現頻率最高的數值。當資料中有一個或幾個數值出現的頻率明顯高於其他數值時,眾數能較好地反映資料的集中趨勢。當一種產品的銷量遠高於其他產品時,這個產品的銷量就是眾數,代表大多數銷售額來自這個產品,使用眾數能更直接地反映出最受歡迎的產品。
結語
以上是 iPAS AI應用規劃師(初級)科目一 CH3.2 資料處理與分析概念 的重點整理,建議搭配 CH3.1 人工智慧概念、CH3.3 機器學習概念、CH3.4 鑑別式AI與生成式AI概念一起複習,掌握完整的人工智慧基礎概論知識體系,為 iPAS AI應用規劃師初級考試做好準備。
