【Measures of Dispersion DSE】離差的度量|解密數據分散性【全攻略】

Table of Contents

Measures of Dispersion 離差的度量

在統計學中,我們常常需要了解一組數據的分散程度,也就是數據的離散程度。為了量化這種分散度,我們使用了一個重要的概念,稱為離差(Dispersion)。在本文中,我們將探討幾種常見的離差度量方法,包括變異數、標準差、範圍、四分位距和平均絕對偏差。我們將介紹這些方法的定義、計算方式以及它們在實際應用中的意義。

離差的度量 Measures of Dispersion 是什麼

離差的度量(Measures of Dispersion)是用來衡量一組數據中個別數值與平均值或中央趨勢之間的差異程度的統計量。它提供了數據的變異性和分散程度的資訊,幫助我們理解數據的分佈和數據點之間的差異。

Measures of Dispersion

分佈域(Range)

分佈域是最簡單的離差度量,它是資料集中最大值和最小值之間的差值。範圍越大,資料的變異性越高。

四分位數間距(Interquartile Range)

四分位數間距(Interquartile Range)是統計學中用來衡量數據的變異性的一個指標。它是指在一組數據中第一四分位數(25%分位數)與第三四分位數(75%分位數)之間的範圍。四分位數間距可以用來描述數據的離散程度或數據的分布的集中程度。

計算四分位數間距的步驟如下:

  1. 首先,將數據從小到大進行排序。
  2. 找到第一四分位數(Q1),即將數據分成四等分後的第一個等分點。
  3. 找到第三四分位數(Q3),即將數據分成四等分後的第三個等分點。
  4. 計算四分位數間距,即 Q3 – Q1。

四分位數間距提供了一個中間50%數據的範圍,可以幫助我們了解數據的分佈情況。它比範圍(最大值減最小值)更穩定

框線圖 Box-and-Whisker Diagram

框線圖(Box-and-Whisker Diagram)是一種統計圖表,用於呈現數據集的分布情況和統計摘要。它由一個矩形箱體和幾條線組成,用來表示數據的中位數、四分位數等統計量。

Box-and-Whisker Diagram

製作框線圖的步驟如下:

收集數據

首先,收集要比較的不同組別的數據。

計算統計量

對於每個組別,計算以下統計量:

  • 第一四分位數(Q1):將數據分成四等分後的第一個等分點。
  • 第二四分位數(Q2)或中位數:將數據分成兩等分的中間值。
  • 第三四分位數(Q3):將數據分成四等分後的第三個等分點。
  • 最小值:數據中的最小值。
  • 最大值:數據中的最大值。

繪製框線圖

在水平軸上繪製不同組別,並在垂直軸上繪製數值範圍。使用矩形箱體來表示四分位數的範圍,箱體的上邊界和下邊界分別表示第三四分位數和第一四分位數。在箱體兩側,使用兩條垂直線表示數據的整體範圍,即是分佈域。

解釋框線圖

透過觀察框線圖,可以比較不同組別之間的數據分佈情況。

  • 中位數:箱體內的線(中位數)表示數據的中心趨勢。
  • 四分位數範圍:箱體的高度表示數據的變異程度。較高的箱體表示數據的變異程度較大,較矮的箱體表示數據的變異程度較小。
  • 極值:圖的頭末端表示數據的整體範圍。

透過比較不同組別的框線圖,可以得出以下結論:

  • 中位數:比較不同組別的中位數可以了解數據的中心趨勢。
  • 分散程度:比較不同組別的箱體闊度可以了解數據的分散程度。

標準差(Standard Deviation)

標準差(Standard Deviation)是衡量數據集合中數據分散程度的一個統計指標。它衡量數據與平均值之間的差異程度,可以用來判斷數據的變異程度。

標準差 = √(Σ(xi – μ)² / N)

其中:

  • Σ 表示對所有數據點進行求和
  • xi 代表數據集中的每個數據點
  • μ 代表數據集的平均值
  • N 代表數據集中的總數據點
Standard Deviation

標準差的計算步驟如下:

  1. 計算數據的平均值(Mean)。
  2. 計算每個數據點與平均值之間的差異(偏差)。
  3. 將每個偏差的平方相加。
  4. 將總和除以數據點的個數。
  5. 取平均數的平方根,即為標準差。

標準差的值越大,表示數據點相對平均值的差異越大,數據的分散程度也越大;而標準差的值越小,表示數據點相對平均值的差異越小,數據的分散程度也越小。

標準差在統計分析中具有多種應用,例如:

  1. 衡量數據集合的變異性和分散程度。
  2. 判斷數據的離散程度,以及數據是否集中在平均值附近。
  3. 確定數據的正態分佈情況。
  4. 作為比較不同數據集合差異的指標。

分組數據 vs 不分組數據 Grouped Data vs Raw Data

分組數據和不分組數據是統計學中兩個不同的數據表示方式。

分組數據(Grouped Data)是指將數據按照一定的區間或類別進行分組,然後對每個組別的數據進行統計分析。例如,將身高數據分為不同的身高區間(例如150-160cm、160-170cm等),然後統計每個區間內的人數或其他統計量。

不分組數據(Raw Data)是指直接使用原始數據進行統計分析,沒有將數據分為不同的組別或類別。例如,如果有一組身高數據,不分組數據就是將每個人的具體身高值直接用於分析。

以下以計算標準差 Standard Deviation 展示分組數據及不分組數據的離差計算方法。

在不分組數據中,計算標準差的步驟如下:

  1. 計算數據的平均值(Mean)。
  2. 計算每個數據點與平均值之間的差異(偏差)。
  3. 將每個偏差的平方相加。
  4. 將總和除以數據點的個數。
  5. 取平均數的平方根,即為標準差。

在分組數據中,計算標準差的步驟略有不同:

  1. 計算每個組別的中點(或平均數)。
  2. 計算每個數據點與組別中點之間的差異(偏差)。
  3. 將每個偏差的平方相加。
  4. 將總和除以數據點的個數(或總數)。
  5. 取平均數的平方根,即為標準差。

分組數據的標準差計算方法考慮了數據在組內的分佈情況,並且將組內差異納入統計分析。而不分組數據的標準差計算方法則僅考慮數據的整體分散情況,不納入組內差異。

正態分佈 Normal Distribution

正態分佈,也稱為高斯分佈,是統計學中最常見的分佈之一。它具有對稱的鐘形曲線,並且其形狀由其均值和標準差確定。正態分佈的均值是曲線的中心點,標準差則決定曲線的寬度。

根據正態分佈的性質,約68%的數據位於均值加減一個標準差範圍內,約95%的數據位於均值加減兩個標準差範圍內,約99.7%的數據位於均值加減三個標準差範圍內。這被稱為「68-95-99.7規則」或「三個標準差法則」。

標準分 Standard Score

標準分是指將原始數據轉換為與其均值和標準差相關的新數據。這種轉換稱為標準化。標準分的計算方式是將原始數據點減去均值,然後除以標準差。它的公式為:

標準分 = (原始數據點 – 平均值) / 標準差

標準分的值可以告訴我們一個數據點與平均值相比有多少標準差的差距。如果標準分為正數,則該數據點高於平均值;如果標準分為負數,則該數據點低於平均值。

對每一項數據加上一個相同的常數對離差的影響

對於每一項數據加上一個相同的常數,將對離差產生以下影響:

平均值 中位數 眾數

平均值 中位數 眾數 Mean Median Mode

  1. 平均值:加上一個常數對平均值的影響是相同的,即平均值也會增加相同的常數。
  2. 中位數:加上一個常數對中位數的影響是相同的,即中位數也會增加相同的常數。
  3. 眾數:加上一個常數對眾數的影響是相同的,即眾數也會增加相同的常數。

分佈域 標準差 四分位分佈

分佈域 標準差 四分位分佈 Range Standard Deviation Interquartile Range

  1. 分佈域:加上一個常數對分佈域(數據的範圍)是沒有影響的,即分佈域不變。
  2. 標準差:加上一個常數對標準差是沒有影響的。標準差是衡量數據的離散程度,如果對所有數據加上一個常數,則標準差不會改變,因為數據的離散程度並沒有發生變化,即標準差不變。
  3. 四分位分佈:加上一個常數對四分位分佈是沒有影響的,因為每個四分位數也會增加相同的常數,即四分位分佈不變。

對每一項數據乘以一個相同的常數對離差的影響

當對每一項數據乘以一個相同的常數時,對離差(差異)的影響如下:

平均值 中位數 眾數

平均值 中位數 眾數 Mean Median Mode

  1. 平均值:乘以一個常數將使平均值也乘以相同的常數。如果常數大於1,則平均值將增大;如果常數在0和1之間,則平均值將減少。
  2. 中位數:乘以一個常將使中位數也乘以相同的常數。如果常數大於1,則中位數會增加。如果常數在0和1之間,則中位數會減少。
  3. 眾數:乘以一個常將使眾數也乘以相同的常數。如果常數大於1,則眾數會增加。如果常數在0和1之間,則眾數會減少。

分佈域 標準差 四分位分佈

分佈域 標準差 四分位分佈 Range Standard Deviation Interquartile Range

  1. 分佈域:乘以一個常數對分佈域(數據的範圍)的影響是相同的,即分佈域也將乘以相同的常數。
  2. 標準差:乘以一個常數對標準差的影響是不明確的。如果常數大於1,則標準差可能會增大,表示數據的離散程度變大;如果常數在0和1之間,則標準差可能會減小,表示數據的離散程度變小。
  3. 四分位分佈:乘以一個常數對四分位分佈的影響是相同的,即每個四分位數也將乘以相同的常數。

加數據/乘數據對數據的離差之影響 整理

離差對每一項數據加上一個相同的常數對每一項數據乘以一個相同的常數
平均值 Mean變變
中位數 Median變變
眾數 Mode變變
分佈域 Range不變變
標準差 Standard Deviation不變變
四分位分佈 Interquartile Range不變變

統計的應用及誤用 Uses and Abuses of Statistics 是什麼

統計的應用及誤用這個主題通常用於討論統計學在研究和決策過程中的角色,以及統計數據在各個領域中被誤用的風險。

“Uses of Statistics”(統計的應用)部分通常闡述統計在不同領域中的實際應用,例如科學研究、醫學和流行病學、市場調查、經濟分析等。這一部分著重於統計如何幫助我們收集、組織和分析數據,以得出有意義的結論和指導決策。

“Abuses of Statistics”(統計的誤用)部分則關注統計在現實中可能出現的問題和誤用情況。這包括選擇性報告結果、錯誤的因果關係推斷、樣本偏差、數據操作和分析錯誤等。該部分旨在提醒大家注意統計數據的局限性和可能的誤導性,並強調正確使用統計的重要性。

Uses and Abuses of Statistics

抽取調查樣本的不同技巧及製作問卷的基本原則

Different Techniques in Survey Sampling and the Basic Principles of Questionnaire Design

抽取調查樣本是進行統計調查的重要步驟,而製作問卷則是收集調查數據的關鍵工具。以下是認識抽取調查樣本的不同技巧以及製作問卷的基本原則:

抽樣技巧

  • 簡單隨機抽樣:從研究人口中以隨機方式選擇樣本,確保每個單位有相等的機會被選中。
  • 分層抽樣:將研究人口分成不同層次,然後在每個層次中進行簡單隨機抽樣,以確保每個層次都有適當的代表性。
  • 系統抽樣:根據事先確定的規則,例如每隔固定的間隔選擇一個樣本單位。
  • 分配抽樣:根據研究人口的特徵,按比例從不同子群體中抽取樣本。
  • 整群抽樣:將研究人口分成群組,然後以隨機方式選擇群組,再從選中的群組中選擇特定數量的樣本。

製作問卷的基本原則

  • 清晰明確:問題應該清晰明確,避免使用模棱兩可或含糊不清的詞語。確保問題的意思對受訪者來說是易於理解的。
  • 簡潔簡明:問卷應該簡潔,不要冗長或重複。避免問卷過於繁雜,以免引起受訪者的疲勞或不耐煩。
  • 避免偏見:問題的提問方式應該中立,不要引導受訪者的回答或表達任何偏見。避免使用主觀詞語或含有價值判斷的問題。
  • 順序合理:問題的順序應該有邏輯性,從簡單到複雜、從一般到具體。這樣可以幫助受訪者更順暢地回答問題。
  • 提供選項:在可能的情況下,提供具體的選項供受訪者選擇,這樣可以簡化回答過程,同時確保回答的一致性。
  • 預測反應範圍:問題的回答選項應該能夠涵蓋受訪者可能的回答範圍,並避免遺漏重要選項。
  • 測試和修訂:在正式使用問卷之前,進行測試和修訂是至關重要的。測試問卷可以幫助發現潛在問題並進行修正,以提高問卷的質量和效度。

這些技巧和原則有助於確保抽樣過程的有效性和問卷的可靠性。在進行抽樣和製作問卷時,研究人員應該根據具體研究目的和問題的特點選擇最適合的方法和原則,以確保收集到的數據具有代表性且可靠。

日常活動或調查中統計方法的應用和誤用

the Uses and Abuses of Statistical Methods in Daily-life Activities or Investigations

在日常活動和調查中,統計方法具有廣泛的應用,可以幫助我們獲得有關人群、事件或現象的數據和洞察。然而,統計方法也容易被誤用,導致誤導性的結果。以下是一些常見的統計方法應用和可能的誤用:

平均數的應用和誤用

應用:平均數是最常見的統計指標之一,它可以用來描述數據集的集中趨勢。例如,計算一個城市的平均年齡可以提供人口結構的一般概況。

誤用:平均數容易受到極端值的影響。當極端值存在時,平均數可能不再反映數據的典型情況。此外,如果樣本不具有正態分佈,使用平均數可能會產生誤解。

相關性的應用和誤用

應用:相關性分析可以用來評估兩個變數之間的關係。它可以提供有關變數如何隨著彼此變化的信息。例如,研究收入與教育水平之間的相關性。

誤用:相關性不等於因果關係。僅僅因為兩個變數相關,並不意味著其中一個變數是另一個變數的原因。這種誤解可能導致錯誤的因果推斷。

抽樣方法的應用和誤用

應用:抽樣方法用於從研究人口中選擇代表性的樣本。這樣可以節省時間和成本,同時獲得可靠的結果。

誤用:如果抽樣方法不正確或樣本不具有代表性,就可能導致偏差和不準確的結果。例如,使用方便抽樣(convenience sampling)可能導致樣本偏向某類人群,從而無法代表整個人群。

敏感度和特異度的應用和誤用

應用:敏感度和特異度是用於評估診斷測試準確性的統計指標。它們可以幫助我們了解測試的效能和可靠性。

誤用:敏感度和特異度並不是獨立於疾病流行率的指標。在不同的疾病流行率下,敏感度和特異度的值可能會有所變化。忽視這一點可能導致對測試準確性的不正確評估。

樣本大小的應用和誤用

應用:樣本大小的選擇對於統計結果的準確性和可靠性至關重要。較大的樣本大小通常可以提供更高的統計功效和較小的誤差。

誤用:過度解讀小樣本的結果是一個常見的誤用。小樣本容易產生偶然性的結果,並且可能無法代表整個人群。此外,過度依賴小樣本結果可能導致錯誤的結論和不準確的推斷。

評估從新聞媒介、研究報告等不同來源所獲得的統計調查報告

Assessing Statistical Investigations presented in Different Sources such as News Media, Research Reports, etc.

評估從不同來源獲得的統計調查報告是非常重要的,因為這可以幫助我們確定報告的可信度和可靠性。以下是一些評估統計調查報告的建議:

查看報告的來源

首先,檢查報告的來源是非常重要的。不同的來源具有不同的可信度和專業性。例如,經過同行評審的學術期刊通常較為可靠,而社交媒體上的帖子可能缺乏可信度。

檢查研究方法

了解報告中使用的研究方法是非常重要的。這包括樣本選擇方式、數據收集方法、統計分析方法等。確保研究方法是嚴謹和適當的,並且可以支持報告中的結論。

檢視樣本大小和代表性

樣本大小和代表性對於統計調查的可靠性至關重要。較大的樣本大小通常可以提供更可靠的結果,而具有代表性的樣本可以更好地推斷到整個人群。因此,應該關注報告中使用的樣本大小和抽樣方法,以確定其可靠性。

檢視結果的統計顯著性

統計顯著性是評估研究結果是否具有實際意義的一個重要指標。報告中應該提供統計顯著性的結果,並解釋其意義和影響。同時,應該關注報告中是否存在其他重要的統計指標,例如信度和效度。

尋找專家評論和其他獨立意見

如果可能的話,尋找來自相關領域的專家評論和其他獨立意見。這可以提供對報告的更全面和客觀的評估。同行評審和學術討論也可以幫助確定報告的可靠性。

注意報告的偏見和語氣

統計報告可能受到報告者的偏見和語氣的影響。注意報告中的價值觀、立場或個人觀點,並評估這些因素對報告結果的影響。

如果大家有什麼問題,歡迎你可以隨時再跟我們多交流一下,可以Email得到更多資訊,亦都可以上我們的網頁了解更多!

You cannot copy content of this page