ಹರಡುವಿಕೆಯ ಅಳತೆಗಳು: ಡೇಟಾದಲ್ಲಿನ ವ್ಯತ್ಯಾಸವನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳುವುದು
ಅಂಕಿಅಂಶಗಳು ಮತ್ತು ದತ್ತಾಂಶ ವಿಶ್ಲೇಷಣೆಯಲ್ಲಿ, ನಿಖರ ಮತ್ತು ಸಂಬಂಧಿತ ತೀರ್ಮಾನಗಳನ್ನು ಮಾಡಲು ದತ್ತಾಂಶದ ವಿತರಣೆ ಮತ್ತು ವ್ಯತ್ಯಾಸವನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳುವುದು ಬಹಳ ಮುಖ್ಯ. ದತ್ತಾಂಶದಲ್ಲಿನ ವ್ಯತ್ಯಾಸವನ್ನು ವಿವರಿಸಲು ಬಳಸುವ ಒಂದು ಪ್ರಮುಖ ಪರಿಕಲ್ಪನೆಯೆಂದರೆ "ಪ್ರಸರಣ ಅಳತೆ". ಈ ಲೇಖನವು ಪ್ರಸರಣದ ವಿವಿಧ ಅಳತೆಗಳು, ಅವು ಏಕೆ ಮುಖ್ಯ, ಅವುಗಳನ್ನು ಹೇಗೆ ಲೆಕ್ಕ ಹಾಕುವುದು ಮತ್ತು ದತ್ತಾಂಶ ವಿಶ್ಲೇಷಣೆಯ ಸಂದರ್ಭದಲ್ಲಿ ಅವುಗಳ ವ್ಯಾಖ್ಯಾನವನ್ನು ಚರ್ಚಿಸುತ್ತದೆ.
ಹರಡುವಿಕೆಯ ಅಳತೆ ಎಂದರೇನು?
ಪ್ರಸರಣದ ಅಳತೆಗಳು ಒಂದು ಗುಂಪಿನಲ್ಲಿರುವ ದತ್ತಾಂಶವು ಕೇಂದ್ರ ಮೌಲ್ಯದಿಂದ ಎಷ್ಟರ ಮಟ್ಟಿಗೆ ಹರಡುತ್ತದೆ ಅಥವಾ ಚದುರಿಹೋಗುತ್ತದೆ ಎಂಬುದನ್ನು ವಿವರಿಸಲು ಬಳಸುವ ಮೆಟ್ರಿಕ್ಗಳಾಗಿವೆ. ಈ ಕೇಂದ್ರ ಮೌಲ್ಯವನ್ನು ಸಾಮಾನ್ಯವಾಗಿ ಸರಾಸರಿ ಅಥವಾ ಮಧ್ಯದಂತಹ ಕೇಂದ್ರ ಪ್ರವೃತ್ತಿಯ ಅಳತೆಗಳನ್ನು ಬಳಸಿಕೊಂಡು ಅಳೆಯಲಾಗುತ್ತದೆ. ಪ್ರಸರಣದ ಅಳತೆಗಳು ದತ್ತಾಂಶದ ವ್ಯಾಪ್ತಿ, ವ್ಯತ್ಯಾಸ ಮತ್ತು ಸ್ಥಿರತೆಯ ಒಳನೋಟವನ್ನು ಒದಗಿಸುತ್ತದೆ.
ಸ್ಪ್ರೆಡ್ ಗಾತ್ರ ಏಕೆ ಮುಖ್ಯ?
1. ವ್ಯತ್ಯಾಸವನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳುವುದು:
ಯಾವುದೇ ಡೇಟಾದ ಅವಿಭಾಜ್ಯ ಅಂಗವೆಂದರೆ ವ್ಯತ್ಯಾಸ. ಡೇಟಾ ಎಷ್ಟು ಬದಲಾಗುತ್ತದೆ ಎಂಬುದನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳುವ ಮೂಲಕ, ಆ ಡೇಟಾದ ಆಧಾರವಾಗಿರುವ ಚಲನಶೀಲತೆಯನ್ನು ನಾವು ಅರ್ಥಮಾಡಿಕೊಳ್ಳಬಹುದು.
2. ಹೊರಗಿರುವ ಅಂಶಗಳನ್ನು ಗುರುತಿಸಿ:
ದತ್ತಾಂಶ ವಿತರಣೆಯು ಹೊರಗಿನ ಮೌಲ್ಯಗಳನ್ನು ಗುರುತಿಸಲು ಸಹಾಯ ಮಾಡುತ್ತದೆ (ಉಳಿದ ದತ್ತಾಂಶದಿಂದ ದೂರವಿರುವ ತೀವ್ರ ಮೌಲ್ಯಗಳು), ಇದು ಹೆಚ್ಚಿನ ವಿಶ್ಲೇಷಣೆಗೆ ಮುಖ್ಯವಾಗಬಹುದು ಅಥವಾ ದೋಷ ದತ್ತಾಂಶವಾಗಿರಬಹುದು.
3. ಡೇಟಾಸೆಟ್ ಹೋಲಿಕೆ:
ಪ್ರಸರಣದ ಅಳತೆಗಳು ಎರಡು ಅಥವಾ ಹೆಚ್ಚಿನ ದತ್ತಾಂಶ ಸೆಟ್ಗಳ ನಡುವೆ ಹೋಲಿಕೆ ಮಾಡಲು ಅನುವು ಮಾಡಿಕೊಡುತ್ತದೆ. ಉದಾಹರಣೆಗೆ, ಎರಡು ದತ್ತಾಂಶ ಸೆಟ್ಗಳು ಒಂದೇ ಸರಾಸರಿಯನ್ನು ಹೊಂದಿರಬಹುದು ಆದರೆ ವಿಭಿನ್ನ ವ್ಯತ್ಯಾಸಗಳು ಅಥವಾ ಪ್ರಸರಣಗಳನ್ನು ಹೊಂದಿರಬಹುದು.
4. ತಾರ್ಕಿಕ ಅಂಕಿಅಂಶಗಳು:
ಅನೇಕ ತಾರ್ಕಿಕ ಸಂಖ್ಯಾಶಾಸ್ತ್ರೀಯ ವಿಧಾನಗಳು ಮಾನ್ಯ ಮತ್ತು ಮಹತ್ವದ ತೀರ್ಮಾನಗಳನ್ನು ತೆಗೆದುಕೊಳ್ಳಲು ದತ್ತಾಂಶದ ವಿತರಣೆಯ ಉತ್ತಮ ತಿಳುವಳಿಕೆಯನ್ನು ಬಯಸುತ್ತವೆ.
ಸ್ಪ್ರೆಡ್ ಗಾತ್ರದ ವಿಧಗಳು
ಸಂಖ್ಯಾಶಾಸ್ತ್ರೀಯ ದತ್ತಾಂಶ ವಿಶ್ಲೇಷಣೆಯಲ್ಲಿ ಸಾಮಾನ್ಯವಾಗಿ ಬಳಸುವ ಪ್ರಸರಣದ ಹಲವಾರು ಅಳತೆಗಳಿವೆ:
1. ಶ್ರೇಣಿ
ಶ್ರೇಣಿಯು ಹರಡುವಿಕೆಯ ಸರಳ ಅಳತೆಯಾಗಿದೆ ಮತ್ತು ಡೇಟಾ ಸೆಟ್ನಲ್ಲಿ ಗರಿಷ್ಠ ಮತ್ತು ಕನಿಷ್ಠ ಮೌಲ್ಯಗಳ ನಡುವಿನ ವ್ಯತ್ಯಾಸವಾಗಿ ಲೆಕ್ಕಹಾಕಲಾಗುತ್ತದೆ.
\[ \ಪಠ್ಯ{ಶ್ರೇಣಿ} = \ಪಠ್ಯ{ಗರಿಷ್ಠ ಮೌಲ್ಯ} – \ಪಠ್ಯ{ಕನಿಷ್ಠ ಮೌಲ್ಯ} \]
ಲೆಕ್ಕಾಚಾರ ಮಾಡಲು ಸುಲಭವಾಗಿದ್ದರೂ, ಶ್ರೇಣಿಯು ಎರಡು ಡೇಟಾ ಬಿಂದುಗಳನ್ನು ಮಾತ್ರ ಪರಿಗಣಿಸುತ್ತದೆ ಮತ್ತು ಕನಿಷ್ಠ ಮತ್ತು ಗರಿಷ್ಠ ಮೌಲ್ಯಗಳ ನಡುವಿನ ಡೇಟಾ ವಿತರಣೆಯನ್ನು ಪ್ರತಿಬಿಂಬಿಸುವುದಿಲ್ಲ.
2. ಇಂಟರ್ಕ್ವಾರ್ಟೈಲ್ ರೇಂಜ್ (IQR)
IQR, ಶ್ರೇಣಿಗಿಂತ ಪ್ರಸರಣದ ಹೆಚ್ಚು ದೃಢವಾದ ಅಳತೆಯಾಗಿದೆ ಏಕೆಂದರೆ ಇದು ಹೊರಗಿನ ಅಂಶಗಳಿಂದ ಪ್ರಭಾವಿತವಾಗುವುದಿಲ್ಲ. ಇದು 75 ನೇ ಶೇಕಡಾವಾರು (Q3) ನಿಂದ 25 ನೇ ಶೇಕಡಾವಾರು (Q1) ಅನ್ನು ಕಳೆಯುವ ಮೂಲಕ ಡೇಟಾದ ಸರಾಸರಿ ಶ್ರೇಣಿಯನ್ನು ಲೆಕ್ಕಾಚಾರ ಮಾಡುತ್ತದೆ.
\[ \ಪಠ್ಯ{IQR} = Q3 – Q1 \]
ಸರಾಸರಿ ಮೇಲೆ ಕೇಂದ್ರೀಕರಿಸುವ ಮೂಲಕ, IQR ಆಧಾರವಾಗಿರುವ ಡೇಟಾದ ವಿತರಣೆಯ ಉತ್ತಮ ಚಿತ್ರವನ್ನು ಒದಗಿಸುತ್ತದೆ.
3. ವ್ಯತ್ಯಾಸ
ದತ್ತಾಂಶ ಸಮೂಹದಲ್ಲಿನ ಪ್ರತಿಯೊಂದು ಮೌಲ್ಯವು ಸರಾಸರಿಯಿಂದ ಎಷ್ಟು ದೂರದಲ್ಲಿದೆ ಎಂಬುದನ್ನು ವ್ಯತ್ಯಾಸವು ಅಳೆಯುತ್ತದೆ. ಇದನ್ನು ಪ್ರತಿ ಮೌಲ್ಯದ ವ್ಯತ್ಯಾಸಗಳ ವರ್ಗಗಳನ್ನು ಸರಾಸರಿಯಿಂದ ಕೂಡಿಸಿ, ನಂತರ ದತ್ತಾಂಶ ಅಂಶಗಳ ಸಂಖ್ಯೆಯಿಂದ (ಜನಸಂಖ್ಯೆಗೆ) ಅಥವಾ ಅಂಶಗಳ ಸಂಖ್ಯೆಯಿಂದ ಒಂದನ್ನು ಕಳೆಯುವ ಮೂಲಕ (ಮಾದರಿಗಾಗಿ) ಭಾಗಿಸುವ ಮೂಲಕ ಲೆಕ್ಕಹಾಕಲಾಗುತ್ತದೆ.
ಜನಸಂಖ್ಯೆಗೆ (\(\sigma^2\)):
\[ \ಸಿಗ್ಮಾ^2 = \frac{\ಮೊತ್ತ (X_i – \mu)^2}{N} \]
ಮಾದರಿಗಾಗಿ (\(s^2\)):
\[ s^2 = \frac{\sum (X_i – \overline{X})^2}{n-1} \]
ವ್ಯತ್ಯಾಸವು ದತ್ತಾಂಶದ ಸ್ಥಿರತೆಯ ಕಲ್ಪನೆಯನ್ನು ಒದಗಿಸುತ್ತದೆ; ಆದಾಗ್ಯೂ, ವ್ಯತ್ಯಾಸವು ವರ್ಗೀಕೃತ ಘಟಕಗಳನ್ನು ಬಳಸುವುದರಿಂದ, ಅದನ್ನು ನೇರವಾಗಿ ಅರ್ಥೈಸಲು ಕಷ್ಟವಾಗುತ್ತದೆ.
4. ಪ್ರಮಾಣಿತ ವಿಚಲನ
ಪ್ರಮಾಣಿತ ವಿಚಲನವು ವ್ಯತ್ಯಾಸದ ವರ್ಗಮೂಲವಾಗಿದೆ ಮತ್ತು ಮೂಲ ದತ್ತಾಂಶದಂತೆಯೇ ಅದೇ ಘಟಕಗಳಲ್ಲಿರುತ್ತದೆ, ಇದು ಅರ್ಥೈಸಲು ಸುಲಭವಾಗುತ್ತದೆ.
ಜನಸಂಖ್ಯೆಗೆ (\(\ಸಿಗ್ಮಾ\)):
\[ \sigma = \sqrt{\sigma^2} = \sqrt{\frac{\sum (X_i – \mu)^2}{N}} \]
ಮಾದರಿಗಾಗಿ (\(ಗಳು\)):
\[ s = \sqrt{s^2} = \sqrt{\frac{\sum (X_i – \overline{X})^2}{n-1}} \]
ಪ್ರಮಾಣಿತ ವಿಚಲನವು ಪ್ರಸರಣದ ಅತ್ಯಂತ ಸಾಮಾನ್ಯವಾಗಿ ಬಳಸುವ ಅಳತೆಗಳಲ್ಲಿ ಒಂದಾಗಿದೆ ಏಕೆಂದರೆ ಇದನ್ನು ಅರ್ಥೈಸಲು ಸುಲಭ ಮತ್ತು ವಿವಿಧ ಸಂಖ್ಯಾಶಾಸ್ತ್ರೀಯ ವಿಶ್ಲೇಷಣೆಗಳಲ್ಲಿ ಆಗಾಗ್ಗೆ ಬಳಸಲಾಗುತ್ತದೆ.
5. ವ್ಯತ್ಯಾಸದ ಗುಣಾಂಕ (CV)
CV ಎಂಬುದು ಸಾಪೇಕ್ಷ ಪ್ರಸರಣದ ಅಳತೆಯಾಗಿದ್ದು, ಇದನ್ನು ಪ್ರಮಾಣಿತ ವಿಚಲನದ ಅನುಪಾತವಾಗಿ ಸರಾಸರಿಗೆ ವ್ಯಕ್ತಪಡಿಸಲಾಗುತ್ತದೆ ಮತ್ತು ಇದನ್ನು ಹೆಚ್ಚಾಗಿ ಶೇಕಡಾವಾರು ಪ್ರಮಾಣದಲ್ಲಿ ವ್ಯಕ್ತಪಡಿಸಲಾಗುತ್ತದೆ.
\[ \ಪಠ್ಯ{CV} = \frac{s}{\ಓವರ್ಲೈನ್{X}} \ಟೈಮ್ಸ್ 100\% \]
ವಿಭಿನ್ನ ವಿಧಾನಗಳೊಂದಿಗೆ ಡೇಟಾ ಸೆಟ್ಗಳ ನಡುವಿನ ವ್ಯತ್ಯಾಸವನ್ನು ಹೋಲಿಸಲು CV ತುಂಬಾ ಉಪಯುಕ್ತವಾಗಿದೆ.
ಲೆಕ್ಕಾಚಾರ ಮತ್ತು ಅರ್ಥೈಸುವುದು ಹೇಗೆ
ಲೆಕ್ಕಾಚಾರದ ಉದಾಹರಣೆ
ಕೆಳಗಿನ ಡೇಟಾ ಉದಾಹರಣೆಯೊಂದಿಗೆ ವಿವರಿಸೋಣ:
\[ \{15, 20, 25, 35, 45, 55, 65, 75, 85, 95\} \]
1. ಶ್ರೇಣಿ:
\[ \ಪಠ್ಯ{ಶ್ರೇಣಿ} = 95 – 15 = 80 \]
2. ಇಂಟರ್ಕ್ವಾರ್ಟೈಲ್ ಶ್ರೇಣಿ (IQR):
ಡೇಟಾವನ್ನು ವಿಂಗಡಿಸಿದ ನಂತರ, ನಾವು Q1 ಮತ್ತು Q3 ಕ್ವಾರ್ಟೈಲ್ಗಳನ್ನು ಕಂಡುಹಿಡಿಯಬಹುದು. ಈ ಸಂದರ್ಭದಲ್ಲಿ, Q1 25 ಮತ್ತು Q3 75 ಆಗಿದೆ.
\[ \ಪಠ್ಯ{IQR} = 75 – 25 = 50 \]
3. ವ್ಯತ್ಯಾಸ ಮತ್ತು ಪ್ರಮಾಣಿತ ವಿಚಲನ:
ದತ್ತಾಂಶದ ಸರಾಸರಿ (\(\overline{X}\)) 51.5. ನಂತರ ನಾವು ವ್ಯತ್ಯಾಸ ಮತ್ತು ಪ್ರಮಾಣಿತ ವಿಚಲನವನ್ನು ಲೆಕ್ಕ ಹಾಕುತ್ತೇವೆ.
\[ \ಪಠ್ಯ{ವ್ಯತ್ಯಾಸ (s^2)} = \frac{1}{n-1} \ಮೊತ್ತ (X_i – \ಓವರ್ಲೈನ್{X})^2 = 816.11 \]
\[ \ಪಠ್ಯ{ಪ್ರಮಾಣಿತ ವಿಚಲನ (ಗಳು)} = \sqrt{816.11} = 28.57 \]
4. ವ್ಯತ್ಯಾಸದ ಗುಣಾಂಕ (CV):
\[ \ಪಠ್ಯ{CV} = \frac{28.57}{51.5} \ಬಾರಿ 100\% \ಸುಮಾರು 55.48\% \]
ಇಲ್ಲಿಂದ, ಪ್ರಮಾಣಿತ ವಿಚಲನವು 28.57 ಎಂದು ನಾವು ಅರ್ಥೈಸಿಕೊಳ್ಳಬಹುದು, ಆದರೆ CV ಪ್ರಮಾಣಿತ ವಿಚಲನವು ಮೂಲ ದತ್ತಾಂಶದ ಸರಾಸರಿಯ ಸುಮಾರು 55.48% ಎಂದು ತೋರಿಸುತ್ತದೆ.
ತೀರ್ಮಾನ
ಪ್ರಸರಣದ ಅಳತೆಗಳು ಸಂಖ್ಯಾಶಾಸ್ತ್ರೀಯ ದತ್ತಾಂಶ ವಿಶ್ಲೇಷಣೆಯ ಅತ್ಯಗತ್ಯ ಅಂಶಗಳಾಗಿವೆ ಏಕೆಂದರೆ ಅವು ಕೇಂದ್ರ ಮೌಲ್ಯದ ಸುತ್ತ ದತ್ತಾಂಶದ ವ್ಯತ್ಯಾಸ ಮತ್ತು ಹರಡುವಿಕೆಯ ಒಳನೋಟವನ್ನು ಒದಗಿಸುತ್ತವೆ. ಸಾಮಾನ್ಯವಾಗಿ ಬಳಸುವ ಪ್ರಸರಣದ ಅಳತೆಗಳಲ್ಲಿ ವ್ಯಾಪ್ತಿ, ಇಂಟರ್ಕ್ವಾರ್ಟೈಲ್ ಶ್ರೇಣಿ, ವ್ಯತ್ಯಾಸ, ಪ್ರಮಾಣಿತ ವಿಚಲನ ಮತ್ತು ವ್ಯತ್ಯಾಸದ ಗುಣಾಂಕ ಸೇರಿವೆ. ಈ ಪ್ರತಿಯೊಂದು ಅಳತೆಗಳು ನಿರ್ದಿಷ್ಟ ಉಪಯೋಗಗಳನ್ನು ಹೊಂದಿವೆ ಮತ್ತು ದತ್ತಾಂಶದ ಸಂದರ್ಭ ಮತ್ತು ವಿಶ್ಲೇಷಣೆಯ ಉದ್ದೇಶವನ್ನು ಅವಲಂಬಿಸಿ ಅಮೂಲ್ಯವಾದ ಒಳನೋಟಗಳನ್ನು ಒದಗಿಸಬಹುದು. ಪ್ರಸರಣದ ಅಳತೆಗಳನ್ನು ಸೂಕ್ತವಾಗಿ ಅರ್ಥಮಾಡಿಕೊಳ್ಳುವ ಮತ್ತು ಬಳಸುವ ಮೂಲಕ, ನಾವು ವಿವಿಧ ಸಂಶೋಧನಾ ಕ್ಷೇತ್ರಗಳು ಮತ್ತು ದತ್ತಾಂಶ ವಿಜ್ಞಾನ ಅನ್ವಯಿಕೆಗಳಲ್ಲಿ ಹೆಚ್ಚು ಮಾಹಿತಿಯುಕ್ತ ಮತ್ತು ನಿಖರವಾದ ನಿರ್ಧಾರಗಳನ್ನು ತೆಗೆದುಕೊಳ್ಳಬಹುದು.