ದತ್ತಾಂಶ ವಿತರಣೆಯಲ್ಲಿ ವ್ಯತ್ಯಾಸ ಮತ್ತು ಪ್ರಮಾಣಿತ ವಿಚಲನದ ವಿಶ್ಲೇಷಣೆ
ಅಂಕಿಅಂಶಗಳಲ್ಲಿ, ದತ್ತಾಂಶ ವಿತರಣೆಯನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳುವುದು ಸರಾಸರಿ ಅಥವಾ ಮಧ್ಯಾಂಕದಂತಹ ಕೇಂದ್ರ ಮೌಲ್ಯಗಳನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳುವಷ್ಟೇ ಮುಖ್ಯವಾಗಿದೆ. ಎರಡು ದತ್ತಾಂಶ ಸೆಟ್ಗಳು ಒಂದೇ ಸರಾಸರಿಯನ್ನು ಹೊಂದಿರಬಹುದು, ಆದರೆ ಅವುಗಳ ವಿತರಣೆಗಳು ಬಹಳ ಭಿನ್ನವಾಗಿವೆ: ಒಂದು ಸರಾಸರಿಯ ಸುತ್ತಲೂ ಬಿಗಿಯಾಗಿ ಗುಂಪಾಗಿರಬಹುದು, ಆದರೆ ಇನ್ನೊಂದು ವ್ಯಾಪಕವಾಗಿ ಹರಡಿರಬಹುದು. ಇಲ್ಲಿಯೇ ವ್ಯತ್ಯಾಸ ಮತ್ತು ಪ್ರಮಾಣಿತ ವಿಚಲನ ಬರುತ್ತದೆ - ಅವು ದತ್ತಾಂಶವು ಅದರ ಕೇಂದ್ರ ಮೌಲ್ಯದಿಂದ ಎಷ್ಟು ಬದಲಾಗುತ್ತದೆ ಎಂಬುದರ ಪ್ರಮುಖ ಅಳತೆಗಳಾಗಿವೆ. ಈ ಲೇಖನವು ಅವುಗಳ ಪರಿಕಲ್ಪನೆಗಳು, ಸೂತ್ರಗಳು, ವ್ಯಾಖ್ಯಾನಗಳು ಮತ್ತು ದತ್ತಾಂಶ ವಿಶ್ಲೇಷಣೆಯಲ್ಲಿ ಅವುಗಳ ಅನ್ವಯದ ಉದಾಹರಣೆಗಳನ್ನು ಚರ್ಚಿಸುತ್ತದೆ.
1. ದತ್ತಾಂಶ ಪ್ರಸರಣ ಏಕೆ ಮುಖ್ಯ?
ದತ್ತಾಂಶ ಪ್ರಸರಣವು ಸ್ಥಿರತೆ ಮತ್ತು ಅಪಾಯದ ಬಗ್ಗೆ ಮಾಹಿತಿಯನ್ನು ಒದಗಿಸುತ್ತದೆ. ಉದಾಹರಣೆಗೆ, ಪರೀಕ್ಷಾ ಅಂಕಗಳ ಸಂದರ್ಭದಲ್ಲಿ, A ಮತ್ತು B ತರಗತಿಗಳ ಸರಾಸರಿ 80 ಆಗಿರಬಹುದು. ಆದಾಗ್ಯೂ, ವರ್ಗ A ಯ ಅಂಕಗಳಲ್ಲಿನ ವ್ಯತ್ಯಾಸವು ಚಿಕ್ಕದಾಗಿದ್ದರೆ, ಹೆಚ್ಚಿನ ವಿದ್ಯಾರ್ಥಿಗಳು ಇದೇ ರೀತಿ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತಾರೆ. ಇದಕ್ಕೆ ವಿರುದ್ಧವಾಗಿ, ವರ್ಗ B ಯ ಅಂಕಗಳಲ್ಲಿನ ವ್ಯತ್ಯಾಸವು ದೊಡ್ಡದಾಗಿದ್ದರೆ, ಕೆಲವು ವಿದ್ಯಾರ್ಥಿಗಳು ಅತಿ ಹೆಚ್ಚು ಅಂಕಗಳನ್ನು ಹೊಂದಿರುವ ಮತ್ತು ಇತರರು ತೀರಾ ಕಡಿಮೆ ಅಂಕಗಳನ್ನು ಹೊಂದಿರುವ ಸಾಧ್ಯತೆಯಿದೆ. ವ್ಯವಹಾರದಲ್ಲಿ, ಮಾರಾಟ ದತ್ತಾಂಶದ ಪ್ರಸರಣವು ಆದಾಯದ ಸ್ಥಿರತೆಯನ್ನು ಸೂಚಿಸುತ್ತದೆ; ಹಣಕಾಸಿನಲ್ಲಿ, ಹೂಡಿಕೆ ಆದಾಯದ ಪ್ರಸರಣವು ಅಪಾಯದ ಮಟ್ಟವನ್ನು ಸೂಚಿಸುತ್ತದೆ.
ವ್ಯತ್ಯಾಸ ಮತ್ತು ಪ್ರಮಾಣಿತ ವಿಚಲನವನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳುವ ಮೂಲಕ, ನಿರ್ಧಾರ ತೆಗೆದುಕೊಳ್ಳುವವರು:
– ಒಂದು ಪ್ರಕ್ರಿಯೆಯು ಸ್ಥಿರವಾಗಿದೆಯೇ ಅಥವಾ ಇಲ್ಲವೇ ಎಂಬುದನ್ನು ನಿರ್ಣಯಿಸಿ (ಉದಾ. ಕಾರ್ಖಾನೆ ಉತ್ಪಾದನೆ).
- ಗುಂಪುಗಳ ನಡುವಿನ ಸ್ಥಿರತೆಯನ್ನು ಹೋಲಿಸುವುದು (ಉದಾ. ಎರಡು ಕಲಿಕಾ ವಿಧಾನಗಳು).
- ಪರಿಶೀಲಿಸಲು ಯೋಗ್ಯವಾದ ಹೊರಗಿನ ಡೇಟಾವನ್ನು ಗುರುತಿಸುವುದು.
- ಭವಿಷ್ಯವಾಣಿಗಳು ಮತ್ತು ಮಾದರಿಗಳಲ್ಲಿ ಅನಿಶ್ಚಿತತೆಯನ್ನು ಅಂದಾಜು ಮಾಡುವುದು.
2. ವ್ಯತ್ಯಾಸದ ಮೂಲ ಪರಿಕಲ್ಪನೆ
ವ್ಯತ್ಯಾಸವು ಸರಾಸರಿಯಿಂದ ಪ್ರತಿ ಡೇಟಾ ಸೆಟ್ನ ಸರಾಸರಿ ವರ್ಗ ವಿಚಲನವನ್ನು ಅಳೆಯುತ್ತದೆ. ವಿಚಲನವು ಡೇಟಾ ಮೌಲ್ಯಗಳು ಮತ್ತು ಸರಾಸರಿ ನಡುವಿನ ವ್ಯತ್ಯಾಸವಾಗಿದೆ. ಅನೇಕ ಮೌಲ್ಯಗಳು ಸರಾಸರಿಯಿಂದ ದೂರವಿದ್ದರೆ, ವ್ಯತ್ಯಾಸವು ದೊಡ್ಡದಾಗಿರುತ್ತದೆ. ಮೌಲ್ಯಗಳು ಸರಾಸರಿಗೆ ಹತ್ತಿರದಲ್ಲಿದ್ದರೆ, ವ್ಯತ್ಯಾಸವು ಚಿಕ್ಕದಾಗಿರುತ್ತದೆ.
\(\bar{x}\) ಸರಾಸರಿ ಹೊಂದಿರುವ \(x_1, x_2, …, x_n\) ದತ್ತಾಂಶಗಳಿವೆ ಎಂದು ಭಾವಿಸೋಣ. ಪ್ರತಿಯೊಂದು ದತ್ತಾಂಶದ ವಿಚಲನವು \(x_i – \bar{x}\) ಆಗಿರುತ್ತದೆ. ಆದಾಗ್ಯೂ, ವಿಚಲನಗಳನ್ನು ನೇರವಾಗಿ ಸೇರಿಸಿದರೆ, ಫಲಿತಾಂಶವು ಯಾವಾಗಲೂ ಶೂನ್ಯವಾಗಿರುತ್ತದೆ ಏಕೆಂದರೆ ಪರಸ್ಪರ ರದ್ದುಗೊಳಿಸುವ ಧನಾತ್ಮಕ ಮತ್ತು ಋಣಾತ್ಮಕ ವಿಚಲನಗಳಿವೆ. ಇದನ್ನು ನಿವಾರಿಸಲು, ವಿಚಲನಗಳನ್ನು ವರ್ಗೀಕರಿಸಲಾಗುತ್ತದೆ ಆದ್ದರಿಂದ ಅವೆಲ್ಲವೂ ಧನಾತ್ಮಕವಾಗಿರುತ್ತವೆ. ಇಲ್ಲಿಯೇ ವ್ಯತ್ಯಾಸವು ಹುಟ್ಟುತ್ತದೆ.
a) ಜನಸಂಖ್ಯಾ ವ್ಯತ್ಯಾಸ
ದತ್ತಾಂಶವು ಇಡೀ ಜನಸಂಖ್ಯೆಯನ್ನು ಪ್ರತಿನಿಧಿಸುತ್ತದೆ ಎಂದು ಪರಿಗಣಿಸಿದರೆ, ಜನಸಂಖ್ಯಾ ವ್ಯತ್ಯಾಸವನ್ನು ಹೀಗೆ ಬರೆಯಲಾಗುತ್ತದೆ:
\[
\sigma^2 = \frac{\sum_{i=1}^{N}(x_i – \mu)^2}{N}
\]
ಎಲ್ಲಿ:
– \(N\) ಎಂಬುದು ಜನಸಂಖ್ಯಾ ದತ್ತಾಂಶದ ಸಂಖ್ಯೆ,
– \(\mu\) ಎಂಬುದು ಜನಸಂಖ್ಯಾ ಸರಾಸರಿ,
– \(\sigma^2\) ಎಂಬುದು ಜನಸಂಖ್ಯಾ ವ್ಯತ್ಯಾಸವಾಗಿದೆ.
ಬಿ) ಮಾದರಿ ವ್ಯತ್ಯಾಸ
ದತ್ತಾಂಶವು ದೊಡ್ಡ ಜನಸಂಖ್ಯೆಯಿಂದ ಮಾದರಿಯಾಗಿದ್ದರೆ, ಮಾದರಿ ವ್ಯತ್ಯಾಸವನ್ನು ಬಳಸಲಾಗುತ್ತದೆ:
\[
s^2 = \frac{\sum_{i=1}^{n}(x_i – \bar{x})^2}{n-1}
\]
ಭಾಜಕ \(n-1\) ಅನ್ನು ಬೆಸೆಲ್ ತಿದ್ದುಪಡಿ ಎಂದು ಕರೆಯಲಾಗುತ್ತದೆ ಮತ್ತು ಜನಸಂಖ್ಯೆಯ ವ್ಯತ್ಯಾಸದ ಅಂದಾಜು ಪಕ್ಷಪಾತವಿಲ್ಲದಂತೆ ಖಚಿತಪಡಿಸಿಕೊಳ್ಳಲು ಇದನ್ನು ಬಳಸಲಾಗುತ್ತದೆ. ಮೂಲಭೂತವಾಗಿ, ಮಾದರಿ ಸರಾಸರಿಯನ್ನು ದತ್ತಾಂಶದಿಂದಲೇ ಲೆಕ್ಕಹಾಕಲಾಗುವುದರಿಂದ, "ಸ್ವಾತಂತ್ರ್ಯದ ಡಿಗ್ರಿಗಳ ನಷ್ಟ" ಇರುತ್ತದೆ, ಆದ್ದರಿಂದ ಭಾಜಕವನ್ನು ಅದಕ್ಕೆ ಅನುಗುಣವಾಗಿ ಸರಿಹೊಂದಿಸಲಾಗುತ್ತದೆ.
3. ಪ್ರಮಾಣಿತ ವಿಚಲನ: ಭಿನ್ನತೆಯ ಮೂಲ
ವ್ಯತ್ಯಾಸವು ಒಂದು ಪ್ರಾಯೋಗಿಕ ನ್ಯೂನತೆಯನ್ನು ಹೊಂದಿದೆ: ಅದರ ಘಟಕಗಳು ದತ್ತಾಂಶದ ಘಟಕಗಳ ವರ್ಗವಾಗಿದೆ. ಡೇಟಾ "ರುಪಿಯಾ" ನಲ್ಲಿದ್ದರೆ, ವ್ಯತ್ಯಾಸವು "ರುಪಿಯಾ²" ನಲ್ಲಿರುತ್ತದೆ, ಇದನ್ನು ನೇರವಾಗಿ ಅರ್ಥೈಸುವುದು ಕಷ್ಟ. ಆದ್ದರಿಂದ, ನಾವು ಪ್ರಮಾಣಿತ ವಿಚಲನವನ್ನು ಬಳಸುತ್ತೇವೆ, ಇದು ವ್ಯತ್ಯಾಸದ ವರ್ಗಮೂಲವಾಗಿದೆ.
a) ಜನಸಂಖ್ಯಾ ಪ್ರಮಾಣಿತ ವಿಚಲನ
\[
\sigma = \sqrt{\sigma^2}
\]
ಬಿ) ಮಾದರಿ ಪ್ರಮಾಣಿತ ವಿಚಲನ
\[
s = \sqrt{s^2}
\]
ಪ್ರಮಾಣಿತ ವಿಚಲನವು ಮೂಲ ದತ್ತಾಂಶದಂತೆಯೇ ಅದೇ ಘಟಕಗಳನ್ನು ಹೊಂದಿದ್ದು, ಅದನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳಲು ಸುಲಭವಾಗುತ್ತದೆ. ಹೆಚ್ಚಿನ ಪ್ರಮಾಣಿತ ವಿಚಲನವು ಹೆಚ್ಚು ಹರಡಿರುವ ದತ್ತಾಂಶವನ್ನು ಸೂಚಿಸುತ್ತದೆ; ಕಡಿಮೆ ಪ್ರಮಾಣಿತ ವಿಚಲನವು ಹೆಚ್ಚು ದಟ್ಟವಾದ ದತ್ತಾಂಶ ಗುಂಪನ್ನು ಸೂಚಿಸುತ್ತದೆ.
4. ಸರಳ ಲೆಕ್ಕಾಚಾರದ ಉದಾಹರಣೆ
ಉದಾಹರಣೆಗೆ, ಪರೀಕ್ಷಾ ಅಂಕಗಳ ದತ್ತಾಂಶ: 70, 75, 80, 85, 90.
1) ಸರಾಸರಿಯನ್ನು ಲೆಕ್ಕಹಾಕಿ:
\[
\ಬಾರ್{x} = \frac{70+75+80+85+90}{5} = 80
\]
2) ಸರಾಸರಿಯಿಂದ ಪ್ರತಿ ಮೌಲ್ಯದ ವಿಚಲನವನ್ನು ಲೆಕ್ಕಹಾಕಿ:
– 70: \(70-80=-10\)
– 75: \(75-80=-5\)
– 80: \(80-80=0\)
– 85: \(85-80=5\)
– 90: \(90-80=10\)
3) ವಿಚಲನವನ್ನು ವರ್ಗಗೊಳಿಸಿ:
– 100, 25, 0, 25, 100
4) ಸೇರಿಸಿ:
\[
\ಮೊತ್ತ (x_i-\ಬಾರ್{x})^2 = 250
\]
5) ಮಾದರಿ ವ್ಯತ್ಯಾಸ:
\[
s^2 = \frac{250}{5-1} = 62.5
\]
6) ಮಾದರಿ ಪ್ರಮಾಣಿತ ವಿಚಲನ:
\[
s = \sqrt{62.5} \ಸುಮಾರು 7.91
\]
ವ್ಯಾಖ್ಯಾನ: ಸರಾಸರಿ ಅಂಕ 80, ಮತ್ತು "ಸಾಮಾನ್ಯವಾಗಿ" ಅಂಕಗಳು ಸರಾಸರಿಗಿಂತ ಸುಮಾರು 7–8 ಅಂಕಗಳಿಂದ ವ್ಯತ್ಯಾಸಗೊಳ್ಳುತ್ತವೆ.
5. ವ್ಯತ್ಯಾಸ ಮತ್ತು ಪ್ರಮಾಣಿತ ವಿಚಲನದ ವ್ಯಾಖ್ಯಾನ
ವ್ಯತ್ಯಾಸ ಮತ್ತು ಪ್ರಮಾಣಿತ ವಿಚಲನವು ಕೇವಲ ಸಂಖ್ಯೆಗಳಲ್ಲ; ಅವುಗಳನ್ನು ಸಂದರ್ಭಕ್ಕೆ ತಕ್ಕಂತೆ ಅರ್ಥೈಸಿಕೊಳ್ಳಬೇಕು.
– ಸಣ್ಣ ಪ್ರಮಾಣಿತ ವಿಚಲನ: ಹೆಚ್ಚಿನ ಸ್ಥಿರತೆ. ಉದಾಹರಣೆಗೆ, ಉತ್ಪನ್ನದ ಗಾತ್ರದಲ್ಲಿ ಬಹಳ ಕಡಿಮೆ ಪ್ರಮಾಣಿತ ವಿಚಲನವನ್ನು ಹೊಂದಿರುವ ಉತ್ಪಾದನಾ ಪ್ರಕ್ರಿಯೆಯು ಸ್ಥಿರ ಗುಣಮಟ್ಟವನ್ನು ಸೂಚಿಸುತ್ತದೆ.
– ದೊಡ್ಡ ಪ್ರಮಾಣಿತ ವಿಚಲನ: ಹೆಚ್ಚಿನ ವ್ಯತ್ಯಾಸ. ಹೂಡಿಕೆಯಲ್ಲಿ, ಆದಾಯದ ಹೆಚ್ಚಿನ ಪ್ರಮಾಣಿತ ವಿಚಲನ ಎಂದರೆ ಹೆಚ್ಚಿನ ಚಂಚಲತೆ (ಹೆಚ್ಚಿನ ಅಪಾಯ).
– ಗುಂಪುಗಳ ನಡುವಿನ ಹೋಲಿಕೆ: ಎರಡು ಗುಂಪುಗಳು ಒಂದೇ ಸರಾಸರಿಯನ್ನು ಹೊಂದಿದ್ದರೂ ವಿಭಿನ್ನ ಪ್ರಮಾಣಿತ ವಿಚಲನಗಳನ್ನು ಹೊಂದಿದ್ದರೆ, ಸಣ್ಣ ವಿಚಲನವನ್ನು ಹೊಂದಿರುವ ಗುಂಪು ಹೆಚ್ಚು ಏಕರೂಪವಾಗಿರುತ್ತದೆ.
ಆದಾಗ್ಯೂ, ಪ್ರಮಾಣಿತ ವಿಚಲನವು ಹೊರಗಿನವುಗಳಿಗೆ ಸೂಕ್ಷ್ಮವಾಗಿರುತ್ತದೆ ಎಂಬುದನ್ನು ನೆನಪಿಟ್ಟುಕೊಳ್ಳುವುದು ಮುಖ್ಯ. ಒಂದೇ ತೀವ್ರ ಮೌಲ್ಯವು ವ್ಯತ್ಯಾಸ ಮತ್ತು ಪ್ರಮಾಣಿತ ವಿಚಲನವನ್ನು ಗಮನಾರ್ಹವಾಗಿ ಹೆಚ್ಚಿಸುತ್ತದೆ. ಆದ್ದರಿಂದ, ವಿತರಣಾ ವಿಶ್ಲೇಷಣೆಯು ಹೆಚ್ಚಾಗಿ ದೃಶ್ಯೀಕರಣಗಳು (ಹಿಸ್ಟೋಗ್ರಾಮ್ಗಳು, ಬಾಕ್ಸ್ಪ್ಲಾಟ್ಗಳು) ಅಥವಾ IQR (ಇಂಟರ್ಕ್ವಾರ್ಟೈಲ್ ಶ್ರೇಣಿ) ನಂತಹ ದೃಢವಾದ ಅಳತೆಗಳಿಂದ ಪೂರಕವಾಗಿರುತ್ತದೆ.
6. ಸಾಮಾನ್ಯ ವಿತರಣೆ ಮತ್ತು ಪ್ರಾಯೋಗಿಕ ನಿಯಮಗಳೊಂದಿಗೆ ಸಂಬಂಧ
ಸಾಮಾನ್ಯ ವಿತರಣೆಯಲ್ಲಿ (ಬೆಲ್ ಕರ್ವ್), ಪ್ರಮಾಣಿತ ವಿಚಲನವು ಬಹಳ ಬಲವಾದ ಅರ್ಥವನ್ನು ಹೊಂದಿದೆ. ಸಾಮಾನ್ಯವಾಗಿ ಬಳಸಲಾಗುವ ಒಂದು ಪ್ರಾಯೋಗಿಕ ನಿಯಮವಿದೆ:
– ಸುಮಾರು 68% ಡೇಟಾ \(\bar{x} \pm 1s\) ವ್ಯಾಪ್ತಿಯಲ್ಲಿದೆ.
– ಸುಮಾರು 95% ಡೇಟಾ \(\bar{x} \pm 2s\) ವ್ಯಾಪ್ತಿಯಲ್ಲಿದೆ.
– ಸುಮಾರು 99,7% ಡೇಟಾ \(\bar{x} \pm 3s\) ವ್ಯಾಪ್ತಿಯಲ್ಲಿದೆ.
ಈ ನಿಯಮವು ತ್ವರಿತ ವ್ಯಾಖ್ಯಾನಗಳನ್ನು ಮಾಡಲು ಸಹಾಯ ಮಾಡುತ್ತದೆ, ಉದಾಹರಣೆಗೆ ಒಂದು ಮೌಲ್ಯವು "ಅಸ್ವಾಭಾವಿಕ" ಅಥವಾ ಇನ್ನೂ ಸಾಮಾನ್ಯ ವ್ಯಾಪ್ತಿಯಲ್ಲಿದೆಯೇ ಎಂದು ನಿರ್ಣಯಿಸುವುದು.
7. ವಿವಿಧ ಕ್ಷೇತ್ರಗಳಲ್ಲಿನ ಅನ್ವಯಗಳು
1) ಶಿಕ್ಷಣ: ವಿದ್ಯಾರ್ಥಿಗಳ ಶ್ರೇಣಿಗಳ ವಿತರಣೆಯನ್ನು ಮೇಲ್ವಿಚಾರಣೆ ಮಾಡುವುದು. ಸಣ್ಣ ವಿಚಲನಗಳು ಸಮಾನ ಕಲಿಕೆಯ ಫಲಿತಾಂಶಗಳನ್ನು ಸೂಚಿಸುತ್ತವೆ, ಆದರೆ ದೊಡ್ಡ ವಿಚಲನಗಳು ತಿಳುವಳಿಕೆಯಲ್ಲಿನ ಅಂತರವನ್ನು ಸೂಚಿಸಬಹುದು.
2) ಕೈಗಾರಿಕೆ: ಗುಣಮಟ್ಟ ನಿಯಂತ್ರಣ. ಉತ್ಪಾದನಾ ಸ್ಥಿರತೆಯನ್ನು ಮೌಲ್ಯಮಾಪನ ಮಾಡಲು ವ್ಯತ್ಯಾಸವನ್ನು ಬಳಸಲಾಗುತ್ತದೆ.
3) ಹಣಕಾಸು: ಷೇರು ಬೆಲೆಯ ಏರಿಳಿತ, ಬಂಡವಾಳ ಹೂಡಿಕೆಯ ಆದಾಯ ಮತ್ತು ಹೂಡಿಕೆಯ ಅಪಾಯವನ್ನು ಅಳೆಯುತ್ತದೆ.
4) ಆರೋಗ್ಯ: ರೋಗಿಯ ಜನಸಂಖ್ಯೆಯಲ್ಲಿ ರಕ್ತದೊತ್ತಡ, ಸಕ್ಕರೆ ಮಟ್ಟಗಳು ಅಥವಾ ಇತರ ವೈದ್ಯಕೀಯ ಸೂಚಕಗಳಲ್ಲಿನ ವ್ಯತ್ಯಾಸಗಳನ್ನು ಗಮನಿಸುವುದು.
5) ಸಾಮಾಜಿಕ ಸಂಶೋಧನೆ: ಸಮೀಕ್ಷೆಯ ಪ್ರತಿಕ್ರಿಯೆಗಳ ವೈವಿಧ್ಯತೆ ಮತ್ತು ಪ್ರತಿಕ್ರಿಯಿಸುವವರ ಗುಣಲಕ್ಷಣಗಳ ವೈವಿಧ್ಯತೆಯನ್ನು ನಿರ್ಣಯಿಸುವುದು.
8. ಸಾಮಾನ್ಯ ತಪ್ಪುಗಳು ಮತ್ತು ಪ್ರಾಯೋಗಿಕ ಸಲಹೆಗಳು
ಕೆಲವು ಸಾಮಾನ್ಯ ತಪ್ಪುಗಳು:
– ದತ್ತಾಂಶವು ಪೂರ್ಣ ಜನಸಂಖ್ಯೆಯಾಗಿದ್ದರೂ ಮಾದರಿ ವ್ಯತ್ಯಾಸವನ್ನು (ಭಾಜಕ \(n-1\)) ಬಳಸುವುದು, ಅಥವಾ ಪ್ರತಿಯಾಗಿ.
– ವ್ಯತ್ಯಾಸವನ್ನು ಅದರ ವರ್ಗ ಘಟಕಗಳನ್ನು ಪರಿಗಣಿಸದೆ ಅರ್ಥೈಸಿಕೊಳ್ಳಿ; ವ್ಯಾಖ್ಯಾನಕ್ಕಾಗಿ ಪ್ರಮಾಣಿತ ವಿಚಲನವನ್ನು ಬಳಸುವುದು ಸುರಕ್ಷಿತವಾಗಿದೆ.
- ಹೊರಗಿನವರನ್ನು ನಿರ್ಲಕ್ಷಿಸಿ; ಮೊದಲು ಡೇಟಾವನ್ನು ಪರಿಶೀಲಿಸುವುದು ಉತ್ತಮ.
– ಸಾಮಾನ್ಯೀಕರಣವಿಲ್ಲದೆ ವಿಭಿನ್ನ ಮಾಪಕಗಳೊಂದಿಗೆ ಡೇಟಾದ ನಡುವಿನ ಪ್ರಮಾಣಿತ ವಿಚಲನಗಳನ್ನು ಹೋಲಿಕೆ ಮಾಡಿ; ಕೆಲವು ಸಂದರ್ಭಗಳಲ್ಲಿ, ಉತ್ತಮ ಹೋಲಿಕೆಗಾಗಿ ವ್ಯತ್ಯಾಸದ ಗುಣಾಂಕ (CV) ಅಂದರೆ \(CV = \frac{s}{\bar{x}}\times 100\%\) ಬಳಸಿ.
ಪೆನುಟಪ್
ದತ್ತಾಂಶ ವಿತರಣೆಯನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳಲು ವ್ಯತ್ಯಾಸ ಮತ್ತು ಪ್ರಮಾಣಿತ ವಿಚಲನವು ಮೂಲಭೂತ ಸಾಧನಗಳಾಗಿವೆ. ವ್ಯತ್ಯಾಸವು ಬಲವಾದ ಗಣಿತದ ಅಡಿಪಾಯವನ್ನು ಒದಗಿಸುತ್ತದೆ, ಆದರೆ ಪ್ರಮಾಣಿತ ವಿಚಲನವು ಮೂಲ ದತ್ತಾಂಶಕ್ಕೆ ಹೋಲುವುದರಿಂದ ಅರ್ಥೈಸಲು ಸುಲಭವಾದ ಅಳತೆಯನ್ನು ಒದಗಿಸುತ್ತದೆ. ಈ ಎರಡು ಅಳತೆಗಳನ್ನು ಬಳಸುವುದರ ಮೂಲಕ, ದತ್ತಾಂಶ ಸೆಟ್ಗಳ ನಡುವಿನ ವಿತರಣಾ ಗುಣಲಕ್ಷಣಗಳಲ್ಲಿನ ಸ್ಥಿರತೆ, ಅಪಾಯ ಮತ್ತು ವ್ಯತ್ಯಾಸಗಳನ್ನು ನಾವು ಹೆಚ್ಚು ಸ್ಪಷ್ಟವಾಗಿ ನಿರ್ಣಯಿಸಬಹುದು. ದತ್ತಾಂಶ ವಿಶ್ಲೇಷಣಾ ಅಭ್ಯಾಸದಲ್ಲಿ, ದತ್ತಾಂಶದ ಸಂಪೂರ್ಣ ಚಿತ್ರವನ್ನು ಒದಗಿಸಲು ಮತ್ತು ಹೆಚ್ಚು ಮಾಹಿತಿಯುಕ್ತ ನಿರ್ಧಾರಗಳನ್ನು ತೆಗೆದುಕೊಳ್ಳಲು ಕೇಂದ್ರ ಪ್ರವೃತ್ತಿ ಮತ್ತು ದೃಶ್ಯೀಕರಣದ ಅಳತೆಗಳೊಂದಿಗೆ ವ್ಯತ್ಯಾಸ ಮತ್ತು ಪ್ರಮಾಣಿತ ವಿಚಲನವನ್ನು ಉತ್ತಮವಾಗಿ ಬಳಸಲಾಗುತ್ತದೆ.
ನೀವು ಬಯಸಿದರೆ, ನಾನು ಹೆಚ್ಚು ಸಂಕೀರ್ಣವಾದ ಲೆಕ್ಕಾಚಾರದ ಉದಾಹರಣೆಗಳನ್ನು (ಉದಾ. ಗುಂಪು ಮಾಡಿದ ಡೇಟಾ) ಸೇರಿಸಬಹುದು, ಅಥವಾ z-ಸ್ಕೋರ್ ಮತ್ತು ಹೊರಗಿನ ಪತ್ತೆಯೊಂದಿಗೆ ಪ್ರಮಾಣಿತ ವಿಚಲನದ ಸಂಬಂಧವನ್ನು ವಿವರಿಸಬಹುದು.