ದತ್ತಾಂಶ ವಿಶ್ಲೇಷಣೆಯಲ್ಲಿ ವಿವರಣಾತ್ಮಕ ಅಂಕಿಅಂಶಗಳ ತಿಳುವಳಿಕೆ ಮತ್ತು ಮೂಲ ಪರಿಕಲ್ಪನೆಗಳು
ವಿವರಣಾತ್ಮಕ ಅಂಕಿಅಂಶಗಳು ದತ್ತಾಂಶ ವಿಶ್ಲೇಷಣಾ ಪ್ರಕ್ರಿಯೆಯಲ್ಲಿ ಪ್ರಮುಖ ಅಡಿಪಾಯಗಳಲ್ಲಿ ಒಂದಾಗಿದೆ. ಯಾರಾದರೂ ತೀರ್ಮಾನಗಳನ್ನು ತೆಗೆದುಕೊಳ್ಳುವ ಮೊದಲು, ಭವಿಷ್ಯ ನುಡಿಯುವ ಮೊದಲು ಅಥವಾ ದತ್ತಾಂಶವನ್ನು ಆಧರಿಸಿ ನಿರ್ಧಾರಗಳನ್ನು ತೆಗೆದುಕೊಳ್ಳುವ ಮೊದಲು, ಮೊದಲ ಹೆಜ್ಜೆ ಯಾವಾಗಲೂ "ಡೇಟಾವನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳುವುದು". ಇಲ್ಲಿ ವಿವರಣಾತ್ಮಕ ಅಂಕಿಅಂಶಗಳು ಕಾರ್ಯರೂಪಕ್ಕೆ ಬರುತ್ತವೆ: ದತ್ತಾಂಶವನ್ನು ಸಂಕ್ಷೇಪಿಸಲು, ಸಂಘಟಿಸಲು ಮತ್ತು ಪ್ರಸ್ತುತಪಡಿಸಲು ಸಹಾಯ ಮಾಡುತ್ತದೆ ಇದರಿಂದ ಅದರ ಮಾದರಿಗಳು, ಗುಣಲಕ್ಷಣಗಳು ಮತ್ತು ಪ್ರವೃತ್ತಿಗಳು ಸ್ಪಷ್ಟವಾಗಿ ಕಂಡುಬರುತ್ತವೆ. ಈ ಲೇಖನವು ವಿವರಣಾತ್ಮಕ ಅಂಕಿಅಂಶಗಳ ವ್ಯಾಖ್ಯಾನ ಮತ್ತು ದತ್ತಾಂಶ ವಿಶ್ಲೇಷಣೆಯಲ್ಲಿ ವ್ಯಾಪಕವಾಗಿ ಬಳಸಲಾಗುವ ಅದರ ಮೂಲ ಪರಿಕಲ್ಪನೆಗಳನ್ನು ಚರ್ಚಿಸುತ್ತದೆ.
ವಿವರಣಾತ್ಮಕ ಅಂಕಿಅಂಶಗಳನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳುವುದು
ಸಾಮಾನ್ಯವಾಗಿ, ವಿವರಣಾತ್ಮಕ ಅಂಕಿಅಂಶಗಳು ಅಂಕಿಅಂಶಗಳ ಒಂದು ಶಾಖೆಯಾಗಿದ್ದು, ಅದು ಅದರ ಸ್ಥಿತಿಯ ಸ್ಪಷ್ಟ ಚಿತ್ರಣವನ್ನು ಒದಗಿಸಲು ಡೇಟಾವನ್ನು ಸಂಗ್ರಹಿಸುವುದು, ಸಂಕ್ಷೇಪಿಸುವುದು, ಸಂಘಟಿಸುವುದು ಮತ್ತು ಪ್ರಸ್ತುತಪಡಿಸುವುದರ ಮೇಲೆ ಕೇಂದ್ರೀಕರಿಸುತ್ತದೆ. ಇದರ ಪ್ರಾಥಮಿಕ ಗುರಿ ಊಹೆಗಳನ್ನು ಪರೀಕ್ಷಿಸುವುದು ಅಥವಾ ವಿಶಾಲ ಜನಸಂಖ್ಯೆಗೆ (ಅದು ತಾರ್ಕಿಕ ಅಂಕಿಅಂಶಗಳ ಕ್ಷೇತ್ರ) ಸಾಮಾನ್ಯೀಕರಿಸುವುದು ಅಲ್ಲ, ಬದಲಿಗೆ ಕೈಯಲ್ಲಿರುವ ಡೇಟಾದಲ್ಲಿ ಏನಾಗುತ್ತದೆ ಎಂಬುದನ್ನು ವಿವರಿಸುವುದು.
ಉದಾಹರಣೆಗೆ, ಒಂದು ಶಾಲೆಯು 200 ವಿದ್ಯಾರ್ಥಿಗಳಿಂದ ಗಣಿತ ಪರೀಕ್ಷೆಯ ಅಂಕಗಳನ್ನು ಸಂಗ್ರಹಿಸಿದರೆ, ವಿವರಣಾತ್ಮಕ ಅಂಕಿಅಂಶಗಳನ್ನು ಬಳಸಿಕೊಂಡು ಈ ಕೆಳಗಿನ ಪ್ರಶ್ನೆಗಳಿಗೆ ಉತ್ತರಿಸಬಹುದು: ಸರಾಸರಿ ಅಂಕ ಎಷ್ಟು? ಅಂಕಗಳಲ್ಲಿ ಎಷ್ಟು ವ್ಯತ್ಯಾಸವಿದೆ? ಅತ್ಯಧಿಕ ಮತ್ತು ಕಡಿಮೆ ಅಂಕಗಳು ಯಾವುವು? ಹೆಚ್ಚಿನ ಅಂಕಗಳು ಒಂದು ನಿರ್ದಿಷ್ಟ ವ್ಯಾಪ್ತಿಯಲ್ಲಿ ಗುಂಪು ಮಾಡಲಾಗಿದೆಯೇ? ಇತರ ಶಾಲೆಗಳಲ್ಲಿನ ವಿದ್ಯಾರ್ಥಿಗಳ ಬಗ್ಗೆ ತೀರ್ಮಾನಗಳನ್ನು ತೆಗೆದುಕೊಳ್ಳದೆಯೇ, ಮೌಲ್ಯಮಾಪನಕ್ಕೆ ಆಧಾರವಾಗಿ ಈ ಪ್ರಶ್ನೆಗಳು ಮುಖ್ಯವಾಗಿವೆ.
ದತ್ತಾಂಶ ವಿಶ್ಲೇಷಣೆಯಲ್ಲಿ ವಿವರಣಾತ್ಮಕ ಅಂಕಿಅಂಶಗಳ ಪಾತ್ರ
ದತ್ತಾಂಶ ವಿಶ್ಲೇಷಣಾ ಪದ್ಧತಿಯಲ್ಲಿ, ವಿವರಣಾತ್ಮಕ ಅಂಕಿಅಂಶಗಳು ಸಾಮಾನ್ಯವಾಗಿ ನಂತರದ ವಿಶ್ಲೇಷಣೆಯ ದಿಕ್ಕನ್ನು ನಿರ್ಧರಿಸುವ ಆರಂಭಿಕ ಹಂತವಾಗಿದೆ. ಇದರ ಪಾತ್ರಗಳು:
1. ಕಚ್ಚಾ ಡೇಟಾವನ್ನು ಹೆಚ್ಚು ಸಂಕ್ಷಿಪ್ತ ಮತ್ತು ಅರ್ಥಮಾಡಿಕೊಳ್ಳಲು ಸುಲಭವಾದ ರೂಪದಲ್ಲಿ ಸಂಕ್ಷೇಪಿಸಿ.
2. ಪ್ರವೃತ್ತಿಗಳು, ಪ್ರಬಲ ದತ್ತಾಂಶ ಗುಂಪುಗಳು ಅಥವಾ ವೈಪರೀತ್ಯಗಳಂತಹ ಮಾದರಿಗಳನ್ನು ಗುರುತಿಸಿ.
3. ಅವಿವೇಕದ ಮೌಲ್ಯಗಳು, ಕಾಣೆಯಾದ ಡೇಟಾ ಅಥವಾ ನಕಲು ಮುಂತಾದ ಡೇಟಾ ದೋಷಗಳನ್ನು ಪತ್ತೆ ಮಾಡಿ.
4. ಕೋಷ್ಟಕಗಳು, ಗ್ರಾಫ್ಗಳು ಮತ್ತು ಅಂಕಿಅಂಶಗಳ ಸಾರಾಂಶಗಳ ಮೂಲಕ ಮಾಹಿತಿಯನ್ನು ಸಂವಹನಾತ್ಮಕವಾಗಿ ಪ್ರಸ್ತುತಪಡಿಸಿ.
5. ಗ್ರಾಹಕರ ಡೇಟಾ ಸಾರಾಂಶಗಳ ಆಧಾರದ ಮೇಲೆ ಮಾರ್ಕೆಟಿಂಗ್ ತಂತ್ರಗಳನ್ನು ನಿರ್ಧರಿಸುವಂತಹ ಆರಂಭಿಕ ನಿರ್ಧಾರ ತೆಗೆದುಕೊಳ್ಳುವಿಕೆಯನ್ನು ಬೆಂಬಲಿಸುತ್ತದೆ.
ವಿವರಣಾತ್ಮಕ ಹಂತಗಳಿಲ್ಲದೆ, ದತ್ತಾಂಶವು ಸಂಪೂರ್ಣವಾಗಿ ಅರ್ಥವಾಗದ ಕಾರಣ ಮುಂದಿನ ವಿಶ್ಲೇಷಣೆಯು ತಪ್ಪಾಗಿರಬಹುದು.
ಡೇಟಾ ಪ್ರಕಾರಗಳು ಮತ್ತು ಅಳತೆ ಮಾಪಕಗಳು
ವಿವರಣಾತ್ಮಕ ಅಂಕಿಅಂಶಗಳ ಮೂಲ ಪರಿಕಲ್ಪನೆಯನ್ನು ದತ್ತಾಂಶ ಪ್ರಕಾರಗಳು ಮತ್ತು ಅಳತೆ ಮಾಪಕಗಳ ತಿಳುವಳಿಕೆಯಿಂದ ಬೇರ್ಪಡಿಸಲು ಸಾಧ್ಯವಿಲ್ಲ, ಏಕೆಂದರೆ ಎರಡೂ ಸೂಕ್ತವಾದ ಸಾರಾಂಶ ವಿಧಾನವನ್ನು ನಿರ್ಧರಿಸುತ್ತವೆ.
1. ಗುಣಾತ್ಮಕ ಮತ್ತು ಪರಿಮಾಣಾತ್ಮಕ ದತ್ತಾಂಶ
– ಗುಣಾತ್ಮಕ ದತ್ತಾಂಶ (ವರ್ಗಗಳು): ವರ್ಗಗಳು ಅಥವಾ ಲೇಬಲ್ಗಳ ರೂಪದಲ್ಲಿ ದತ್ತಾಂಶ, ಉದಾಹರಣೆಗೆ ಲಿಂಗ, ಉದ್ಯೋಗ ಸ್ಥಿತಿ, ಉತ್ಪನ್ನ ವರ್ಗ.
– ಪರಿಮಾಣಾತ್ಮಕ (ಸಂಖ್ಯಾತ್ಮಕ) ದತ್ತಾಂಶ: ವಯಸ್ಸು, ಆದಾಯ, ಎತ್ತರ ಮುಂತಾದ ಎಣಿಸಬಹುದಾದ ಅಥವಾ ಅಳೆಯಬಹುದಾದ ಸಂಖ್ಯೆಗಳ ರೂಪದಲ್ಲಿ ದತ್ತಾಂಶ.
2. ಮಾಪನ ಮಾಪಕ
– ನಾಮಮಾತ್ರ: ವರ್ಗಗಳನ್ನು ಮಾತ್ರ ಪ್ರತ್ಯೇಕಿಸುತ್ತದೆ (ಉದಾಹರಣೆ: ರಕ್ತದ ಪ್ರಕಾರ).
– ಸಾಮಾನ್ಯ: ಒಂದು ಅನುಕ್ರಮವಿದೆ, ಆದರೆ ವರ್ಗಗಳ ನಡುವಿನ ಅಂತರವು ಅನಿಶ್ಚಿತವಾಗಿದೆ (ಉದಾಹರಣೆ: ತೃಪ್ತಿ ಮಟ್ಟ: ಕಡಿಮೆ–ಮಧ್ಯಮ–ಹೆಚ್ಚು).
– ಮಧ್ಯಂತರ: ಮೌಲ್ಯಗಳ ನಡುವಿನ ಅಂತರವು ಒಂದೇ ಆಗಿರುತ್ತದೆ, ಆದರೆ ಸಂಪೂರ್ಣ ಶೂನ್ಯವನ್ನು ಹೊಂದಿಲ್ಲ (ಉದಾಹರಣೆ: ಸೆಲ್ಸಿಯಸ್ ತಾಪಮಾನ).
– ಅನುಪಾತ: ದೂರವು ಒಂದೇ ಆಗಿರುತ್ತದೆ ಮತ್ತು ಸಂಪೂರ್ಣ ಶೂನ್ಯವನ್ನು ಹೊಂದಿರುತ್ತದೆ (ಉದಾಹರಣೆ: ದೇಹದ ತೂಕ, ಆದಾಯ).
ಕೇಂದ್ರ ಪ್ರವೃತ್ತಿ, ಪ್ರಸರಣದ ಅಳತೆಗಳು ಮತ್ತು ದೃಶ್ಯೀಕರಣಗಳ ಸೂಕ್ತ ಅಳತೆಗಳನ್ನು ಆಯ್ಕೆ ಮಾಡಲು ದತ್ತಾಂಶದ ಪ್ರಮಾಣವನ್ನು ನಿರ್ಧರಿಸುವುದು ಮುಖ್ಯವಾಗಿದೆ.
ಡೇಟಾ ಪ್ರಸ್ತುತಿ: ಕೋಷ್ಟಕಗಳು ಮತ್ತು ಗ್ರಾಫ್ಗಳು
ವಿವರಣಾತ್ಮಕ ಅಂಕಿಅಂಶಗಳು ಹೆಚ್ಚಾಗಿ ದತ್ತಾಂಶವನ್ನು ಪ್ರಸ್ತುತಪಡಿಸುವುದರೊಂದಿಗೆ ಸಂಬಂಧ ಹೊಂದಿವೆ, ಆದ್ದರಿಂದ ಅದನ್ನು ಓದಲು ಮತ್ತು ಅರ್ಥೈಸಲು ಸುಲಭವಾಗುತ್ತದೆ.
1. ಆವರ್ತನ ವಿತರಣಾ ಕೋಷ್ಟಕ
ಆವರ್ತನ ವಿತರಣಾ ಕೋಷ್ಟಕವು ಒಂದು ಮೌಲ್ಯ ಅಥವಾ ವರ್ಗ ಎಷ್ಟು ಬಾರಿ ಸಂಭವಿಸುತ್ತದೆ ಎಂಬುದನ್ನು ತೋರಿಸುತ್ತದೆ. ಇದು ದೊಡ್ಡ ಡೇಟಾ ಸೆಟ್ಗಳಿಗೆ ಉಪಯುಕ್ತವಾಗಿದೆ, ಇದು ಸಂಕ್ಷಿಪ್ತತೆಯನ್ನು ಅನುಮತಿಸುತ್ತದೆ. ಸಂಖ್ಯಾತ್ಮಕ ಡೇಟಾಕ್ಕಾಗಿ, ಆವರ್ತನಗಳನ್ನು ಹೆಚ್ಚಾಗಿ ವರ್ಗ ಮಧ್ಯಂತರಗಳಲ್ಲಿ ಜೋಡಿಸಲಾಗುತ್ತದೆ (ಉದಾ., 0–10, 11–20, ಮತ್ತು ಹೀಗೆ).
2. ಗ್ರಾಫ್ಗಳು ಮತ್ತು ರೇಖಾಚಿತ್ರಗಳು
ದೃಶ್ಯೀಕರಣದ ಕೆಲವು ಸಾಮಾನ್ಯ ರೂಪಗಳು:
– ಬಾರ್ ಚಾರ್ಟ್: ವರ್ಗೀಯ ದತ್ತಾಂಶಕ್ಕೆ ಸೂಕ್ತವಾಗಿದೆ.
– ಪೈ ಚಾರ್ಟ್: ಪ್ರತಿಯೊಂದು ವರ್ಗದ ಅನುಪಾತವನ್ನು ತೋರಿಸುತ್ತದೆ (ಆದಾಗ್ಯೂ ಅನೇಕ ವರ್ಗಗಳಿಗೆ ಇದು ಸಾಮಾನ್ಯವಾಗಿ ಕಡಿಮೆ ಪರಿಣಾಮಕಾರಿಯಾಗಿದೆ).
– ಹಿಸ್ಟೋಗ್ರಾಮ್: ಬಾರ್ ಚಾರ್ಟ್ ಅನ್ನು ಹೋಲುತ್ತದೆ ಆದರೆ ಗುಂಪು ಮಾಡಿದ ಸಂಖ್ಯಾತ್ಮಕ ದತ್ತಾಂಶಕ್ಕಾಗಿ; ವಿತರಣೆಯ ಆಕಾರವನ್ನು ನೋಡಲು ಸಹಾಯ ಮಾಡುತ್ತದೆ.
– ಆವರ್ತನ ಬಹುಭುಜಾಕೃತಿ: ಪ್ರತಿ ವರ್ಗದ ಆವರ್ತನ ಬಿಂದುಗಳನ್ನು ಸಂಪರ್ಕಿಸುವ ರೇಖೆ.
– ಬಾಕ್ಸ್ಪ್ಲಾಟ್ (ಬಾಕ್ಸ್ ರೇಖಾಚಿತ್ರ): ಮಧ್ಯಮ, ಕ್ವಾರ್ಟೈಲ್ಗಳು, ವಿತರಣೆ ಮತ್ತು ಸಂಭಾವ್ಯ ಹೊರವಲಯಗಳನ್ನು ಪ್ರದರ್ಶಿಸುತ್ತದೆ.
ದೃಶ್ಯೀಕರಣವು ಡೇಟಾದಲ್ಲಿನ ಪ್ರವೃತ್ತಿಗಳು ಅಥವಾ ವೈಪರೀತ್ಯಗಳನ್ನು ನೋಡಲು ಸಹಾಯ ಮಾಡುತ್ತದೆ, ಆದರೆ ಕೆಲವೊಮ್ಮೆ ಸಂಖ್ಯೆಗಳನ್ನು ನೋಡಿದರೆ ಅವು ಸ್ಪಷ್ಟವಾಗಿಲ್ಲ.
ಕೇಂದ್ರ ಪ್ರವೃತ್ತಿಯ ಕ್ರಮಗಳು
ಕೇಂದ್ರ ಪ್ರವೃತ್ತಿಯ ಅಳತೆಗಳು "ಮಧ್ಯಮ" ಮೌಲ್ಯ ಅಥವಾ ಡೇಟಾ ಸೆಟ್ ಅನ್ನು ಉತ್ತಮವಾಗಿ ಪ್ರತಿನಿಧಿಸುವ ಮೌಲ್ಯವನ್ನು ವಿವರಿಸುತ್ತದೆ.
1. ಸರಾಸರಿ (ಸರಾಸರಿ)
ಸರಾಸರಿ ಎಂದರೆ ಎಲ್ಲಾ ಮೌಲ್ಯಗಳ ಮೊತ್ತವನ್ನು ದತ್ತಾಂಶ ಬಿಂದುಗಳ ಸಂಖ್ಯೆಯಿಂದ ಭಾಗಿಸಿದಾಗ ಬರುವ ಮೊತ್ತ. ಸರಾಸರಿ ಜನಪ್ರಿಯವಾಗಿದೆ ಏಕೆಂದರೆ ಅದು ಅರ್ಥಮಾಡಿಕೊಳ್ಳುವುದು ಸುಲಭ, ಆದರೆ ಅದು ಹೊರಗಿನವರಿಗೆ ಸೂಕ್ಷ್ಮವಾಗಿರುತ್ತದೆ. ಉದಾಹರಣೆಗೆ, ಆದಾಯದ ದತ್ತಾಂಶದಲ್ಲಿ, ಒಬ್ಬ ಶ್ರೀಮಂತ ವ್ಯಕ್ತಿ ಸರಾಸರಿಯನ್ನು ಗಮನಾರ್ಹವಾಗಿ ತಿರುಚಬಹುದು.
2. ಸರಾಸರಿ (ಮಧ್ಯಮ ಮೌಲ್ಯ)
ದತ್ತಾಂಶವನ್ನು ವಿಂಗಡಿಸಿದ ನಂತರ ಮಧ್ಯಾಂಕವು ಮಧ್ಯಾಂಕದ ಮೌಲ್ಯವಾಗಿದೆ. ದತ್ತಾಂಶ ಬಿಂದುಗಳ ಸಂಖ್ಯೆ ಸಮವಾಗಿದ್ದರೆ, ಮಧ್ಯಾಂಕವು ಎರಡು ಮಧ್ಯಾಂಕದ ಮೌಲ್ಯಗಳ ಸರಾಸರಿಯಾಗಿದೆ. ಮಧ್ಯಾಂಕವು ಹೊರಗಿನವುಗಳಿಗೆ ಹೆಚ್ಚು ನಿರೋಧಕವಾಗಿರುತ್ತದೆ, ಆದ್ದರಿಂದ ಇದನ್ನು ಹೆಚ್ಚಾಗಿ ಅಸಮ್ಮಿತ ವಿತರಣೆಗಳನ್ನು ಹೊಂದಿರುವ ದತ್ತಾಂಶಗಳಿಗೆ ಬಳಸಲಾಗುತ್ತದೆ.
3. ಮೋಡ್ (ಹೆಚ್ಚಾಗಿ ಕಾಣಿಸಿಕೊಳ್ಳುವ ಮೌಲ್ಯ)
ಈ ಮೋಡ್ ಅತ್ಯಂತ ಆಗಾಗ್ಗೆ ಸಂಭವಿಸುವ ಮೌಲ್ಯವಾಗಿದ್ದು, ವರ್ಗೀಕೃತ ದತ್ತಾಂಶಕ್ಕೆ ಉಪಯುಕ್ತವಾಗಿದೆ. ಉದಾಹರಣೆಗೆ, ಹೆಚ್ಚಾಗಿ ಖರೀದಿಸಲಾದ ಉತ್ಪನ್ನ ಪ್ರಕಾರಗಳ ಮೋಡ್ ಪ್ರಾಥಮಿಕ ಆದ್ಯತೆಯನ್ನು ಸೂಚಿಸುತ್ತದೆ.
ಪ್ರಸರಣದ ಅಳತೆಗಳು
ಕೇಂದ್ರ ಮೌಲ್ಯವನ್ನು ತಿಳಿದುಕೊಳ್ಳುವುದರ ಜೊತೆಗೆ, ಕೇಂದ್ರದಿಂದ ದತ್ತಾಂಶವು ಎಷ್ಟು ಹರಡಿದೆ ಎಂಬುದನ್ನು ತಿಳಿದುಕೊಳ್ಳುವುದು ಸಹ ಮುಖ್ಯವಾಗಿದೆ.
1. ಶ್ರೇಣಿ
ಶ್ರೇಣಿ ಎಂದರೆ ಗರಿಷ್ಠ ಮತ್ತು ಕನಿಷ್ಠ ಮೌಲ್ಯಗಳ ನಡುವಿನ ವ್ಯತ್ಯಾಸ. ಈ ಅಳತೆ ಸರಳವಾಗಿದೆ, ಆದರೆ ಇದು ಹೊರಗಿನ ಮೌಲ್ಯಗಳಿಂದ ಹೆಚ್ಚು ಪ್ರಭಾವಿತವಾಗಿರುತ್ತದೆ.
2. ವ್ಯತ್ಯಾಸ ಮತ್ತು ಪ್ರಮಾಣಿತ ವಿಚಲನ
- ವ್ಯತ್ಯಾಸವು ಸರಾಸರಿಯಿಂದ ಮೌಲ್ಯಗಳ ಸರಾಸರಿ ವರ್ಗದ ವಿಚಲನವನ್ನು ಅಳೆಯುತ್ತದೆ.
- ಪ್ರಮಾಣಿತ ವಿಚಲನವು ವ್ಯತ್ಯಾಸದ ವರ್ಗಮೂಲವಾಗಿದೆ, ಇದನ್ನು ಹೆಚ್ಚಾಗಿ ಬಳಸಲಾಗುತ್ತದೆ ಏಕೆಂದರೆ ಅದರ ಘಟಕಗಳು ಮೂಲ ದತ್ತಾಂಶದಂತೆಯೇ ಇರುತ್ತವೆ.
ಪ್ರಮಾಣಿತ ವಿಚಲನ ದೊಡ್ಡದಾದಷ್ಟೂ, ದತ್ತಾಂಶವು ಹೆಚ್ಚು ವ್ಯತ್ಯಾಸಗೊಳ್ಳುತ್ತದೆ; ಅದು ಚಿಕ್ಕದಾಗಿದ್ದರೆ, ದತ್ತಾಂಶವು ಸರಾಸರಿಯ ಸುತ್ತಲೂ ಹೆಚ್ಚು ಕ್ಲಸ್ಟರ್ ಆಗುತ್ತದೆ.
3. ಕ್ವಾರ್ಟೈಲ್ಗಳು ಮತ್ತು IQR (ಇಂಟರ್ಕ್ವಾರ್ಟೈಲ್ ರೇಂಜ್)
ಕ್ವಾರ್ಟೈಲ್ಗಳು ಡೇಟಾವನ್ನು ನಾಲ್ಕು ಸಮಾನ ಭಾಗಗಳಾಗಿ ವಿಂಗಡಿಸುತ್ತವೆ:
– Q1 (ಕೆಳಗಿನ ಕ್ವಾರ್ಟೈಲ್), Q2 (ಮಧ್ಯಮ), Q3 (ಮೇಲಿನ ಕ್ವಾರ್ಟೈಲ್).
IQR = Q3 − Q1 ಮಧ್ಯದ 50% ದತ್ತಾಂಶದ ವಿತರಣೆಯನ್ನು ತೋರಿಸುತ್ತದೆ ಮತ್ತು ಹೊರಗಿನವುಗಳಿಗೆ ತುಲನಾತ್ಮಕವಾಗಿ ನಿರೋಧಕವಾಗಿದೆ.
ವಿತರಣಾ ಫಾರ್ಮ್ ಮತ್ತು ಔಟ್ಲೈಯರ್ಗಳು
ವಿವರಣಾತ್ಮಕ ಅಂಕಿಅಂಶಗಳು ದತ್ತಾಂಶ ವಿತರಣೆಯ ಸ್ವರೂಪಕ್ಕೂ ಗಮನ ಕೊಡುತ್ತವೆ:
– ಸಮ್ಮಿತೀಯ: ದತ್ತಾಂಶವು ಸರಾಸರಿ/ಮಧ್ಯಮದ ಎಡ ಮತ್ತು ಬಲಕ್ಕೆ ಸಮವಾಗಿ ಹರಡುತ್ತದೆ.
– ಬಲಕ್ಕೆ ಓರೆಯಾಗಿ: ಹಲವು ಸಣ್ಣ ಮೌಲ್ಯಗಳು, ಕೆಲವು ದೊಡ್ಡ ಮೌಲ್ಯಗಳು.
– ಎಡಕ್ಕೆ ಓರೆಯಾಗಿ: ಹಲವು ದೊಡ್ಡ ಮೌಲ್ಯಗಳು, ಕೆಲವು ಸಣ್ಣ ಮೌಲ್ಯಗಳು.
ಏತನ್ಮಧ್ಯೆ, ಹೊರಗಣ ಮೌಲ್ಯವು ಹೆಚ್ಚಿನ ಡೇಟಾದಿಂದ ಗಮನಾರ್ಹವಾಗಿ ಭಿನ್ನವಾಗಿರುವ ಮೌಲ್ಯವಾಗಿದೆ. ಹೊರಗಣ ಮೌಲ್ಯಗಳು ರೆಕಾರ್ಡಿಂಗ್ ದೋಷಗಳು ಅಥವಾ ಗಮನಾರ್ಹ ನೈಜ-ಪ್ರಪಂಚದ ವಿದ್ಯಮಾನಗಳಿಂದಾಗಿ ಸಂಭವಿಸಬಹುದು (ಉದಾ., ಅತ್ಯಂತ ದೊಡ್ಡ ವಹಿವಾಟುಗಳು). ಹೊರಗಣ ಮೌಲ್ಯಗಳನ್ನು ಗುರುತಿಸುವುದು ಮುಖ್ಯವಾಗಿದೆ ಏಕೆಂದರೆ ಅವು ಸರಾಸರಿ, ವ್ಯತ್ಯಾಸ ಮತ್ತು ಒಟ್ಟಾರೆ ವ್ಯಾಖ್ಯಾನದ ಮೇಲೆ ಪರಿಣಾಮ ಬೀರುತ್ತವೆ.
ತೀರ್ಮಾನ
ವಿವರಣಾತ್ಮಕ ಅಂಕಿಅಂಶಗಳು ದತ್ತಾಂಶ ವಿಶ್ಲೇಷಣೆಯಲ್ಲಿ ಅತ್ಯಗತ್ಯವಾದ ಮೊದಲ ಹೆಜ್ಜೆಯಾಗಿದೆ ಏಕೆಂದರೆ ಇದು ಕಚ್ಚಾ ದತ್ತಾಂಶವನ್ನು ಅರ್ಥಪೂರ್ಣ ಮಾಹಿತಿಯಾಗಿ ಪರಿವರ್ತಿಸಲು ಸಹಾಯ ಮಾಡುತ್ತದೆ. ಸಂಖ್ಯಾತ್ಮಕ ಸಾರಾಂಶಗಳು (ಸರಾಸರಿ, ಮಧ್ಯಮ, ಮೋಡ್), ಪ್ರಸರಣದ ಅಳತೆಗಳು (ಶ್ರೇಣಿ, ಪ್ರಮಾಣಿತ ವಿಚಲನ, IQR), ಮತ್ತು ಕೋಷ್ಟಕಗಳು ಮತ್ತು ಗ್ರಾಫ್ಗಳಲ್ಲಿ ದತ್ತಾಂಶ ಪ್ರಸ್ತುತಿಯ ಮೂಲಕ, ವಿಶ್ಲೇಷಕರು ದತ್ತಾಂಶ ಗುಣಲಕ್ಷಣಗಳನ್ನು ತ್ವರಿತವಾಗಿ ಮತ್ತು ನಿಖರವಾಗಿ ಅರ್ಥಮಾಡಿಕೊಳ್ಳಬಹುದು. ದತ್ತಾಂಶ ಪ್ರಕಾರ ಮತ್ತು ಅಳತೆ ಮಾಪಕವನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳುವುದು ಸೂಕ್ತವಾದ ವಿವರಣಾತ್ಮಕ ವಿಧಾನವನ್ನು ಸಹ ನಿರ್ಧರಿಸುತ್ತದೆ. ಈ ಅಡಿಪಾಯದೊಂದಿಗೆ, ತಾರ್ಕಿಕ ವಿಶ್ಲೇಷಣೆ ಮತ್ತು ನಿರ್ಧಾರ ತೆಗೆದುಕೊಳ್ಳುವಿಕೆಯನ್ನು ಒಳಗೊಂಡಂತೆ ನಂತರದ ವಿಶ್ಲೇಷಣೆಯನ್ನು ಹೆಚ್ಚು ಕೇಂದ್ರೀಕೃತ ಮತ್ತು ಜವಾಬ್ದಾರಿಯುತ ರೀತಿಯಲ್ಲಿ ನಡೆಸಬಹುದು.
ನೀವು ಬಯಸಿದರೆ, ನಾನು ಈ ಲೇಖನವನ್ನು ಹೆಚ್ಚು ಶೈಕ್ಷಣಿಕವಾಗಿ (ಉಲ್ಲೇಖಗಳೊಂದಿಗೆ), ಹೆಚ್ಚು ಬ್ಲಾಗ್ ಸ್ನೇಹಿಯಾಗಿ ಅಥವಾ ಸರಳ ಲೆಕ್ಕಾಚಾರದ ಉದಾಹರಣೆಗಳು ಮತ್ತು ಕೋಷ್ಟಕ/ಗ್ರಾಫ್ ವಿವರಣೆಗಳನ್ನು ಸೇರಿಸಲು ಹೊಂದಿಕೊಳ್ಳಬಹುದು.