ಅಂಕಿಅಂಶಗಳಲ್ಲಿ ಇಂಪ್ಯುಟೇಶನ್ ವಿಧಾನಗಳು
ಅಂಕಿಅಂಶಗಳು ಮತ್ತು ದತ್ತಾಂಶ ವಿಶ್ಲೇಷಣೆಯ ಅಭ್ಯಾಸದಲ್ಲಿ, ದತ್ತಾಂಶ ಕಾಣೆಯ ಸಮಸ್ಯೆ ಬಹುತೇಕ ಯಾವಾಗಲೂ ಉದ್ಭವಿಸುತ್ತದೆ. ಪ್ರತಿಕ್ರಿಯಿಸುವವರು ಕೆಲವು ಪ್ರಶ್ನೆಗಳಿಗೆ ಉತ್ತರಿಸದಿರುವುದು, ರೆಕಾರ್ಡಿಂಗ್ ದೋಷಗಳು, ಸಂವೇದಕ ಹಸ್ತಕ್ಷೇಪ, ಹೊರತೆಗೆಯುವ ಸಮಯದಲ್ಲಿ ದೋಷಪೂರಿತ ದತ್ತಾಂಶ ಅಥವಾ ಸಂಪೂರ್ಣವಾಗಿ ಹೊಂದಿಕೆಯಾಗದ ಬಹು ದತ್ತಾಂಶ ಮೂಲಗಳನ್ನು ಸಂಯೋಜಿಸುವ ಪ್ರಕ್ರಿಯೆಯಿಂದಾಗಿ ದತ್ತಾಂಶ ಕಾಣೆಯಾಗಿರಬಹುದು. ಸರಿಯಾಗಿ ನಿರ್ವಹಿಸದಿದ್ದರೆ, ದತ್ತಾಂಶ ಕಾಣೆಯಾಗುವುದು ವಿಶ್ಲೇಷಣೆಯ ಗುಣಮಟ್ಟವನ್ನು ಕುಗ್ಗಿಸಬಹುದು, ಪರೀಕ್ಷೆಯ ಶಕ್ತಿಯನ್ನು ಕಡಿಮೆ ಮಾಡಬಹುದು ಮತ್ತು ಪಕ್ಷಪಾತದ ತೀರ್ಮಾನಗಳಿಗೆ ಕಾರಣವಾಗಬಹುದು. ಕಾಣೆಯಾದ ದತ್ತಾಂಶವನ್ನು ನಿರ್ವಹಿಸುವ ಸಾಮಾನ್ಯ ವಿಧಾನವೆಂದರೆ ಇಂಪ್ಯುಟೇಶನ್, ಇದು ಲಭ್ಯವಿರುವ ಮಾಹಿತಿಯ ಆಧಾರದ ಮೇಲೆ ಅಂದಾಜು ಮೌಲ್ಯಗಳೊಂದಿಗೆ ಕಾಣೆಯಾದ ಮೌಲ್ಯಗಳನ್ನು ಭರ್ತಿ ಮಾಡುವುದನ್ನು ಒಳಗೊಂಡಿರುತ್ತದೆ.
ಇಂಪ್ಯುಟೇಶನ್ ಏಕೆ ಮುಖ್ಯ?
ಕಾಣೆಯಾದ ಡೇಟಾವನ್ನು ಅಳಿಸುವುದಕ್ಕಿಂತ ಹೆಚ್ಚಾಗಿ ಆಪಾದನೆಯನ್ನು ಆಯ್ಕೆ ಮಾಡಲು ಹಲವಾರು ಕಾರಣಗಳಿವೆ. ಮೊದಲನೆಯದಾಗಿ, ಕಾಣೆಯಾದ ಮೌಲ್ಯಗಳನ್ನು ಹೊಂದಿರುವ ಸಾಲುಗಳು/ಅವಲೋಕನಗಳನ್ನು ಅಳಿಸುವುದು (ಉದಾ. ಪಟ್ಟಿವಾರು ಅಳಿಸುವಿಕೆ) ಮಾದರಿ ಗಾತ್ರವನ್ನು ತೀವ್ರವಾಗಿ ಕಡಿಮೆ ಮಾಡುತ್ತದೆ, ವಿಶೇಷವಾಗಿ ಕಾಣೆಯಾದ ಡೇಟಾದ ಶೇಕಡಾವಾರು ಗಮನಾರ್ಹವಾಗಿದ್ದಾಗ. ಎರಡನೆಯದಾಗಿ, ಡೇಟಾ ಯಾದೃಚ್ಛಿಕವಾಗಿ ಕಾಣೆಯಾಗಿಲ್ಲದಿದ್ದರೆ, ಅಳಿಸುವಿಕೆಯು ಪಕ್ಷಪಾತವನ್ನು ಪರಿಚಯಿಸಬಹುದು. ಮೂರನೆಯದಾಗಿ, ಅನೇಕ ಸಂಖ್ಯಾಶಾಸ್ತ್ರೀಯ ಅಥವಾ ಯಂತ್ರ ಕಲಿಕೆಯ ಅಲ್ಗಾರಿದಮ್ಗಳು ಸಂಪೂರ್ಣ ಡೇಟಾವನ್ನು ಬಯಸುತ್ತವೆ, ಇದು ಆಪಾದನೆಯನ್ನು ಅನುಕೂಲಕರ ಪೂರ್ವ-ಸಂಸ್ಕರಣಾ ಹಂತವನ್ನಾಗಿ ಮಾಡುತ್ತದೆ.
ಆದಾಗ್ಯೂ, ಆಪಾದನೆಯು ಕೇವಲ "ಅಂತರಗಳನ್ನು ತುಂಬುವ" ಬಗ್ಗೆ ಅಲ್ಲ. ಆಯ್ಕೆ ಮಾಡಿದ ವಿಧಾನವು ಕಾಣೆಯಾದ ದತ್ತಾಂಶ ಕಾರ್ಯವಿಧಾನ, ಅಸ್ಥಿರಗಳ ರಚನೆ ಮತ್ತು ವಿಶ್ಲೇಷಣೆಯ ಉದ್ದೇಶಗಳನ್ನು ಗಣನೆಗೆ ತೆಗೆದುಕೊಳ್ಳಬೇಕು. ಕಳಪೆ ಆಪಾದನೆಯು ಮಾದರಿಯನ್ನು "ಮೋಸ" ಮಾಡಬಹುದು, ವ್ಯತ್ಯಾಸವನ್ನು ಕಡಿಮೆ ಮಾಡಬಹುದು ಮತ್ತು ಫಲಿತಾಂಶಗಳು ನಿಜವಾಗಿರುವುದಕ್ಕಿಂತ ಹೆಚ್ಚು ಖಚಿತವಾಗಿ ಕಾಣುವಂತೆ ಮಾಡುತ್ತದೆ.
ಕಳೆದುಹೋದ ಡೇಟಾ ಕಾರ್ಯವಿಧಾನ
ಸಂಖ್ಯಾಶಾಸ್ತ್ರೀಯ ಸಾಹಿತ್ಯದಲ್ಲಿ, ಕಾಣೆಯಾದ ಡೇಟಾವನ್ನು ಸಾಮಾನ್ಯವಾಗಿ ಮೂರು ಮುಖ್ಯ ಕಾರ್ಯವಿಧಾನಗಳಾಗಿ ವರ್ಗೀಕರಿಸಲಾಗುತ್ತದೆ:
1. MCAR (ಯಾದೃಚ್ಛಿಕವಾಗಿ ಸಂಪೂರ್ಣವಾಗಿ ಕಾಣೆಯಾಗಿದೆ): ದತ್ತಾಂಶ ಕಾಣೆಯ ಸಂಭವನೀಯತೆಯು ಗಮನಿಸಿದ ಅಥವಾ ಗಮನಿಸದ ಯಾವುದೇ ಅಸ್ಥಿರಗಳಿಂದ ಸ್ವತಂತ್ರವಾಗಿರುತ್ತದೆ. ಉದಾಹರಣೆಗೆ, ಅಪಘಾತದಿಂದ ಹಾನಿಗೊಳಗಾದ ಪ್ರಶ್ನಾವಳಿ.
2. MAR (ಯಾದೃಚ್ಛಿಕವಾಗಿ ಕಾಣೆಯಾಗಿದೆ): ಡೇಟಾ ಕಾಣೆಯ ಸಂಭವನೀಯತೆಯು ಗಮನಿಸಿದ ವೇರಿಯೇಬಲ್ ಅನ್ನು ಅವಲಂಬಿಸಿರುತ್ತದೆ, ಆದರೆ ಇತರ ವೇರಿಯೇಬಲ್ಗಳನ್ನು ನಿಯಂತ್ರಿಸಿದ ನಂತರ ಕಾಣೆಯಾದ ಮೌಲ್ಯವನ್ನು ಅವಲಂಬಿಸಿರುವುದಿಲ್ಲ. ಉದಾಹರಣೆಗೆ, ಯುವ ಪ್ರತಿಕ್ರಿಯಿಸುವವರು ಆದಾಯದ ಪ್ರಶ್ನೆಗಳನ್ನು ತಪ್ಪಿಸಿಕೊಳ್ಳುವ ಸಾಧ್ಯತೆ ಹೆಚ್ಚು, ಆದರೆ ವಯಸ್ಸು ಲಭ್ಯವಿದೆ.
3. MNAR (ಯಾದೃಚ್ಛಿಕವಾಗಿ ಕಾಣೆಯಾಗದಿರುವುದು): ಡೇಟಾ ಕಾಣೆಯಾಗುವ ಸಂಭವನೀಯತೆಯು ಕಾಣೆಯಾದ ಮೌಲ್ಯವನ್ನು ಅವಲಂಬಿಸಿರುತ್ತದೆ. ಉದಾಹರಣೆಗೆ, ಅತಿ ಹೆಚ್ಚು ಆದಾಯ ಹೊಂದಿರುವ ಜನರು ತಮ್ಮ ಆದಾಯವನ್ನು ಬಹಿರಂಗಪಡಿಸುವುದಿಲ್ಲ.
MCAR/MAR ಅಡಿಯಲ್ಲಿ ಇಂಪ್ಯುಟೇಶನ್ ಸಾಮಾನ್ಯವಾಗಿ ಸುರಕ್ಷಿತವಾಗಿರುತ್ತದೆ. MNAR ಗೆ ಸಾಮಾನ್ಯವಾಗಿ ಕಾಣೆಯಾದ ಡೇಟಾ ಅಥವಾ ಸೂಕ್ಷ್ಮತೆಯ ವಿಶ್ಲೇಷಣೆಯನ್ನು ಸ್ಪಷ್ಟವಾಗಿ ಲೆಕ್ಕಹಾಕುವ ಮಾದರಿಯ ಅಗತ್ಯವಿರುತ್ತದೆ.
ಸರಳ ಇಂಪ್ಯುಟೇಶನ್ ವಿಧಾನ
1. ಸರಾಸರಿ/ಮಧ್ಯಮ/ಮೋಡ್ ಇಂಪ್ಯುಟೇಶನ್
ಸರಳವಾದ ವಿಧಾನವೆಂದರೆ ಕಾಣೆಯಾದ ಮೌಲ್ಯಗಳನ್ನು ಸಂಖ್ಯಾತ್ಮಕ ಅಸ್ಥಿರಗಳಿಗೆ ಸರಾಸರಿ ಅಥವಾ ಸರಾಸರಿಯೊಂದಿಗೆ ಮತ್ತು ವರ್ಗೀಯ ಅಸ್ಥಿರಗಳಿಗೆ ಮೋಡ್ನೊಂದಿಗೆ ಬದಲಾಯಿಸುವುದು. ಅನುಕೂಲಗಳು ಹೀಗಿವೆ: ಇದು ಸುಲಭ, ವೇಗವಾಗಿದೆ ಮತ್ತು ಹೆಚ್ಚಾಗಿ ಬೇಸ್ಲೈನ್ ಆಗಿ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತದೆ. ಅನಾನುಕೂಲಗಳೆಂದರೆ: ಇದು ವ್ಯತ್ಯಾಸವನ್ನು ಕಡಿಮೆ ಮಾಡುತ್ತದೆ ಮತ್ತು ಡೇಟಾ ವಿತರಣೆಯನ್ನು ವಿರೂಪಗೊಳಿಸುತ್ತದೆ, ವಿಶೇಷವಾಗಿ ಡೇಟಾ ಅಸಮ್ಮಿತವಾಗಿದ್ದರೆ ಅಥವಾ ಹೊರಗಣ ಮೌಲ್ಯಗಳನ್ನು ಹೊಂದಿದ್ದರೆ. ಮಧ್ಯಗಣವು ಸಾಮಾನ್ಯವಾಗಿ ಸರಾಸರಿಗಿಂತ ಹೊರಗಣ ಮೌಲ್ಯಗಳಿಗೆ ಹೆಚ್ಚು ದೃಢವಾಗಿರುತ್ತದೆ.
2. ನಿರಂತರ ಆರೋಪಣೆ
ಕಾಣೆಯಾದ ಮೌಲ್ಯಗಳನ್ನು 0, -1, ಅಥವಾ "ಅಜ್ಞಾತ" ಲೇಬಲ್ನಂತಹ ನಿರ್ದಿಷ್ಟ ಸ್ಥಿರಾಂಕದಿಂದ ತುಂಬಿಸಲಾಗುತ್ತದೆ. ಮೌಲ್ಯವು ನಿರ್ದಿಷ್ಟ ಅರ್ಥವನ್ನು ಹೊಂದಿರುವಾಗ (ಉದಾ., "ವ್ಯವಹಾರವಿಲ್ಲ"), ಅಥವಾ ಕಾಣೆಯಾಗಿರುವುದನ್ನು ಹೈಲೈಟ್ ಮಾಡಲು ಮಾದರಿಗೆ ಹೆಚ್ಚುವರಿ ಸೂಚಕವನ್ನು ನೀಡಬೇಕಾದಾಗ ಇದು ಉಪಯುಕ್ತವಾಗಿದೆ. ಆದಾಗ್ಯೂ, ಅನಿಯಂತ್ರಿತ ಸ್ಥಿರಾಂಕವನ್ನು ಆರಿಸುವುದರಿಂದ ನಕಲಿ ಮಾದರಿಗಳನ್ನು ಪರಿಚಯಿಸಬಹುದು.
3. ಹಾಟ್ ಡೆಕ್ ಇಂಪ್ಯೂಟೇಶನ್
ಹಾಟ್ ಡೆಕ್ನಲ್ಲಿ, ಕಾಣೆಯಾದ ಮೌಲ್ಯಗಳನ್ನು ಹಲವಾರು ಪ್ರಮುಖ ಅಸ್ಥಿರಗಳ ಆಧಾರದ ಮೇಲೆ ಇತರ, "ಸಮಾನ" ಅವಲೋಕನಗಳಿಂದ (ದಾನಿಗಳು) ಮೌಲ್ಯಗಳನ್ನು ಬಳಸಿಕೊಂಡು ತುಂಬಿಸಲಾಗುತ್ತದೆ. ಈ ವಿಧಾನವು ಸಮೀಕ್ಷೆಗಳಲ್ಲಿ ಜನಪ್ರಿಯವಾಗಿದೆ. ಹಾಟ್ ಡೆಕ್ಗಳು ವಾಸ್ತವಿಕ ಮೌಲ್ಯಗಳನ್ನು ನಿರ್ವಹಿಸುತ್ತವೆ ಏಕೆಂದರೆ ಅವು ಡೇಟಾದ ನಿಜವಾದ ಮೌಲ್ಯಗಳನ್ನು ಸೆರೆಹಿಡಿಯುತ್ತವೆ, ಆದರೆ ಫಲಿತಾಂಶಗಳು "ಸಾಮ್ಯತೆ" ಯ ವ್ಯಾಖ್ಯಾನಕ್ಕೆ ಸೂಕ್ಷ್ಮವಾಗಿರುತ್ತವೆ ಮತ್ತು ಅಂತರ-ಮಾದರಿ ವ್ಯತ್ಯಾಸವನ್ನು ಉಂಟುಮಾಡಬಹುದು.
ಮಾದರಿ ಆಧಾರಿತ ಇಂಪ್ಯುಟೇಶನ್ ವಿಧಾನ
4. ಹಿಂಜರಿತದ ಆರೋಪಣೆ
ಕಾಣೆಯಾದ ಮೌಲ್ಯಗಳನ್ನು ಇತರ ಅಸ್ಥಿರಗಳಿಂದ ಪಡೆದ ಹಿಂಜರಿತ ಮಾದರಿಯನ್ನು ಬಳಸಿಕೊಂಡು ಊಹಿಸಲಾಗುತ್ತದೆ. ಸಂಖ್ಯಾತ್ಮಕ ಅಸ್ಥಿರಗಳಿಗೆ, ರೇಖೀಯ ಹಿಂಜರಿತವನ್ನು ಬಳಸಬಹುದು; ವರ್ಗೀಯ ಅಸ್ಥಿರಗಳಿಗೆ, ಲಾಜಿಸ್ಟಿಕ್ ಅಥವಾ ಬಹುಪದೀಯ ಹಿಂಜರಿತವನ್ನು ಬಳಸಬಹುದು. ಅನುಕೂಲವೆಂದರೆ ಅದು ಅಸ್ಥಿರಗಳ ನಡುವಿನ ಸಂಬಂಧಗಳನ್ನು ಬಳಸಿಕೊಳ್ಳುತ್ತದೆ. ಅನಾನುಕೂಲವೆಂದರೆ ನಿರ್ಣಾಯಕ ಮುನ್ಸೂಚಿತ ಮೌಲ್ಯಗಳನ್ನು ಮಾತ್ರ ಬಳಸುವುದು ವ್ಯತ್ಯಾಸವನ್ನು ಕಡಿಮೆ ಮಾಡುತ್ತದೆ ಏಕೆಂದರೆ ಎಲ್ಲಾ ಆಪಾದಿತ ಮೌಲ್ಯಗಳು ಭವಿಷ್ಯ ರೇಖೆಯ ಮೇಲೆ ನಿಖರವಾಗಿ ಬೀಳುತ್ತವೆ. ಇದನ್ನು ಪರಿಹರಿಸಲು, ಹೆಚ್ಚಿನ ವಾಸ್ತವಿಕತೆಗಾಗಿ ಯಾದೃಚ್ಛಿಕ ಘಟಕಗಳನ್ನು (ಉದಾ., ಉಳಿಕೆಗಳು) ಹೆಚ್ಚಾಗಿ ಸೇರಿಸಲಾಗುತ್ತದೆ.
5. k-ಹತ್ತಿರದ ನೆರೆಹೊರೆಯವರು (kNN) ಇಂಪ್ಯೂಟೇಶನ್
kNN ವಿಧಾನವು k ಹತ್ತಿರದ ನೆರೆಹೊರೆಯವರ ಸರಾಸರಿ (ಅಥವಾ ಮತದಾನ) ಆಧಾರದ ಮೇಲೆ ಕಾಣೆಯಾದ ಮೌಲ್ಯಗಳನ್ನು ತುಂಬುತ್ತದೆ. ಡೇಟಾವನ್ನು ಸಾಮಾನ್ಯೀಕರಿಸಿದ ನಂತರ ಸಾಮೀಪ್ಯವನ್ನು ಸಾಮಾನ್ಯವಾಗಿ ಯೂಕ್ಲಿಡಿಯನ್ ದೂರ ಅಥವಾ ಇನ್ನೊಂದು ಮೆಟ್ರಿಕ್ ಮೂಲಕ ಅಳೆಯಲಾಗುತ್ತದೆ. ಇದರ ಅನುಕೂಲಗಳಲ್ಲಿ ನಮ್ಯತೆ ಮತ್ತು ಯಾವುದೇ ರೇಖೀಯ ಸಂಬಂಧದ ಊಹೆ ಸೇರಿವೆ. ಅನಾನುಕೂಲಗಳು ದೊಡ್ಡ ಡೇಟಾ ಸೆಟ್ಗಳಿಗೆ ಕಂಪ್ಯೂಟೇಶನಲ್ ಆಗಿ ದುಬಾರಿ, ವೇರಿಯಬಲ್ ಸ್ಕೇಲ್ಗೆ ಸೂಕ್ಷ್ಮತೆ ಮತ್ತು ಹೆಚ್ಚಿನ ಆಯಾಮದ ಡೇಟಾದಲ್ಲಿ ಕಾರ್ಯಕ್ಷಮತೆಯ ಅವನತಿ (ಆಯಾಮದ ಶಾಪ) ಸೇರಿವೆ.
6. ನಿರೀಕ್ಷೆ-ಗರಿಷ್ಠೀಕರಣ (EM)
EM ವಿಧಾನವು ಕಾಣೆಯಾದ ಮೌಲ್ಯಗಳನ್ನು ಸುಪ್ತ ಅಸ್ಥಿರಗಳಾಗಿ ಪರಿಗಣಿಸುವ ಮೂಲಕ ಮಾದರಿ ನಿಯತಾಂಕಗಳನ್ನು (ಉದಾ., ಮಲ್ಟಿವೇರಿಯೇಟ್ ಸಾಮಾನ್ಯ ದತ್ತಾಂಶಕ್ಕಾಗಿ ಸರಾಸರಿ ಮತ್ತು ಸಹವೇರಿಯನ್ಸ್) ಅಂದಾಜು ಮಾಡುತ್ತದೆ. ಹಂತ E ಪ್ರಸ್ತುತ ನಿಯತಾಂಕಗಳನ್ನು ಆಧರಿಸಿ ಕಾಣೆಯಾದ ಮೌಲ್ಯಗಳ ನಿರೀಕ್ಷೆಯನ್ನು ಪುನರಾವರ್ತಿತವಾಗಿ ಲೆಕ್ಕಾಚಾರ ಮಾಡುತ್ತದೆ ಮತ್ತು ನಂತರ ಹಂತ M ನಿರೀಕ್ಷಿತ "ಸಂಪೂರ್ಣ" ಡೇಟಾವನ್ನು ಆಧರಿಸಿ ನಿಯತಾಂಕಗಳನ್ನು ನವೀಕರಿಸುತ್ತದೆ. EM ಕೆಲವು ವಿತರಣಾ ಊಹೆಗಳಿಗೆ ದೃಢವಾಗಿದೆ, ಆದರೆ ಸಂಕೀರ್ಣವಾಗಿರಬಹುದು ಮತ್ತು ಮಾದರಿ ಊಹೆಗಳ ಸರಿಯಾದತೆಯನ್ನು ಅವಲಂಬಿಸಿರುತ್ತದೆ.
ಬಹು ಆರೋಪಣೆ: ಹಲವು ಪ್ರಕರಣಗಳಲ್ಲಿ ಚಿನ್ನದ ಮಾನದಂಡ
7. ಬಹು ಇಂಪ್ಯುಟೇಶನ್ (MI)
ಬಹು ಇಂಪ್ಯುಟೇಶನ್ ಅನ್ನು MAR ಗೆ ಅತ್ಯಂತ ತತ್ವಬದ್ಧ ವಿಧಾನಗಳಲ್ಲಿ ಒಂದೆಂದು ಪರಿಗಣಿಸಲಾಗಿದೆ. ಒಂದೇ ಸಂಪೂರ್ಣ ಡೇಟಾಸೆಟ್ ಅನ್ನು ಉತ್ಪಾದಿಸುವ ಬದಲು, MI ಅನಿಶ್ಚಿತತೆಯನ್ನು ಪ್ರತಿಬಿಂಬಿಸುವ ವಿಭಿನ್ನ ಇಂಪ್ಯುಟೇಶನ್ಗಳೊಂದಿಗೆ ಬಹು ಡೇಟಾಸೆಟ್ಗಳನ್ನು (ಉದಾ., 5–20) ಉತ್ಪಾದಿಸುತ್ತದೆ. ಪ್ರತಿಯೊಂದು ಡೇಟಾಸೆಟ್ ಅನ್ನು ಪ್ರತ್ಯೇಕವಾಗಿ ವಿಶ್ಲೇಷಿಸಲಾಗುತ್ತದೆ, ನಂತರ ಹೆಚ್ಚು ಮಾನ್ಯ ಅಂದಾಜುಗಳು ಮತ್ತು ಪ್ರಮಾಣಿತ ದೋಷಗಳನ್ನು ಪಡೆಯಲು ರೂಬಿನ್ನ ನಿಯಮಗಳನ್ನು ಬಳಸಿಕೊಂಡು ಫಲಿತಾಂಶಗಳನ್ನು ಸಂಯೋಜಿಸಲಾಗುತ್ತದೆ.
MI ಅನುಕೂಲಗಳು:
– ಆರೋಪಣೆಯ ಅನಿಶ್ಚಿತತೆಯನ್ನು ಸರಿದೂಗಿಸುತ್ತದೆ.
– ಸಂಖ್ಯಾಶಾಸ್ತ್ರೀಯ ನಿರ್ಣಯಕ್ಕೆ ಹೆಚ್ಚು ನಿಖರತೆ (ವಿಶ್ವಾಸಾರ್ಹ ಮಧ್ಯಂತರಗಳು, ಊಹೆ ಪರೀಕ್ಷೆ).
- ವಿವಿಧ ರೀತಿಯ ಅಸ್ಥಿರಗಳಿಗೆ ಹೊಂದಿಕೊಳ್ಳುವ.
ಇದರ ಮಿತಿಗಳು:
- ಹೆಚ್ಚು ಸಂಕೀರ್ಣವಾದ ಅನುಷ್ಠಾನ.
– ಸಾಕಷ್ಟು ಊಹೆಗಳು ಮತ್ತು ಆರೋಪಣೆ ಮಾದರಿ ವಿಶೇಷಣಗಳ ಅಗತ್ಯವಿದೆ.
– MNAR ನಲ್ಲಿ ಕೊರತೆಯಿದ್ದರೆ, ಪ್ರಮಾಣಿತ MI ಇನ್ನೂ ಪಕ್ಷಪಾತವಾಗಿರಬಹುದು.
ಸಮಯ ಸರಣಿ ಮತ್ತು ಪ್ರಾದೇಶಿಕ ದತ್ತಾಂಶಕ್ಕಾಗಿ ಇಂಪ್ಯುಟೇಶನ್
ಸಮಯ ಸರಣಿಯ ದತ್ತಾಂಶದಲ್ಲಿ, ಕಾಣೆಯಾದ ಮೌಲ್ಯಗಳು ಹೆಚ್ಚಾಗಿ ಅವುಗಳ ಹಿಂದಿನ ಮತ್ತು ನಂತರದ ಮೌಲ್ಯಗಳೊಂದಿಗೆ ಬಲವಾಗಿ ಪರಸ್ಪರ ಸಂಬಂಧ ಹೊಂದಿವೆ. ರೇಖೀಯ ಇಂಟರ್ಪೋಲೇಷನ್, ಸ್ಪ್ಲೈನ್ಗಳು, ಕಲ್ಮನ್ ಫಿಲ್ಟರ್ಗಳು ಅಥವಾ ARIMA/ಸ್ಟೇಟ್ ಸ್ಪೇಸ್ ಮಾದರಿಗಳಂತಹ ವಿಧಾನಗಳನ್ನು ಹೆಚ್ಚಾಗಿ ಬಳಸಲಾಗುತ್ತದೆ. ಪ್ರಾದೇಶಿಕ ದತ್ತಾಂಶಕ್ಕಾಗಿ, ಕ್ರಿಗಿಂಗ್ ಮತ್ತು ಪ್ರಾದೇಶಿಕ ಮಾದರಿಗಳಂತಹ ವಿಧಾನಗಳು ಭೌಗೋಳಿಕ ಸಾಮೀಪ್ಯವನ್ನು ಬಳಸಿಕೊಳ್ಳಬಹುದು. ತಾತ್ಕಾಲಿಕ/ಪ್ರಾದೇಶಿಕ ರಚನೆಯು ಪ್ರಬಲವಾಗಿದ್ದಾಗ ಈ ವಿಧಾನಗಳು ಪರಿಣಾಮಕಾರಿಯಾಗಿರುತ್ತವೆ, ಆದರೆ ಸರಳ ಇಂಟರ್ಪೋಲೇಷನ್ ಅನ್ನು ದಾರಿತಪ್ಪಿಸುವ ಹಠಾತ್ ಬದಲಾವಣೆಗಳ ವಿರುದ್ಧ (ಉದಾ. ಆರ್ಥಿಕ ಆಘಾತಗಳು) ಎಚ್ಚರಿಕೆ ವಹಿಸಬೇಕು.
ಇಂಪ್ಯುಟೇಶನ್ ವಿಧಾನಗಳನ್ನು ಆಯ್ಕೆಮಾಡುವಲ್ಲಿ ಉತ್ತಮ ಅಭ್ಯಾಸಗಳು
1. ಕಾಣೆಯಾದ ದತ್ತಾಂಶ ಪರಿಶೋಧನೆಯನ್ನು ನಡೆಸುವುದು: ಕಾಣೆಯಾದ ಮೌಲ್ಯಗಳ ಶೇಕಡಾವಾರು, ಕಾಣೆಯಾದ ಮಾದರಿ ಮತ್ತು ಕಾಣೆಯಾದ ಮೌಲ್ಯವು ನಿರ್ದಿಷ್ಟ ವೇರಿಯೇಬಲ್ಗೆ ಸಂಬಂಧಿಸಿದೆಯೇ ಎಂದು ಪರಿಶೀಲಿಸಿ.
2. ತರಬೇತಿ ಮತ್ತು ಪರೀಕ್ಷಾ ಡೇಟಾವನ್ನು ಪ್ರತ್ಯೇಕಿಸಿ: ತರಬೇತಿ ಡೇಟಾದಿಂದ ಮಾತ್ರ "ಕಲಿಕೆ" ಮೂಲಕ ಆಪಾದನೆಯನ್ನು ಮಾಡಿ, ನಂತರ ಡೇಟಾ ಸೋರಿಕೆಯನ್ನು ತಪ್ಪಿಸಲು ಅದನ್ನು ಪರೀಕ್ಷಾ ಡೇಟಾಗೆ ಅನ್ವಯಿಸಿ.
3. ವೇರಿಯೇಬಲ್ ಪ್ರಕಾರವನ್ನು ಪರಿಗಣಿಸಿ: ಸಂಖ್ಯಾತ್ಮಕ, ವರ್ಗೀಯ, ಆರ್ಡಿನಲ್ ಅಥವಾ ಮಿಶ್ರ; ಸೂಕ್ತ ವಿಧಾನವು ಭಿನ್ನವಾಗಿರುತ್ತದೆ.
4. ಕಾಣೆಯಾಗಿರುವಿಕೆ ಸೂಚಕಗಳನ್ನು ಬಳಸಿ: ಕೆಲವೊಮ್ಮೆ ಮೌಲ್ಯ ಕಾಣೆಯಾಗಿರುವ ಮಾಹಿತಿಯು ಸ್ವತಃ ಭವಿಷ್ಯಸೂಚಕವಾಗಿರುತ್ತದೆ; ಸೂಚಕ ಅಸ್ಥಿರಗಳನ್ನು ಸೇರಿಸುವುದರಿಂದ ಭವಿಷ್ಯಸೂಚಕ ಮಾದರಿಯ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ಸುಧಾರಿಸಬಹುದು.
5. ಆಪಾದನೆಯ ಪರಿಣಾಮವನ್ನು ಮೌಲ್ಯಮಾಪನ ಮಾಡಿ: ಆಪಾದನೆಯ ಮೊದಲು/ನಂತರದ ವಿತರಣೆಗಳನ್ನು ಹೋಲಿಕೆ ಮಾಡಿ, ವ್ಯತ್ಯಾಸ ಕಡಿಮೆಯಾಗಿದೆಯೇ ಎಂದು ಪರಿಶೀಲಿಸಿ ಮತ್ತು ಮಾದರಿಯನ್ನು ಮೌಲ್ಯೀಕರಿಸಿ.
6. ನಿರ್ಣಯಕ್ಕಾಗಿ MI ಗೆ ಆದ್ಯತೆ ನೀಡಿ: ವಿಶ್ಲೇಷಣೆಯ ಗುರಿಯು ನಿಯತಾಂಕ ಅಂದಾಜು ಮತ್ತು ಸಂಖ್ಯಾಶಾಸ್ತ್ರೀಯ ಪರೀಕ್ಷೆಯಾಗಿದ್ದಾಗ, ಬಹು ಆಪಾದನೆಯು ಒಂದೇ ಆಪಾದನೆಗಿಂತ ಹೆಚ್ಚಾಗಿ ಸೂಕ್ತವಾಗಿದೆ.
ತೀರ್ಮಾನ
ಕಾಣೆಯಾದ ಡೇಟಾವನ್ನು ನಿರ್ವಹಿಸಲು ಆಧುನಿಕ ಸಂಖ್ಯಾಶಾಸ್ತ್ರೀಯ ಕೆಲಸದ ಹರಿವುಗಳಲ್ಲಿ ಇಂಪ್ಯುಟೇಶನ್ ಒಂದು ನಿರ್ಣಾಯಕ ಅಂಶವಾಗಿದೆ. ಸರಾಸರಿ/ಮಧ್ಯಂತರದಂತಹ ಸರಳ ವಿಧಾನಗಳು ಬೇಸ್ಲೈನ್ ಆಗಿ ಅಥವಾ ಸಣ್ಣ ಕಾಣೆಗಳಿಗೆ ಉಪಯುಕ್ತವಾಗಬಹುದು, ಆದರೆ ಆಗಾಗ್ಗೆ ಡೇಟಾ ರಚನೆ ಮತ್ತು ಅನಿಶ್ಚಿತತೆಯನ್ನು ರಾಜಿ ಮಾಡಿಕೊಳ್ಳುತ್ತವೆ. ರಿಗ್ರೆಷನ್, kNN ಮತ್ತು EM ನಂತಹ ಮಾದರಿ ಆಧಾರಿತ ವಿಧಾನಗಳು ಅಸ್ಥಿರಗಳ ನಡುವಿನ ಸಂಬಂಧಗಳನ್ನು ಬಳಸಿಕೊಳ್ಳುತ್ತವೆ, ಆದರೆ ಬಹು ಇಂಪ್ಯುಟೇಶನ್ ಅನಿಶ್ಚಿತತೆಯನ್ನು ಲೆಕ್ಕಹಾಕುವ ಮೂಲಕ ಅನುಮಾನಕ್ಕೆ ದೃಢವಾದ ಚೌಕಟ್ಟನ್ನು ಒದಗಿಸುತ್ತದೆ. ಉತ್ತಮ ವಿಧಾನದ ಆಯ್ಕೆಯು ಕಾಣೆಯಾದ ಡೇಟಾ ಕಾರ್ಯವಿಧಾನ (MCAR/MAR/MNAR), ವಿಶ್ಲೇಷಣಾ ಉದ್ದೇಶ (ಭವಿಷ್ಯ vs. ಅನುಮಾನ) ಮತ್ತು ಡೇಟಾದ ಗುಣಲಕ್ಷಣಗಳನ್ನು (ಸಮಯ ಸರಣಿ, ಪ್ರಾದೇಶಿಕ, ಮಿಶ್ರ) ಅವಲಂಬಿಸಿರುತ್ತದೆ. ಸರಿಯಾದ ವಿಧಾನದೊಂದಿಗೆ, ಇಂಪ್ಯುಟೇಶನ್ ವಿಶ್ಲೇಷಣೆಯ ಸಮಗ್ರತೆಯನ್ನು ಕಾಪಾಡಿಕೊಳ್ಳಲು ಸಹಾಯ ಮಾಡುತ್ತದೆ ಮತ್ತು ಹೆಚ್ಚು ವಿಶ್ವಾಸಾರ್ಹ ತೀರ್ಮಾನಗಳನ್ನು ನೀಡುತ್ತದೆ.