గణాంకాలలో విపరీత విలువ అంటే ఏమిటి?

గణాంకాలలో అవుట్‌లయర్ అంటే ఏమిటి?

గణాంక శాస్త్రంలో, వినియోగదారుల ప్రవర్తన, పరీక్ష ఫలితాలు, రోగి ఆరోగ్యం, ఉత్పత్తి నాణ్యత, మరియు ఆర్థిక ధోరణులు వంటి దృగ్విషయాలను అర్థం చేసుకోవడానికి డేటానే ప్రాథమిక ముడి పదార్థం. అయితే, అన్ని డేటా పాయింట్లు మెజారిటీ లాగా "ప్రవర్తించవు". కొన్నిసార్లు మనం మిగిలిన డేటా సెట్ నుండి గణనీయంగా భిన్నంగా కనిపించే ఒకటి లేదా అంతకంటే ఎక్కువ విలువలను ఎదుర్కొంటాము. ఈ అవుట్‌లయర్‌లను అవుట్‌లయర్‌లు అని పిలుస్తారు. అవుట్‌లయర్‌లను అర్థం చేసుకోవడం ముఖ్యం, ఎందుకంటే అవి విశ్లేషణాత్మక నిర్ధారణలను మార్చగలవు, ప్రిడిక్టివ్ మోడల్‌లను ప్రభావితం చేయగలవు, మరియు పరిశోధనకు అర్హమైన ముఖ్యమైన సంఘటనలను కూడా సూచించగలవు.

అవుట్‌లయర్‌లను అర్థం చేసుకోవడం

సులభంగా చెప్పాలంటే, అవుట్‌లయర్ అనేది మెజారిటీ డేటా నుండి గణనీయంగా భిన్నంగా ఉండే ఒక పరిశీలన లేదా డేటా విలువ. అవుట్‌లయర్‌లు సాధారణ నమూనా కంటే ఎక్కువగా (అత్యంత ఎక్కువగా) లేదా తక్కువగా (అత్యంత తక్కువగా) ఉండవచ్చు. ఉదాహరణకు, మెజారిటీ విద్యార్థుల పరీక్ష స్కోర్‌లు 60–90 పరిధిలో ఉండి, 5 లేదా 100 ఉన్న ఒకే ఒక్క స్కోర్ గణనీయంగా విచలనం చెందితే, ఆ స్కోర్‌ను అవుట్‌లయర్‌గా అనుమానించాలి.

ఇక్కడ నొక్కి చెప్పాల్సిన ముఖ్య విషయం ఏమిటంటే: ఒక అవుట్‌లయర్ (అసాధారణ విలువ) అంటే ఎల్లప్పుడూ 'లోపం' అని కాదు. అవుట్‌లయర్ కేవలం డేటా సెట్‌తో పోలిస్తే ఆ విలువ అసాధారణంగా ఉందని సూచిస్తుంది. ఇన్‌పుట్ లోపాల వల్ల, లోపభూయిష్టమైన కొలత పరికరాల వల్ల అవుట్‌లయర్‌లు ఏర్పడవచ్చు, లేదా అవి అరుదైన కానీ ముఖ్యమైన వాస్తవ ప్రపంచ సంఘటనలను ప్రతిబింబించవచ్చు.

సరళమైన ఉదాహరణ

10 మంది వ్యక్తుల నెలవారీ ఆదాయ వివరాలను (మిలియన్ రూపాయలలో) ఊహించుకోండి:
5, 5, 6, 6, 6, 7, 7, 7, 8, 50

ఇక్కడ, మిగతా వాటితో పోలిస్తే 50 అనే సంఖ్య స్పష్టంగా కనిపిస్తోంది. 50 ఒక పొరపాటా? అది తప్పుగా చదవడం వల్ల కావచ్చు (అది 5,0గా ఉండాలి), కానీ ఆ వ్యక్తి ఒక పెద్ద వ్యాపార యజమాని కాబట్టి అది సరైనది కూడా కావచ్చు. ఏ సందర్భంలోనైనా, 50 ఒక విలక్షణమైన సంఖ్యగానే మిగిలిపోతుంది—విశ్లేషణలో మనం దానిని ఎలా పరిగణిస్తామనేదే తేడా.

విపరీత విలువలు ఎందుకు కనిపిస్తాయి?

విపరీత విలువలు కనిపించడానికి అనేక సాధారణ కారణాలు ఉన్నాయి:

1. కొలత లేదా పరికర లోపం
ఉదాహరణకు, అంతరాయం కారణంగా ఉష్ణోగ్రత సెన్సార్ కొన్నిసార్లు తీవ్రమైన విలువలను చూపించవచ్చు.

2. డేటాను రికార్డ్ చేయడంలో లేదా నమోదు చేయడంలో లోపాలు
సాధారణ ఉదాహరణలు: 100కు బదులుగా 1000 అని టైప్ చేయడం, లేదా తప్పుడు యూనిట్లను (సెం.మీ.కు బదులుగా మీటర్లు) ఉపయోగించడం.

చదవండి  ప్రామాణిక విచలనాన్ని ఉపయోగించి డేటా పంపిణీ విశ్లేషణ

3. సహజ వైవిధ్యం
నిజ ప్రపంచంలో, అరుదైనప్పటికీ వాస్తవికమైన దృగ్విషయాలు ఉంటాయి: ఒక పెద్ద ప్రచారం కారణంగా అమ్మకాలు ఒక్కసారిగా పెరగడం, ఒక రోగి మందుకు అసాధారణంగా స్పందించడం, లేదా ఒక క్రీడాకారుడు అత్యంత ఘోరమైన రికార్డును నెలకొల్పడం వంటివి.

4. ప్రక్రియ లేదా పరిస్థితులలో మార్పులు
ఉదాహరణకు, ఒక ఫ్యాక్టరీలో ఒకానొక రోజున యంత్రం విఫలమవడం వల్ల, లోపభూయిష్టమైన ఉత్పత్తుల సంఖ్య విపరీతంగా పెరిగిపోతుంది.

5. మిశ్రమ జనాభా
ఒక డేటాసెట్‌లో అనేక విభిన్న సమూహాలు కలిసి ఉండవచ్చు. ఉదాహరణకు, మాధ్యమిక పాఠశాల మరియు కళాశాల విద్యార్థుల ఎత్తులు కలిసి ఉంటాయి; కొన్ని "విపరీతమైన" విలువలు అసాధారణతల వల్ల కాకుండా, ఆ సమూహాలు నిజంగానే భిన్నంగా ఉండటం వల్ల కనిపించవచ్చు.

గణాంక విశ్లేషణపై అవుట్‌లయర్‌ల ప్రభావం

విపరీత విలువలకు సున్నితంగా ఉండే పద్ధతులలో, విశ్లేషణ ఫలితాలను గణనీయంగా ప్రభావితం చేయగలవు కాబట్టి విపరీత విలువలు ముఖ్యమైనవి.

1. సగటును (మీన్) ప్రభావితం చేస్తుంది
అత్యధిక మరియు అత్యల్ప విలువల వల్ల సగటు సులభంగా ప్రభావితమవుతుంది. పైన పేర్కొన్న ఆదాయ ఉదాహరణలో, అధికశాతం 5–8 మధ్య ఉన్నప్పటికీ, 50 అనే విలువ వల్ల సగటు గణనీయంగా పెరిగిపోతుంది.

2. ప్రామాణిక విచలనం మరియు వైవిధ్యంపై ప్రభావం చూపుతుంది
విచలన గణనలలో సగటు నుండి వర్గ భేదాలు ఉంటాయి కాబట్టి, విపరీత విలువలు (outliers) విచలనాన్ని మరియు ప్రామాణిక విచలనాన్ని పెంచి, డేటా వాస్తవానికి ఉన్నదానికంటే ఎక్కువగా "విస్తరించి" ఉన్నట్లుగా కనిపించేలా చేస్తాయి.

3. రిగ్రెషన్ మరియు మెషిన్ లెర్నింగ్ మోడళ్లను కలవరపరచడం
లీనియర్ రిగ్రెషన్‌లో, అవుట్‌లయర్‌లు రిగ్రెషన్ లైన్‌ను వక్రీకరించగలవు, దీనివల్ల చాలా వరకు డేటాకు అంచనాలు సరిగా ఉండవు. కొన్ని అల్గారిథమ్‌లలో, అవుట్‌లయర్‌లు మోడల్ ఓవర్‌ఫిట్ అవ్వడానికి కారణం కావచ్చు లేదా శిక్షణా పారామీటర్‌లను ప్రభావితం చేయవచ్చు.

4. ప్రభావ పరికల్పన పరీక్ష
పారామెట్రిక్ పరీక్షలలో తరచుగా ఉపయోగించే సాధారణత మరియు వైవిధ్య సజాతీయత యొక్క అంచనాలను విపరీత విలువలు ఉల్లంఘించగలవు, తద్వారా గణాంక నిర్ధారణలు పక్షపాతపూరితంగా మారతాయి.

అయితే, అసాధారణ లావాదేవీలు కూడా ముఖ్యమైన సంకేతాలు కావచ్చు. మోసాలను గుర్తించడంలో, మనం కచ్చితంగా వెతకాల్సింది అసాధారణ లావాదేవీల కోసమే. ఆరోగ్య సంరక్షణలో, గణనీయంగా భిన్నమైన ల్యాబ్ ఫలితాలు ఒక తీవ్రమైన వైద్య పరిస్థితిని సూచించగలవు.

అవుట్‌లయర్‌లను ఎలా గుర్తించాలి

సరైన పద్ధతి అంటూ ఏదీ లేదు. అసాధారణ విలువలను గుర్తించడం అనేది తరచుగా సందర్భం, డేటా రకం మరియు విశ్లేషణ లక్ష్యాలపై ఆధారపడి ఉంటుంది. ఇక్కడ కొన్ని సాధారణ పద్ధతులు ఉన్నాయి:

చదవండి  గణాంకాలలో డేటా సేకరణ పద్ధతులు

1. దృశ్యీకరణ: బాక్స్‌ప్లాట్ మరియు స్కాటర్‌ప్లాట్
– అవుట్‌లయర్‌లను గుర్తించడానికి బాక్స్‌ప్లాట్‌లు చాలా ప్రాచుర్యం పొందాయి. బాక్స్‌ప్లాట్‌లో, విస్కర్ బాక్స్ వెలుపల ఉండే పాయింట్‌లను సాధారణంగా అవుట్‌లయర్‌లుగా గుర్తిస్తారు.
– రెండు చరరాశుల మధ్య సంబంధంలో, ఉదాహరణకు బరువు మరియు ఎత్తు మధ్య, ఉండే విపరీత విలువలను చూడటానికి స్కాటర్‌ప్లాట్‌లు సహాయపడతాయి.

దృశ్యీకరణ మొదటి దశగా ఉపయోగపడుతుంది, ఎందుకంటే ఇది వేగవంతమైనది మరియు సహజమైనది.

2. IQR (ఇంటర్‌క్వార్టైల్ రేంజ్) పద్ధతి
IQR పద్ధతిని తరచుగా ఏక చరరాశి డేటా (యూనివేరియేట్) కోసం ఉపయోగిస్తారు.
– Q1 (క్వార్టైల్ 1) మరియు Q3 (క్వార్టైల్ 3) లను లెక్కించండి
– IQR = Q3 − Q1
– దిగువ పరిమితి = Q1 − 1,5 × IQR
– ఎగువ పరిమితి = Q3 + 1,5 × IQR

ఈ పరిమితులకు వెలుపల ఉన్న విలువలను సాధారణంగా విపరీత విలువలుగా పరిగణిస్తారు. ఈ పద్ధతి సాపేక్షంగా పటిష్టమైనది, ఎందుకంటే ఇది విపరీత విలువల వల్ల పెద్దగా ప్రభావితం కాదు.

3. Z-స్కోరు (సగటు మరియు ప్రామాణిక విచలనం ఆధారంగా)
Z-స్కోరు అనేది ఒక విలువ సగటు నుండి ఎంత దూరంలో ఉందో ప్రామాణిక విచలనం యూనిట్లలో కొలుస్తుంది.
– z = (x − సగటు) / sd
|z| > 3 (కొన్నిసార్లు > 2,5) ఉన్న విలువలను తరచుగా అవుట్‌లయర్‌లుగా పరిగణిస్తారు.

బలహీనత: డేటాలో ఇప్పటికే పెద్ద అవుట్‌లయర్‌లు ఉంటే, మీన్ మరియు sd ప్రభావితమవుతాయి, తద్వారా గుర్తింపు తక్కువ కచ్చితంగా ఉంటుంది.

4. మోడల్-ఆధారిత మరియు బహుళచర పద్ధతులు
బహుళ చరరాశుల డేటా విషయంలో, విపరీత విలువలు ఎల్లప్పుడూ కేవలం ఒకే కాలమ్‌లో కాకుండా, అనేక చరరాశుల కలయికలో కనిపిస్తాయి.
– బహుళ చరరాశి అవుట్‌లయర్‌లను గుర్తించడానికి మహాలనోబిస్ దూరాన్ని తరచుగా ఉపయోగిస్తారు.
– మెషిన్ లెర్నింగ్‌లో ఐసోలేషన్ ఫారెస్ట్, లోకల్ అవుట్‌లియర్ ఫ్యాక్టర్ (LOF), లేదా వన్-క్లాస్ SVM వంటి విధానాలు ఉన్నాయి.

ఈ పద్ధతి పెద్ద మరియు సంక్లిష్టమైన డేటాసెట్‌లకు, ఉదాహరణకు ఆర్థిక లావాదేవీలలోని అసాధారణతలను గుర్తించడానికి అనుకూలంగా ఉంటుంది.

మీరు ఒక విలక్షణ విలువను కనుగొంటే ఏమి చేయాలి?

వాటిని కేవలం తొలగించడం ఉత్తమమైన చర్య కాదు. సాధారణంగా, అసాధారణ ఫైళ్లను నిర్వహించే ప్రక్రియలో అనేక దశలు ఉంటాయి:

1. డేటా ధృవీకరణ
– తప్పుగా నమోదు చేసిన వివరాలు, పునరావృతం లేదా తప్పు యూనిట్లు ఉన్నాయేమో తనిఖీ చేయండి.
– అసలు డేటా మూలంతో (ఉదా. ఫారమ్‌లు, సెన్సార్ లాగ్‌లు లేదా మాన్యువల్ రికార్డులు) పోల్చండి.

2. సందర్భాన్ని అర్థం చేసుకోండి
– ఈ డొమైన్‌లో విపరీత విలువలు అర్థవంతంగా ఉన్నాయా?
– ఉదాహరణకు, మానవ శరీర ఉష్ణోగ్రత 50°C అనేది దాదాపు ఖచ్చితంగా తప్పు; కానీ 50 మిలియన్ల ఆదాయం సహేతుకంగా ఉండవచ్చు.

చదవండి  షరతులతో కూడిన సంభావ్యత యొక్క ప్రాథమిక అంశాలు

3. విశ్లేషణ యొక్క ఉద్దేశ్యాన్ని నిర్ధారించండి
– “సాధారణ” ప్రవర్తనను అర్థం చేసుకోవడమే లక్ష్యం అయితే, విలక్షణ ప్రవర్తనలు ఆధిపత్యం చెలాయించకుండా నిరోధించడానికి వాటిని నియంత్రించాల్సి రావచ్చు.
– అరుదైన సంఘటనలను (మోసం, యంత్ర వైఫల్యం) కనుగొనడమే లక్ష్యం అయితే, విపరీత విలువలపై ప్రధానంగా దృష్టి సారిస్తారు.

4. నిర్వహణ వ్యూహాన్ని ఎంచుకోండి
కొన్ని సాధారణ ఎంపికలు:
– తొలగింపు: విలక్షణ విలువ ఒక దోషమని మరియు ప్రాతినిధ్యం వహించదని నిరూపించబడినప్పుడు ఇది జరుగుతుంది.
– డేటా పరివర్తన: ఉదాహరణకు, వక్రంగా ఉన్న డేటా కోసం లాగ్ పరివర్తన.
– విన్సోరైజింగ్ / క్యాపింగ్ : విపరీత విలువలను నిర్దిష్ట పర్సెంటైల్స్‌కు (ఉదా. p1 మరియు p99) పరిమితం చేయడం.
– పటిష్టమైన పద్ధతులను ఉపయోగించండి: మీడియన్, IQR, రోబస్ట్ రిగ్రెషన్, లేదా అవుట్‌లయర్-రెసిస్టెంట్ మోడల్స్.
– ప్రత్యేక విశ్లేషణ: కొన్నిసార్లు అవుట్‌లయర్‌లను ప్రత్యేక సందర్భాలుగా విశ్లేషించడం మరింత సముచితం.

ముఖ్యంగా, విశ్లేషణ పారదర్శకంగా మరియు జవాబుదారీగా ఉండేలా నిర్ణయాలను తప్పనిసరిగా నమోదు చేయాలి.

విపరీత విలువలు: సమస్యనా లేక విలువైన సమాచారమా?

విపరీత విలువలు గణాంక సారాంశాలను వక్రీకరించగలవు కాబట్టి, వాటిని తరచుగా "అనవసరమైన సమాచారం"గా పరిగణిస్తారు. అయితే, చాలా సందర్భాలలో, ఈ విపరీత విలువలే కొత్త అంతర్దృష్టులకు మార్గం చూపుతాయి: ఉదాహరణకు, ఒక ఉన్నత శ్రేణి వినియోగదారుల విభాగం ఉనికి, శ్రద్ధ అవసరమయ్యే రోగి పరిస్థితి, ఉత్పత్తి ప్రక్రియలో ఒక కొత్త దశ, లేదా సంభావ్య మోసం వంటివి. అందువల్ల, విపరీత విలువలను వెంటనే కొట్టిపారేయకుండా, దర్యాప్తు చేయవలసిన అంశాలుగా పరిగణించాలి.

ముగింపు

గణాంకాలలో, అవుట్‌లయర్ అంటే డేటా యొక్క సాధారణ నమూనా నుండి గణనీయంగా విచలనం చెందే విలువ. ఒక డేటాసెట్‌లోని లోపాలు, సహజ వైవిధ్యం, ప్రక్రియ మార్పులు లేదా సమూహాల మధ్య తేడాల కారణంగా అవుట్‌లయర్‌లు ఏర్పడవచ్చు. వాటి ప్రభావం సగటు, వైవిధ్యం, గణాంక పరీక్షలు మరియు అంచనా నమూనాలపై గణనీయంగా ఉంటుంది. విజువలైజేషన్, IQR పద్ధతులు, z-స్కోర్‌లు, బహుళచర విధానాలు మరియు మెషిన్ లెర్నింగ్ ద్వారా కూడా అవుట్‌లయర్‌లను గుర్తించవచ్చు. వీటిని నిర్వహించేటప్పుడు సందర్భం మరియు లక్ష్యాలను పరిగణనలోకి తీసుకోవాలి: ధృవీకరించడం, కారణాలను అర్థం చేసుకోవడం, ఆపై విలువలను తొలగించడం, మార్చడం, పరిమితం చేయడం లేదా పటిష్టమైన పద్ధతులను ఉపయోగించడం వంటి వ్యూహాన్ని ఎంచుకోవాలి.

సరైన అవగాహనతో, అవుట్‌లయర్‌లు కేవలం “బేసి సంఖ్యలు” మాత్రమే కాదు, అవి డేటా ఆధారిత విశ్లేషణ మరియు నిర్ణయాల నాణ్యతను మెరుగుపరచగల గణాంక పద్ధతిలోని ముఖ్యమైన అంశాలు.

వ్యాఖ్యానించండి