දත්ත ව්යාප්තියේ විචලනය සහ සම්මත අපගමනය විශ්ලේෂණය කිරීම
සංඛ්යාලේඛන වලදී, දත්ත ව්යාප්තිය තේරුම් ගැනීම මධ්යන්යය හෝ මධ්යන්යය වැනි මධ්ය අගයන් තේරුම් ගැනීම තරම්ම වැදගත් වේ. දත්ත කට්ටල දෙකකට එකම සාමාන්යයක් තිබිය හැකි නමුත්, ඒවායේ ව්යාප්තිය බෙහෙවින් වෙනස් ය: එකක් සාමාන්යය වටා තදින් පොකුරු කළ හැකි අතර අනෙක පුළුල් ලෙස පැතිර යා හැකිය. විචලනය සහ සම්මත අපගමනය පැමිණෙන්නේ මෙහිදීය - ඒවා දත්ත එහි මධ්ය අගයෙන් කොපමණ ප්රමාණයක් වෙනස් වේද යන්න පිළිබඳ ප්රධාන මිනුම් වේ. මෙම ලිපියෙන් ඒවායේ සංකල්ප, සූත්ර, අර්ථකථන සහ දත්ත විශ්ලේෂණයේදී ඒවායේ යෙදුමේ උදාහරණ සාකච්ඡා කෙරේ.
1. දත්ත ව්යාප්තිය වැදගත් වන්නේ ඇයි?
දත්ත විසරණය අනුකූලතාව සහ අවදානම පිළිබඳ තොරතුරු සපයයි. උදාහරණයක් ලෙස, පරීක්ෂණ ලකුණු සන්දර්භය තුළ, A සහ B පන්ති සඳහා සාමාන්යය 80 විය හැකිය. කෙසේ වෙතත්, A පන්තියේ ලකුණු වල විචලනය කුඩා නම්, බොහෝ සිසුන් ඒ හා සමානව ක්රියා කරයි. අනෙක් අතට, B පන්තියේ ලකුණු වල විචලනය විශාල නම්, සමහර සිසුන්ට ඉතා ඉහළ ලකුණු ඇති අතර අනෙක් අයට ඉතා අඩු ලකුණු ඇති බව පෙනේ. ව්යාපාරයේදී, විකුණුම් දත්ත විසුරුවා හැරීම ආදායම් ස්ථායිතාව පෙන්නුම් කරයි; මූල්යමය වශයෙන්, ආයෝජන ප්රතිලාභ විසුරුවා හැරීම අවදානම් මට්ටම පෙන්නුම් කරයි.
විචලනය සහ සම්මත අපගමනය තේරුම් ගැනීමෙන්, තීරණ ගන්නන්ට:
– ක්රියාවලියක් ස්ථායීද නැද්ද යන්න තක්සේරු කරන්න (උදා: කර්මාන්තශාලා නිෂ්පාදනය).
- කණ්ඩායම් අතර අනුකූලතාව සංසන්දනය කිරීම (උදා: ඉගෙනුම් ක්රම දෙකක්).
- සමාලෝචනය කළ යුතු බාහිර දත්ත හඳුනා ගැනීම.
- අනාවැකි සහ ආකෘතිවල අවිනිශ්චිතතාව ඇස්තමේන්තු කිරීම.
2. විචලනය පිළිබඳ මූලික සංකල්පය
විචලනය යනු මධ්යන්යයෙන් එක් එක් දත්ත කට්ටලයේ සාමාන්ය වර්ග අපගමනය මනිනු ලබයි. අපගමනය යනු දත්ත අගයන් සහ මධ්යන්යය අතර වෙනසයි. බොහෝ අගයන් මධ්යන්යයෙන් බොහෝ දුරින් තිබේ නම්, විචලනය විශාල වනු ඇත. අගයන් මධ්යන්යයට ආසන්න නම්, විචලනය කුඩා වනු ඇත.
\(\bar{x}\) මධ්යන්යයක් සහිත දත්ත \(x_1, x_2, …, x_n\) ඇතැයි සිතමු. එක් එක් දත්තවල අපගමනය \(x_i – \bar{x}\) වේ. කෙසේ වෙතත්, අපගමනයන් සෘජුවම එකතු කළහොත්, ප්රතිඵලය සැමවිටම ශුන්ය වේ, මන්ද ඒවා එකිනෙක අවලංගු කරන ධන සහ සෘණ අපගමනයන් ඇත. මෙය ජය ගැනීම සඳහා, අපගමනයන් සියල්ල ධන වන පරිදි වර්ග කර ඇත. විචලනය උපදින්නේ මෙහිදීය.
අ) ජනගහන විචලනය
දත්ත සමස්ත ජනගහනය නියෝජනය කරන බව සලකන්නේ නම්, ජනගහන විචලනය මෙසේ ලියා ඇත:
\[
\sigma^2 = \frac{\sum_{i=1}^{N}(x_i – \mu)^2}{N}
\]
කොහෙද:
– \(N\) යනු ජනගහන දත්ත ගණනයි,
– \(\mu\) යනු ජනගහන මධ්යන්යය,
– \(\sigma^2\) යනු ජනගහන විචලනයයි.
b) නියැදි විචලනය
දත්ත විශාල ජනගහනයකින් ලබාගත් නියැදියක් නම්, නියැදි විචලනය භාවිතා කරනු ලැබේ:
\[
s^2 = \frac{\sum_{i=1}^{n}(x_i – \bar{x})^2}{n-1}
\]
භාජකය \(n-1\) බෙසල් නිවැරදි කිරීම ලෙස හඳුන්වන අතර, ජනගහනය සඳහා විචල්යතා ඇස්තමේන්තුව අපක්ෂපාතී බව සහතික කිරීමට භාවිතා කරයි. අත්යවශ්යයෙන්ම, නියැදි මධ්යන්යය දත්ත වලින්ම ගණනය කරන බැවින්, "නිදහසේ අංශක නැතිවීමක්" ඇති බැවින්, භාජකය ඒ අනුව සකස් කරනු ලැබේ.
3. සම්මත අපගමනය: විචලනයේ මුල
විචල්යතාවයට එක් ප්රායෝගික අඩුපාඩුවක් ඇත: එහි ඒකක දත්තවල ඒකකවල වර්ගය වේ. දත්ත "rupiah" හි තිබේ නම්, විචලනය "rupiah²" හි ඇත, එය කෙලින්ම අර්ථ නිරූපණය කිරීමට අපහසුය. එබැවින්, අපි සම්මත අපගමනය භාවිතා කරමු, එය විචලනයේ වර්ගමූලය වේ.
අ) ජනගහන සම්මත අපගමනය
\[
\sigma = \sqrt{\sigma^2}
\]
b) සාම්පල සම්මත අපගමනය
\[
s = \sqrt{s^2}
\]
සම්මත අපගමනයට මුල් දත්තවලට සමාන ඒකක ඇති බැවින් එය තේරුම් ගැනීම පහසු කරයි. ඉහළ සම්මත අපගමනයකින් වඩාත් පැතිරුණු දත්ත පෙන්නුම් කරයි; අඩු සම්මත අපගමනයකින් වඩාත් ඝන දත්ත කට්ටලයක් පෙන්නුම් කරයි.
4. සරල ගණනය කිරීමේ උදාහරණය
උදාහරණයක් ලෙස, පරීක්ෂණ ලකුණු දත්ත: 70, 75, 80, 85, 90.
1) සාමාන්යය ගණනය කරන්න:
\[
\බාර්{x} = \frac{70+75+80+85+90}{5} = 80
\]
2) මධ්යන්යයෙන් එක් එක් අගයේ අපගමනය ගණනය කරන්න:
– 70: \(70-80=-10\)
– 75: \(75-80=-5\)
– 80: \(80-80=0\)
– 85: \(85-80=5\)
– 90: \(90-80=10\)
3) අපගමනය වර්ග කරන්න:
– 100, 25, 0, 25, 100
4) එකතු කරන්න:
\[
\එකතුව (x_i-\තීරුව{x})^2 = 250
\]
5) නියැදි විචලනය:
\[
s^2 = \frac{250}{5-1} = 62.5
\]
6) නියැදි සම්මත අපගමනය:
\[
s = \sqrt{62.5} \ආසන්න වශයෙන් 7.91
\]
අර්ථ නිරූපණය: සාමාන්ය ලකුණු 80 ක් වන අතර, "සාමාන්යයෙන්" ලකුණු සාමාන්යයෙන් ලකුණු 7-8 කින් පමණ අපගමනය වේ.
5. විචලනය සහ සම්මත අපගමනය අර්ථ නිරූපණය කිරීම
විචලනය සහ සම්මත අපගමනය සංඛ්යා පමණක් නොවේ; ඒවා සන්දර්භය තුළ අර්ථ නිරූපණය කළ යුතුය.
– කුඩා සම්මත අපගමනය: ඉහළ අනුකූලතාව. උදාහරණයක් ලෙස, නිෂ්පාදන ප්රමාණයෙන් ඉතා කුඩා සම්මත අපගමනයක් සහිත නිෂ්පාදන ක්රියාවලියක් ස්ථාවර ගුණාත්මක බවක් පෙන්නුම් කරයි.
– විශාල සම්මත අපගමනය: ඉහළ විචලනය. ආයෝජනය කිරීමේදී, ප්රතිලාභවල ඉහළ සම්මත අපගමනය යනු ඉහළ අස්ථාවරත්වයක් (ඉහළ අවදානමක්) යන්නයි.
– කණ්ඩායම් අතර සංසන්දනය: කණ්ඩායම් දෙකකට එකම මධ්යන්යයක් ඇති නමුත් වෙනස් සම්මත අපගමනයන් තිබේ නම්, කුඩා අපගමනය සහිත කාණ්ඩය වඩාත් සමජාතීය වේ.
කෙසේ වෙතත්, සම්මත අපගමනය බාහිර අගයන්ට සංවේදී බව මතක තබා ගැනීම වැදගත්ය. තනි ආන්තික අගයක් මඟින් විචලනය සහ සම්මත අපගමනය සැලකිය යුතු ලෙස වැඩි කළ හැකිය. එබැවින්, බෙදාහැරීමේ විශ්ලේෂණය බොහෝ විට දෘශ්යකරණයන් (හිස්ටෝග්රෑම්, කොටු සටහන්) හෝ IQR (අන්තර් කාර්තු පරාසය) වැනි ශක්තිමත් මිනුම් මගින් අනුපූරක වේ.
6. සාමාන්ය ව්යාප්තිය සහ ආනුභවික රීති සමඟ සම්බන්ධතාවය
සාමාන්ය ව්යාප්තියක (සීනු වක්රය), සම්මත අපගමනය ඉතා ප්රබල අර්ථයක් ඇත. බොහෝ විට භාවිතා වන ප්රායෝගික රීතියක් ඇත:
– දත්ත වලින් 68% ක් පමණ \(\bar{x} \pm 1s\) පරාසයේ ඇත.
– දත්ත වලින් 95% ක් පමණ \(\bar{x} \pm 2s\) පරාසයේ ඇත.
– දත්ත වලින් 99,7% ක් පමණ \(\bar{x} \pm 3s\) පරාසයේ ඇත.
මෙම රීතිය ඉක්මන් අර්ථකථන සිදු කිරීමට උපකාරී වේ, උදාහරණයක් ලෙස අගයක් "අස්වාභාවික" ද නැතහොත් තවමත් සාමාන්ය පරාසය තුළ ද යන්න තක්සේරු කිරීම.
7. විවිධ ක්ෂේත්රවල යෙදුම්
1) අධ්යාපනය: ශිෂ්ය ශ්රේණිවල ව්යාප්තිය නිරීක්ෂණය කිරීම. කුඩා අපගමනයන් සාධාරණ ඉගෙනුම් ප්රතිඵල පෙන්නුම් කරන අතර, විශාල අපගමනයන් අවබෝධයේ හිඩැස් පෙන්නුම් කළ හැකිය.
2) කර්මාන්තය: තත්ත්ව පාලනය. නිෂ්පාදන අනුකූලතාව ඇගයීමට විචලනය භාවිතා කරයි.
3) මූල්ය: කොටස් මිල අස්ථාවරත්වය, කළඹ ප්රතිලාභ සහ ආයෝජන අවදානම මනිනු ලබයි.
4) සෞඛ්යය: රෝගී ජනගහනයක රුධිර පීඩනය, සීනි මට්ටම හෝ වෙනත් සායනික දර්ශකවල වෙනස්කම් නිරීක්ෂණය කිරීම.
5) සමාජ පර්යේෂණ: සමීක්ෂණ ප්රතිචාරවල විෂමජාතීයතාවය සහ ප්රතිචාර දක්වන්නන්ගේ ලක්ෂණවල විවිධත්වය තක්සේරු කිරීම.
8. පොදු වැරදි සහ ප්රායෝගික උපදෙස්
සමහර පොදු වැරදි:
– දත්ත සම්පූර්ණ ජනගහනය වුවද නියැදි විචලනය (භාජකය \(n-1\)) භාවිතා කිරීම, නැතහොත් අනෙක් අතට.
– විචලනය එහි වර්ග ඒකක සලකා බැලීමෙන් තොරව අර්ථ නිරූපණය කරන්න; අර්ථ නිරූපණය සඳහා සම්මත අපගමනය භාවිතා කිරීම ආරක්ෂිත වේ.
- බාහිර සාධක නොසලකා හරින්න; පළමුව දත්ත පරීක්ෂා කිරීම වඩාත් සුදුසුය.
– සාමාන්යකරණයකින් තොරව විවිධ පරිමාණයන් සහිත දත්ත අතර සම්මත අපගමනයන් සංසන්දනය කරන්න; සමහර අවස්ථාවලදී, වඩාත් සාධාරණ සංසන්දනයක් සඳහා විචලන සංගුණකය (CV) එනම් \(CV = \frac{s}{\bar{x}}\times 100\%\) භාවිතා කරන්න.
වසා දැමීම
විචලනය සහ සම්මත අපගමනය දත්ත ව්යාප්තිය තේරුම් ගැනීම සඳහා මූලික මෙවලම් වේ. විචලනය ශක්තිමත් ගණිතමය පදනමක් සපයන අතර, සම්මත අපගමනය මුල් දත්ත වලට සමාන බැවින් අර්ථ නිරූපණය කිරීමට පහසු මිනුමක් සපයයි. මෙම මිනුම් දෙක භාවිතා කිරීමෙන්, දත්ත කට්ටල අතර බෙදා හැරීමේ ලක්ෂණවල අනුකූලතාව, අවදානම සහ වෙනස්කම් අපට වඩාත් පැහැදිලිව තක්සේරු කළ හැකිය. දත්ත විශ්ලේෂණ භාවිතයේදී, දත්ත පිළිබඳ සම්පූර්ණ චිත්රයක් ලබා දීමට සහ වඩාත් දැනුවත් තීරණ ගැනීමට මධ්යම ප්රවණතාවයේ සහ දෘශ්යකරණයේ මිනුම් සමඟ ඒකාබද්ධව විචලනය සහ සම්මත අපගමනය වඩාත් හොඳින් භාවිතා වේ.
ඔබට අවශ්ය නම්, මට වඩාත් සංකීර්ණ ගණනය කිරීමේ උදාහරණ (උදා: සමූහගත දත්ත) එකතු කළ හැකිය, නැතහොත් සම්මත අපගමනය z-ලකුණු සහ බාහිර හඳුනාගැනීම සමඟ ඇති සම්බන්ධතාවය පැහැදිලි කළ හැකිය.