සංඛ්යාලේඛනවල හරස් වලංගුකරණ ක්රමය
සංඛ්යාලේඛන සහ දත්ත විද්යාවේදී, විශාලතම අභියෝගයක් වන්නේ ආකෘතියක් එය පුහුණු කරන ලද දත්ත මත හොඳින් ක්රියා කිරීම පමණක් නොව, නව, කලින් නොදුටු දත්ත මත හොඳින් ක්රියා කරන බව සහතික කිරීමයි. මෙම ගැටළුව බොහෝ විට සාමාන්යකරණය ලෙස හැඳින්වේ. හරස් වලංගුකරණය පැමිණෙන්නේ මෙහිදීය: තනි දත්ත කට්ටලයක් භාවිතා කරමින් තනි ඇගයීමකට වඩා සාධාරණව සහ ස්ථාවරව ආකෘති කාර්ය සාධනය මැනීම සඳහා නිර්මාණය කර ඇති ආකෘති ඇගයීමේ ක්රමයකි.
හරස් වලංගුකරණය අවශ්ය වන්නේ ඇයි?
අපි පුරෝකථන ආකෘතියක් ගොඩනඟන විට - උදාහරණයක් ලෙස, නිවාස මිල පුරෝකථනය කිරීමට ප්රතිගාමී ආකෘතියක් හෝ ස්පෑම් හඳුනා ගැනීමට වර්ගීකරණ ආකෘතියක් - අපි සාමාන්යයෙන් දත්ත කොටස් දෙකකට බෙදන්නෙමු: පුහුණු කට්ටලයක් සහ පරීක්ෂණ කට්ටලයක්. ආකෘතිය පුහුණු දත්ත මත පුහුණු කර පසුව පරීක්ෂණ දත්ත මත ඇගයීමට ලක් කෙරේ. මෙම ප්රවේශය සරලයි, නමුත් එහි අඩුපාඩුවක් තිබේ: ඇගයීමේ ප්රතිඵල දත්ත බෙදී යන ආකාරය මත බෙහෙවින් රඳා පවතී. පරීක්ෂණ දත්ත "පහසු" නම්, කාර්ය සාධනය ඉහළ බව පෙනේ; පරීක්ෂණ දත්ත "දැඩි" නම්, කාර්ය සාධනය අඩු බව පෙනේ.
හරස් වලංගුකරණය විවිධ දත්ත කට්ටල මත බහු පුහුණු සහ පරීක්ෂණ ක්රියාවලීන් සිදු කිරීමෙන් සහ පසුව ප්රතිඵල සාමාන්යකරණය කිරීමෙන් තනි දත්ත කට්ටලයක් මත යැපීම අඩු කරයි. මෙය සැබෑ ලෝක තත්වයන් වඩාත් නියෝජනය කරන කාර්ය සාධන ඇස්තමේන්තු වලට හේතු වේ.
හරස් වලංගුකරණයේ මූලික සංකල්ප
හරස් වලංගුකරණයේ සාරය වන්නේ දත්ත කොටස් කිහිපයකට (නැමීම්) බෙදීමයි. සෑම පුනරාවර්තනයකදීම, ආකෘතිය පුහුණු කිරීම සඳහා සමහර නැමීම් භාවිතා කරන අතර, ආකෘතිය පරීක්ෂා කිරීම සඳහා එක් නැමීමක් භාවිතා කරයි. සෑම නැමීමක්ම පරීක්ෂණ දත්ත ලෙස භාවිතා කරන තෙක් මෙම ක්රියාවලිය නැවත සිදු කෙරේ. එක් එක් පුනරාවර්තනයෙන් ලැබෙන ඇගයීම් ලකුණු (සාමාන්යයෙන් මධ්යන්යය සහ සමහර විට සම්මත අපගමනය සමඟ) ඒකාබද්ධ කර ආකෘතියේ ක්රියාකාරිත්වය පිළිබඳ දළ විශ්ලේෂණයක් ලබා දෙනු ලැබේ.
උදාහරණයක් ලෙස, k=5 සමඟ k-fold cross validation හි, දත්ත නැමීම් 5 කට බෙදා ඇත. පළමු පුනරාවර්තනය: පරීක්ෂණය ලෙස 1 නැමීම, පුහුණුව ලෙස 2–5 නැමීම. දෙවන පුනරාවර්තනය: පරීක්ෂණය ලෙස 2 නැමීම, සහ එසේ 5 නැමීම දක්වා.
හරස් වලංගුකරණයේ පොදු වර්ග
1. රඳවා තබා ගැනීමේ වලංගුකරණය (දුම්රිය-පරීක්ෂණ බෙදීම)
තාක්ෂණිකව "නැවත නැවත" හරස්-වලංගුකරණය සිදු නොවුනත්, රඳවා ගැනීමේ ක්රමය බොහෝ විට මූලික වලංගුකරණ පියවරක් ලෙස සැලකේ. දත්ත එක් වරක් බෙදී යයි, උදාහරණයක් ලෙස, 80% පුහුණුව සහ 20% පරීක්ෂාව. වාසිය නම් එය වේගවත් හා සරල වීමයි, නමුත් අවාසිය නම් එය තනි බෙදීමක් මත රඳා පවතින බැවින් ප්රතිඵලවල ඉහළ විචලනයකි.
මෙම ක්රමය සාමාන්යයෙන් භාවිතා කරනුයේ දත්ත ඉතා විශාල වූ විටය, එබැවින් එක් අංශයක් පවා ප්රමාණවත් ලෙස නියෝජනය වේ.
2. K-Fold හරස් වලංගුකරණය
මෙය වඩාත් ජනප්රිය හරස් වලංගුකරණ ආකාරයයි. k පරාමිතිය බොහෝ විට 5 හෝ 10 ලෙස තෝරා ගනු ලබන්නේ එය පරිගණක පිරිවැය සහ ඇස්තමේන්තු ගුණාත්මකභාවය සමතුලිත කිරීමට සලකනු ලබන බැවිනි.
අතිරික්තය:
- දත්ත වඩාත් කාර්යක්ෂමව භාවිතා කිරීම (සෑම දත්තයක්ම පුහුණු කිරීමේ සහ පරීක්ෂා කිරීමේ කොටසක් බවට පත්වේ).
- කාර්ය සාධන ඇස්තමේන්තු රඳවා තබා ගැනීමට වඩා ස්ථායී වේ.
හිඟය:
– ආකෘතිය k වාර ගණනක් පුහුණු කරන නිසා වැඩි කාලයක් ගතවේ.
– දත්ත ඉතා විශාල නම් හෝ ආකෘතිය ඉතා සංකීර්ණ නම්, පරිගණක පිරිවැය ඉහළ විය හැකිය.
3. ස්ථරීකෘත K-ෆෝල්ඩ් හරස් වලංගුකරණය
වර්ගීකරණ ගැටළු සඳහා, විශේෂයෙන් පන්ති අසමතුලිත නම් (උදා: 90% සෘණ, 10% ධන), නිත්ය k-fold මඟින් ඇලවූ පන්ති ව්යාප්ති සහිත නැමීම් ඇති කළ හැක. ස්ථරීකෘත k-fold මඟින් එක් එක් නැමීමේදී පන්තිවල අනුපාතය මුල් දත්තවල පන්තිවල අනුපාතයට ආසන්න වශයෙන් සමාන බව සහතික කරයි.
රෝග හඳුනාගැනීමේ ආකෘති, වංචා හෝ සුළුතර පන්තිය කුඩා වන වෙනත් අවස්ථා ඇගයීමේදී මෙය විශේෂයෙන් වැදගත් වේ.
4. නිවාඩු-එක-අවුට් හරස් වලංගුකරණය (LOOCV)
LOOCV හි, නැමීම් ගණන දත්ත ප්රමාණයට සමාන වේ (k = n). මෙයින් අදහස් කරන්නේ සෑම පුනරාවර්තනයකදීම, එක් නිරීක්ෂණයක් පමණක් පරීක්ෂණ දත්ත බවට පත්වන අතර ඉතිරිය පුහුණු දත්ත බවට පත්වන බවයි.
අතිරික්තය:
- සෑම පුනරාවර්තනයකදීම පුහුණුව සඳහා සියලුම දත්ත පාහේ භාවිතා වේ, එබැවින් ඇස්තමේන්තු නැඹුරුව කුඩා විය හැකිය.
හිඟය:
– විශාල දත්ත කට්ටල සඳහා පරිගණකමය වශයෙන් ඉතා මිල අධිකය.
– පරීක්ෂණ කට්ටලය පුනරාවර්තනයකට එක් ලක්ෂයක් පමණක් වන බැවින්, සමහර ආකාරයේ ගැටළු වලදී ඇස්තමේන්තු විචලනය ඉහළ විය හැක.
ඉතා කුඩා දත්ත ප්රමාණයක් ඇති විට LOOCV බොහෝ විට භාවිතා වේ, උදාහරණයක් ලෙස කුඩා නියැදි ප්රමාණයක් සහිත පර්යේෂණ.
5. නැවත නැවත සිදු කරන ලද K-Fold හරස් වලංගුකරණය
මෙම ක්රමය විවිධ (අහඹු) නැමීම් පැවරුම් සමඟ k-fold බහු වාරයක් පුනරාවර්තනය වේ. ඉලක්කය වන්නේ තනි නැමීම් පැවරුමක් මත යැපීම අඩු කර වඩාත් ස්ථාවර ඇස්තමේන්තු නිෂ්පාදනය කිරීමයි.
උදාහරණයක් ලෙස, "10 ගුණයකින් 3 වතාවක් පුනරාවර්තනය" යන්නෙන් අදහස් කරන්නේ 10 ගුණයකින් 3 වතාවක් ධාවනය කිරීමයි (මුළු පුහුණුවීම් සහ ඇගයීම් 30).
6. කාල ශ්රේණි හරස් වලංගුකරණය
කාල ශ්රේණි දත්ත සඳහා, සාම්ප්රදායික හරස් වලංගුකරණය සුදුසු නොවේ, මන්ද එය පුහුණු ක්රියාවලියට "අනාගතය කාන්දු කළ හැකි" බැවිනි. කාල ශ්රේණියේදී, තාවකාලික අනුපිළිවෙල ආරක්ෂා කළ යුතුය. එබැවින්, එවැනි ප්රවේශයන්:
– පෙරළෙන/ලිස්සා යන කවුළුව: ආරම්භක කාල පරිච්ඡේදයේදී පුහුණු කර ඊළඟ කාල පරිච්ඡේදයේදී පරීක්ෂා කරන්න, පසුව කවුළුව මාරු වේ.
– පුළුල් වන කවුළුව: පුහුණු දත්ත කාලයත් සමඟ වැඩි වන අතර, ඊළඟ කාල පරිච්ඡේදයේදී පරීක්ෂා කරනු ලැබේ.
මෙම ක්රමය මාසික විකුණුම් පුරෝකථනය, කොටස් මිල ගණන් හෝ තත්ය කාලීන සංවේදක සඳහා අදාළ වේ.
හරස් වලංගුකරණයේ ඇගයීම් මිනුම්
හරස් වලංගුකරණය යනු ඇගයීම් රාමුවක් පමණි; භාවිතා කරන මිනුම් ගැටළු වර්ගය මත රඳා පවතී:
– ප්රතිගමනය: MSE, RMSE, MAE, R-වර්ග.
– වර්ගීකරණය: නිරවද්යතාවය, නිරවද්යතාවය, නැවත කැඳවීම, F1-ලකුණු, ROC-AUC.
– අසමතුලිත වර්ගීකරණය: ROC-AUC, PR-AUC (නිරවද්යතාවය-නැවත කැඳවීම), සමබර නිරවද්යතාවය.
හරස් වලංගුකරණ ප්රතිඵල සාමාන්යයෙන් මෙට්රික් මධ්යන්යයක් සහ සම්මත අපගමනයක් ලෙස වාර්තා වේ (උදා: නිරවද්යතාවය 0,89 ± 0,03). සම්මත අපගමනය ආකෘතියේ ස්ථායිතාව තේරුම් ගැනීමට උපකාරී වේ.
ආකෘති තේරීම සහ පරාමිති සුසර කිරීම සඳහා හරස් වලංගුකරණය
හරස් වලංගුකරණයේ ප්රධාන භාවිතයක් වන්නේ ආකෘති තේරීම සහ අධි පරාමිති සුසර කිරීමයි. උදාහරණයක් ලෙස:
– k-NN හි k තෝරා ගැනීම.
– තීරණ ගසෙහි උපරිම ගැඹුර තෝරන්න.
– රිජ්/ලාසෝ ප්රතිගමනයේ විධිමත් කිරීමේ පරාමිතීන් තීරණය කරන්න.
– SVM හි C සහ ගැමා නිර්ණය කරන්න.
හොඳ භාවිතයේදී, සුසර කිරීමේ ක්රියාවලිය හරස් වලංගුකරණය භාවිතයෙන් පුහුණු දත්ත මත සිදු කරනු ලබන අතර, අවසාන පරීක්ෂණ දත්ත අවසාන ඇගයීම සඳහා වෙන වෙනම තබා ඇත. මෙය ඇගයීම් දත්තවලට ආකෘතිය අධික ලෙස සවි කිරීම හේතුවෙන් "අධි-ශුභවාදය" වළක්වයි.
වඩාත් දැඩි ප්රවේශයක් කැදැලි හරස් වලංගුකරණය ලෙස හැඳින්වේ, එය හරස් වලංගුකරණය තුළ හරස් වලංගුකරණයයි: පිටත ලූපය ඇගයීම සඳහා වන අතර අභ්යන්තර ලූපය සුසර කිරීම සඳහා වේ. මෙය පර්යේෂණවල ජනප්රිය වන්නේ එය වඩාත් අපක්ෂපාතී කාර්ය සාධන ඇස්තමේන්තු සපයන බැවිනි.
හරස් වලංගුකරණයේ වාසි සහ සීමාවන්
ප්රධාන වාසි:
1. තනි අංශයකට වඩා ස්ථාවර කාර්ය සාධන ඇස්තමේන්තු සපයයි.
2. විශේෂයෙන් දත්ත කට්ටලය කුඩා වන විට, දත්ත කාර්යක්ෂමව භාවිතා කරන්න.
3. වඩාත් සාමාන්ය ආකෘතියක් තෝරා ගැනීමට උපකාරී වන අතර අධික ලෙස සවි කිරීමේ අවදානම අඩු කරයි.
සීමාවන්:
1. පුහුණුව බොහෝ වාරයක් පුනරාවර්තනය වන විට ගණනය කිරීමේ පිරිවැය වැඩි වේ.
2. පෙර සැකසුම් නිසි ලෙස සිදු නොකළහොත් දත්ත කාන්දුවීම් තවමත් සිදුවිය හැක.
3. සමූහගත දත්ත සඳහා (උදාහරණයක් ලෙස, වාර්තා කිහිපයක් ඇති රෝගී දත්ත), කණ්ඩායම් k-fold වැනි විශේෂ ක්රමයක් අවශ්ය වේ, එවිට එක් පුද්ගලයෙකු දුම්රියේ පෙනී සිට එකවර පරීක්ෂා නොකෙරේ.
හරස් වලංගුකරණය භාවිතා කිරීමේදී හොඳ පිළිවෙත්
ඇගයීමක් වලංගු වීමට නම්, වැදගත් මූලධර්ම කිහිපයක් අනුගමනය කළ යුතුය:
– සම්පූර්ණ දත්ත සඳහා එක් වරක් නොව, එක් එක් නැමීම තුළ පූර්ව සැකසුම් (සාමාන්යකරණය, ආරෝපණය, විශේෂාංග තේරීම) සිදු කරන්න. එසේ නොමැතිනම්, පරීක්ෂණ නැමීමෙන් තොරතුරු දුම්රිය නැමීමට කාන්දු විය හැකිය.
– අසමතුලිත පන්ති සමඟ වර්ගීකරණය සඳහා ස්ථරීකෘත k-fold භාවිතා කරන්න.
– අනුපිළිවෙල උල්ලංඝනය නොවන පරිදි කාල ශ්රේණි දත්ත සඳහා විශේෂ යෝජනා ක්රමයක් භාවිතා කරන්න.
- යෙදවීමට පෙර ආකෘතියේ අවසාන කාර්ය සාධනය තක්සේරු කිරීම ඔබේ ඉලක්කය නම්, අවසාන පරීක්ෂණ කට්ටලය පසෙකට දමන්න.
වසා දැමීම
හරස්-වලංගුකරණය යනු ආකෘති කාර්ය සාධනය වඩාත් සාධාරණව සහ ශක්තිමත්ව ඇගයීම සඳහා ව්යවහාරික සංඛ්යාලේඛන සහ යන්ත්ර ඉගෙනීමේ මූලික මෙවලමකි. නැවත නැවත දත්ත බෙදාගැනීම භාවිතා කිරීමෙන්, හරස්-වලංගුකරණය දුම්රිය-පරීක්ෂණ බෙදීම් තේරීම නිසා ඇතිවන පක්ෂග්රාහීත්වය අඩු කිරීමට උපකාරී වේ, අධික ලෙස ගැළපීම හඳුනා ගනී, සහ ආකෘති තේරීම සහ අධි පරාමිති සුසර කිරීම සඳහා සහාය වේ. පරිගණකමය පිරිවැය වැඩි වුවද, ප්රතිලාභ බොහෝ විට වටිනවා, විශේෂයෙන් දත්ත කට්ටලය කුඩා වන විට හෝ ආකෘති ප්රතිඵල මත පදනම් වූ තීරණ සැලකිය යුතු ප්රතිවිපාක ඇති විට. නිවැරදි ආකාරයේ හරස්-වලංගුකරණය තෝරා ගැනීමෙන් සහ හොඳම භාවිතයන් ක්රියාත්මක කිරීමෙන්, සැබෑ ලෝක දත්ත මත භාවිතා කිරීමට සූදානම් වඩාත් විශ්වාසදායක ආකෘති අපට ගොඩනගා ගත හැකිය.