Деректер режимін қалай анықтауға болады
Негізгі статистикада режим - орташа және медианамен қатар орталық үрдістің бір өлшемі. Режим көбінесе түсінуге оңай және есептеуге тез болғандықтан қолданылады, әсіресе деректер жиынтығында ең жиі кездесетін мәнді тапқымыз келгенде. Күнделікті өмірде режим ұғымын ең жиі сатып алынатын киім өлшемін, ең жиі қолданылатын көлік түрін, ең жоғары тест ұпайын және тіпті ең танымал өнімді анықтау үшін қолдануға болады. Бұл мақалада әртүрлі деректер түрлері үшін режимді қалай анықтау керектігі егжей-тегжейлі талқыланады: жеке деректер, топтастырылған деректер және бимодальды және мультимодальды деректер сияқты арнайы шарттар.
Режимді түсіну
Режим - ең жоғары жиіліктегі деректер мәні, яғни ол басқа мәндерге қарағанда жиі пайда болады. Режим сүйікті түстер немесе ең жиі таңдалатын тағам түрлері сияқты сандық (сандық) және сапалық (сандық) деректерге де жарамды.
Қарапайым мысал:
Деректер: 2, 3, 3, 4, 5
Ең жиі кездесетін мән 3 (екі рет пайда болады), сондықтан режим = 3.
Дегенмен, барлық деректердің режимі бола бермейді. Кейбір деректерде барлық мәндер бірдей жиі пайда болады, сондықтан режим болмайды. Сонымен қатар, кейбір деректерде бірнеше режим болады.
Режим түрлері
Есептеу қадамдарына кіріспес бұрын, режимдердің вариацияларын түсіну маңызды:
1. Унимодальды: ең жиі тек бір мән пайда болады (бір режим).
2. Бимодальды: екеуі де жиі кездесетін екі мән бар.
3. Мультимодальды: ең жиі кездесетін екіден көп мән бар.
4. Режимі жоқ: барлық мәндер бірдей жиілікте пайда болады.
Бұл режимдерді түсіну бізге деректерді дәлірек түсіндіруге көмектеседі.
Жеке деректердің режимін қалай анықтауға болады
Жеке деректер – аралықтарға топтастырылмаған, сол қалпында жазылған деректер. Жеке деректердің режимін табу қадамдары өте қарапайым:
Қадамдар:
1. Бақылауды жеңілдету үшін деректерді (міндетті емес) ең кішісінен ең үлкеніне қарай орналастырыңыз.
2. Әрбір мәннің пайда болу жиілігін есептеңіз.
3. Мода ретінде ең үлкен жиіліктегі мәнді анықтаңыз.
Мысал:
Тест ұпайларының деректері: 70, 80, 75, 80, 90, 80, 85, 75
Жиілік:
– 70: 1 рет
– 75: 2 рет
– 80: 3 рет
– 85: 1 рет
– 90: 1 рет
80 саны ең көп (3 рет) пайда болғандықтан, режим = 80.
Бимодальды мысал:
Деректер: 1, 2, 2, 3, 3, 4
2 және 3 жиіліктері екеуі де ең жоғары (2 есе), сондықтан мод = 2 және 3 (бимодальды).
Режимсіз мысал:
Деректер: 5, 6, 7, 8
Барлық мәндер бір рет пайда болады. Сондықтан, деректердің режимі жоқ.
Топталған деректердегі режимді қалай анықтауға болады
Іс жүзінде, деректердің үлкен көлемі әдетте жиілікті бөлу кестесі түрінде топтастырылған деректерге жинақталады, яғни деректер сынып аралықтарына топтастырылады (мысалы, 60–69, 70–79 және т.б.). Топтастырылған деректерде моданы белгілі бір саннан тікелей алуға болмайды, керісінше, мод класы арқылы анықталады және формуланы пайдаланып бағалауға болады.
1. Режим класын анықтаңыз
Мода класы - ең үлкен жиіліктегі клас аралығы.
Мысал кестесі:
| Мән аралығы | Жиілік |
|—|—:|
| 40–49 | 3 |
| 50–59 | 6 |
| 60–69 | 10 |
| 70–79 | 8 |
| 80–89 | 5 |
Ең жоғары жиілік 60–69 аралығында 10, сондықтан режим класы = 60–69.
2. Топтастырылған деректер формуласы арқылы режимді есептеу
Жиі қолданылатын топтастырылған деректер режимінің формуласы:
\[
Mo = L + \left(\frac{d_1}{d_1 + d_2}\right)\times p
\]
Ақпарат:
– Mo = режим (есептелген режим мәні)
– L = режим класының төменгі шеті
– p = сынып ұзындығы (аралық ені)
– d₁ = режим класының жиілігі − алдыңғы кластың жиілігі
– d₂ = режим класының жиілігі − келесі кластың жиілігі
Есептеу мысалы:
Алдыңғы кестеден:
– Режим класы: 60–69, жиілік = 10
– Алдыңғы сынып: 50–59, жиілік = 6
– Келесі класс: 70–79, жиілік = 8
Компоненттерді анықтаңыз:
– L = режим класының төменгі шегі = 59,5 (төменгі шегі 60 болғандықтан, төменгі шегі = 59,5)
– p = 10
– d₁ = 10 − 6 = 4
– d₂ = 10 − 8 = 2
Формулаға енгізіңіз:
\[
Мо = 59,5 + \left(\frac{4}{4+2}\right)\times 10
\]
\[
Мо = 59,5 + \left(\frac{4}{6}\right)\times 10
\]
\[
Ай = 59,5 + 6,67 = 66,17
\]
Сонымен, топтастырылған деректердің модасы ≈ 66,17-ге тең. Бұл 60–69 аралығындағы моданың мәнін бағалау.
Режимді табу кезінде жиі кездесетін қателіктер
Бұл режим қарапайым болып көрінгенімен, бірқатар жиі кездесетін қателіктер бар:
1. Режим әрқашан бар деп есептейік
Дегенмен, деректерде ең жиі кездесетін мәндер болмауы мүмкін.
2. Жиілікті мұқият есептемеу
Жеке деректерде жиілікті дұрыс есептемеу дұрыс емес режимді тудырады.
3. Режим класын дұрыс анықтамау
Топтастырылған деректерде режим класы ең үлкен жиілікке ие болуы керек.
4. Класстың төменгі жиегі мен ұзындығы дұрыс анықталмаған
Топтастырылған деректер режимінің формуласында төменгі шек (L) әдеттегі төменгі шек емес, керісінше сыныптың төменгі шегі болып табылады (мысалы, 60–69 сынып үшін 59,5).
Режимді қашан қолданған дұрыс?
Бұл режим келесі жағдайларда өте пайдалы:
– Санаттар түріндегі деректер (мысалы, бренд, түс, зат түрі).
– Біз ең танымал нұсқаларды білгіміз келеді.
– Деректер орташа мәнді бұрмалауы мүмкін шектен тыс мәндерге ие.
– Деректердің таралуы асимметриялық және медиана/орташа мән онша репрезентативті емес.
Мысалы, егер 10 адамның табысы өте жоғары болса, орташа көрсеткіш жоғары қарай «итерілуі» мүмкін. Мұндай жағдайларда бұл әдіс табыстың ең жалпыланған көрінісін бере алады.
Жабу
Деректер режимін анықтау қарапайым талдау және шешім қабылдау үшін пайдалы негізгі статистикалық дағды болып табылады. Жеке деректер жиынтықтары үшін режим ең жиі кездесетін мәнге қарау арқылы анықталады. Топтастырылған деректер жиынтықтары үшін режим ең жоғары жиіліктегі кластан анықталады және дәлірек бағалау алу үшін формуланы пайдаланып есептелуі мүмкін. Қадамдарды түсіну арқылы сіз деректерді жылдамырақ өңдей аласыз және деректер жиынтықтан маңызды ақпаратты шығара аласыз.
Қаласаңыз, режимді қалай анықтау керектігін жақсырақ түсіну үшін талқылаулармен қатар (жеке деректер және топтастырылған деректер) мысал ретінде жаттығу сұрақтарын да жасай аламын.