Datu kategorikoak nola aztertu
Datu kategorikoak ikerketan, negozioetan, marketinean, osasunean, hezkuntzan eta baita bezeroen gogobetetasun inkestetan ere aurkitzen diren datu mota ohikoenetako bat dira. Batez besteko edo desbideratze estandar bat erabiliz kalkula daitezkeen datu numerikoek (adibidez, adina, altuera, diru-sarrerak) ez bezala, datu kategorikoek etiketak edo taldeak dituzte, hala nola "Gizonezkoa/Emakumezkoa", "Ados/Ez ados", "A/B/C" edo "Pozik/Neutroa/Atsekabetuta". Bere izaera kategorikoagatik, analisi teknikek ikuspegi espezifikoak behar dituzte. Artikulu honek datu kategorikoak eraginkortasunez aztertzeko urrats praktikoak eta metodo ohikoenak aztertzen ditu.
1. Datu mota kategorikoak ulertzea
Aztertu aurretik, ulertu lehenik zer motatako datu kategorikoak dituzun. Oro har, bi mota daude:
1) Nominala
Kategoriek ez dute ordenarik. Adibideak: generoa, kolore gogokoena, produktuaren marka, bizilekua.
2) Ordinala
Kategoriek sekuentzia edo maila bat dute. Adibideak: gogobetetasun maila (atsekabetuta–nahiko–asebeteta), hezkuntza maila (batxilergoa–lizentziatura–masterra), Likert eskala (erabat desados–erabat ados).
Bereizketa hau garrantzitsua da, analisi teknika egokietan eragina duelako. Datu ordinalak haien ordena kontuan hartuta azter daitezke, datu nominalak, berriz, ezin dira.
2. Datuak prestatzea: kodeak, etiketak eta datuen garbitasuna
Analisi ona beti hasten da datu antolatuekin. Gomendatutako prestaketa-urratsak:
– Kategoria idazketaren estandarizazioa: adibidez, “Gizona” vs “Mutila” konbinatu behar dira, kategoria desberdin kontsideratu ez daitezen.
– Falta diren balioak kudeatu: erabaki ezabatu, egotzi edo kategoria bereizi bat sortu, hala nola “Ez dut erantzun”.
– Sortu kodeketa beharrezkoa bada: adibidez, Ados=4, Neutrala=3, Ez ados=2. Balio nominaletarako, kode numerikoa etiketa bat besterik ez da, ez balio matematiko bat.
– Egiaztatu oso arraroak diren kategoriak: maiztasun oso baxuko kategoriek analisia oztopatu dezakete; batzuetan konbinatu behar dira emaitza egonkorragoak lortzeko.
3. Azterketa deskribatzailea: maiztasuna eta proportzioa
Datu kategorikoetarako modurik oinarrizkoena eta garrantzitsuena kalkulatzea da:
– Maiztasuna: kategoria bakoitzeko erantzule/behaketa kopurua.
– Proportzioa edo ehunekoa: maiztasuna datu guztien artean zatituta.
Adibide sinple bat: 200 erantzuleetatik, 120 “Pozik” zeuden, 50 “Neutralak” eta 30 “Atsekabetuak”. Erantzule pozik daudenen ehunekoa % 60koa da.
Analisi deskribatzaileak kategorien banaketaren hasierako ikuspegi orokorra eskaintzen du. Askotan, aurkikuntza garrantzitsuak agerikoak dira hemen: kategoria nagusiak, taldeen arteko osaeran dauden desberdintasunak edo "kategoria arraroen" presentzia, kopuru txikia edo handia dela eta.
4. Datu kategorikoen bistaratze egokia
Bistaratzeek irakurleei ereduak azkar ulertzen laguntzen diete. Ohiko grafikoak:
– Barra-diagrama (barra-diagrama): nominal eta ordinaletarako egokiena.
– Barra-diagrama pilatua (pilatutako barrak): egokia da hainbat talderen arteko kategorien osaera alderatzeko, adibidez, adar bakoitzeko gogobetetasuna.
– Sektore-diagrama: erabil daiteke, baina ez da hain eraginkorra kategoria asko edo desberdintasun txikiak badaude.
– Mosaiko diagrama: bi aldagai kategorikoren arteko erlazioa ikusteko erabilgarria.
– Pareto diagrama: maiztasun handienetik txikienera ordenatutako barra-diagrama bat, arazoen lehentasunaren analisietarako erabili ohi dena.
Aholkua: Datu ordinaletarako, ordenatu kategoriak mailaren arabera (adibidez, “Erabat ados”-tik “Erabat ados”), ez alfabetikoki.
5. Taula gurutzatua sortzea
Bi aldagai kategorikoren arteko erlazioa ikusi nahi baduzu, erabili taula gurutzatua. Adibidez, "Generoa" eta "Produktuaren lehentasuna" edo "Eskualdea" eta "Erosketa egoera" arteko erlazioa.
Gurutzatutako taulak kategoria konbinazio jakin batean zenbat behaketa dauden erakusten duen taula bat sortzen du. Honako hauek gehi ditzakezu:
– Errenkada bakoitzeko ehunekoa: errenkada bakoitzeko zutabe-kategorien banaketan jartzen du arreta.
– Zutabe bakoitzeko ehunekoa: zutabe bakoitzeko errenkada-kategorien banaketan jartzen du arreta.
– Guztizko ehunekoa: zelula bakoitzak guztizkoari egiten dion ekarpena.
Taula gurutzatuek askotan "zubi" gisa balio dute proba deskribatzaileen eta estatistikoen artean.
6. Independentziarako khi-karratu testa
Bi aldagai kategoriko erlazionatuta edo independenteak diren probatzeko, probarik ohikoena khi-karratu (χ²) independentziaren proba da. Hipotesia hau da:
– H0: erlaziorik ez (independentea)
– H1: erlazio bat dago (ez independentea)
p-balioa esangura-maila baino txikiagoa bada (adibidez, 0,05), bi aldagaien arteko erlazio baten ebidentzia dago. Ohar garrantzitsu batzuk: - Khi-karratu probak datu kopuru nahikoa behar du, batez ere espero den maiztasunean. Espero den kopuru txikia duten gelaxka gehiegi badaude, probaren emaitzak baliogabeak izan daitezke. - Lagina txikia bada, kontuan hartu Fisherren Test Zehatza (batez ere 2x2 tauletarako). 7. Erlazio baten indarra neurtzea: Cramérren V eta Phi Khi-karratu probak erlazio bat dagoen adierazten du, baina ez du esaten zein sendoa den. Horretarako, efektu-tamainak erabiltzen dira: - Phi (φ): 2x2 tauletarako. - Cramérren V: 2x2 baino handiagoko tauletarako. Cramérren V 0-1 bitartekoa da: - 0tik gertu: erlazio ahula - 1etik gertu: erlazio sendoa Txostenean, aipatu p-balioa eta efektu-tamaina interpretazio osoa lortzeko. 8. Datu ordinalen analisia: sailkapen-korrelazioa eta joeren probak Zure datu kategorikoak ordinalak badira, ordena kontuan hartzen duten ikuspegiak erabil ditzakezu, adibidez: - Spearman sailkapen-korrelazioa (bi aldagai ordinaletarako edo ordinala vs. zenbakizko ez-normala) - Kendall-en tau (Spearman-en alternatiba, askotan egonkorra lagin txikietarako) - Kontingentzia-tauletako joeren probak, goranzko/beheranzko eredu koherente bat dagoen ikusteko. Adibidez: hezkuntza-maila (batxilergoa-lizentziatura-masterra-doktoregoa) adostasun-mailekin (1-5) lotuta al dago goranzko eredu batean? 9. Aurreikuspen-ereduak: Erregresio logistikoa Zure helburua ez bada soilik erlazio bat ikustea, baizik eta beste aldagai batzuetan oinarritutako kategoriak aurreikustea, erabili erregresioa:
- Erregresio logistiko bitarra: bi kategoriako irteerarako (adibidez, “Erosi” vs. “Ez erosi”). - Erregresio logistiko multinomiala: bi kategoria ordenatu gabe baino gehiagoko irteerarako (adibidez, “A/B/C paketea”). - Erregresio logistiko ordinala: irteera kategoriko ordenatuarentzat (adibidez, 1–5 gogobetetasuna). Erregresio logistikoaren abantaila: Hainbat iragarle aldi berean sar ditzakezu (adina, kokapena, marketin kanala) eta odds ratioan oinarritutako interpretazio bat lortu, adibidez, “erosteko probabilitatea 1,8 aldiz handitu da X taldean”. 10. Emaitzak interpretatzea eta ondorioak idaztea Datu kategorikoen analisi ona zenbakietatik haratago doa, baina argi erantzuten dio ikerketa galderari. Ondorioak idazterakoan: - Adierazi banaketa nagusia (adibidez, “erantzuleen % 60 pozik daude”). - Asoziazio proba bat badago, jakinarazi p-balioa eta efektuaren tamaina (adibidez, Cramérren V). - Azaldu esanahi praktikoa: aldea garrantzitsua den ala ez politikarako, marketin estrategiarako edo erakundearen erabakietarako. - Saihestu kausa-baieztapenak datuak behaketa-egilea badira. Elkarteak ez du beti kausalitatea esan nahi. Datu kategorikoak aztertzeko, datu motak ulertzea beharrezkoa da (nominalak vs. ordinalak), maiztasunen deskribapen argia, bistaratze egokia, gurutzaketa eta khi-karratua eta efektu-tamainak bezalako proba estatistikoak egin behar dira, hala nola Cramér-en V. Iragarpenetarako, erregresio logistikoa tresna oso indartsua da. Urrats hauekin, etiketatutako datuak erabakiak hartzeko erabilgarriak diren informazio estatistiko sendo bihur ditzakezu. Nahi baduzu, zure datu-multzoan edo kasu-azterketan oinarritutako lagin-analisi bat sortzen lagun zaitzaket (adibidez, Excel, SPSS, R edo Python erabiliz).