Kukla değişken nedir? Dummy değişken oluşturma ve SPSS uygulaması
Güncelleme tarihi: 14 Eyl
Kukla değişken, kategorik bir değişkenin regresyon gibi istatistiksel analizlerde kullanılabilmesi için çoğunlukla 0 ve 1 değerleriyle yeniden kodlanması sonucunda oluşturulan değişkendir. İngilizce kaynaklarda “dummy variable”, Türkçe kaynaklarda ise “kukla değişken” veya “sahte değişken” olarak adlandırılır. Buradaki “sahte” ifadesi verilerin gerçek olmadığı anlamına gelmez; kategorileri matematiksel modele uygun biçimde temsil eden yardımcı değişkenlerden söz edilmektedir. Bu yazıda kukla değişkenin neden gerekli olduğunu, nasıl oluşturulduğunu, referans kategorinin ne anlama geldiğini, kukla değişken tuzağını ve SPSS uygulamasını örnekler üzerinden açıklayacağız.
Kukla değişken nedir?
Kukla değişken, kategorik bir değişkenin belirli bir kategorisine ait olup olmama durumunu gösteren ikili bir değişkendir. Bir gözlem ilgili kategoriye aitse genellikle 1, ait değilse 0 değeri verilir. Örneğin araştırmaya katılan kişilerin deney ve kontrol gruplarında bulunduğu bir çalışmada kontrol grubu 0, deney grubu 1 olarak kodlanabilir. Bu durumda regresyon katsayısı, deney grubunun bağımlı değişken bakımından kontrol grubundan ne kadar farklı olduğunu gösterir.
Kukla değişkenler özellikle doğrusal regresyon, lojistik regresyon, ANCOVA ve genelleştirilmiş doğrusal modellerde kategorik bağımsız değişkenlerin modele dâhil edilmesinde kullanılır. Regresyon analizinde bütün bağımsız değişkenlerin sürekli olması gerektiği düşüncesi doğru değildir. Doğrusal regresyonda bağımlı değişken genellikle sürekli olmakla birlikte bağımsız değişkenler sürekli, ikili veya uygun biçimde kodlanmış kategorik değişkenlerden oluşabilir.
Kategorik değişkenler neden doğrudan regresyon analizine alınmamalıdır?
Bir kategorik değişkene 1, 2 ve 3 gibi sayısal kodlar verilmesi, bu sayıların gerçek bir büyüklük veya eşit aralıklı ölçüm ifade ettiği anlamına gelmez. Örneğin akademik unvan değişkeninde doktor öğretim üyesi 1, doçent 2 ve profesör 3 olarak kodlanmış olabilir. Bu kodlar yalnızca kategorileri birbirinden ayırır; “profesörlük, doktor öğretim üyeliğinin üç katıdır” ya da kategoriler arasındaki uzaklıklar birbirine eşittir şeklinde yorumlanamaz.
Bu değişkenin 1, 2 ve 3 kodlarıyla doğrudan regresyon modeline alınması, kategoriler arasında eşit aralık ve doğrusal artış bulunduğu yönünde güçlü bir varsayım doğurur. Araştırmacının böyle bir teorik varsayımı yoksa değişkenin kukla değişkenlere dönüştürülmesi gerekir. Böylece her kategori belirlenen referans kategoriyle ayrı ayrı karşılaştırılır ve kategori kodlarına gerçekte taşımadıkları nicel anlamlar yüklenmez.
Bir kategoriden kaç kukla değişken oluşturulur?
Standart bir regresyon modelinde sabit terim kullanılıyorsa, k kategoriye sahip bir değişken için k−1 kukla değişken oluşturulur. İki kategorili bir değişken için bir, üç kategorili bir değişken için iki, dört kategorili bir değişken için ise üç kukla değişken yeterlidir. Kukla değişkenlere dönüştürülmeyen kategori referans kategori olur ve diğer kategoriler bu kategoriyle karşılaştırılır.
UCLA’nın kategorik değişkenlerin regresyonda kodlanmasına ilişkin açıklamasında da her biri 0 ve 1 değerlerinden oluşan, kategori sayısından bir eksik değişken kullanıldığı ve bütün kukla değişkenlerde 0 değerini alan grubun referans kategori olduğu belirtilmektedir. Ayrıca modele oluşturulan kukla değişkenlerin alınması, özgün kategorik değişkenin ise aynı modele yeniden eklenmemesi gerekir. Ayrıntılı teknik açıklamaya UCLA Statistical Methods and Data Analytics kaynağından ulaşabilirsiniz.
Kukla değişken nasıl oluşturulur?
Akademik unvan değişkeninin üç kategoriden oluştuğunu düşünelim: doktor öğretim üyesi, doçent ve profesör. Doktor öğretim üyesi kategorisini referans kabul ettiğimizde “doçent” ve “profesör” olmak üzere iki kukla değişken oluştururuz.
Akademik unvan | Doçent kukla değişkeni | Profesör kukla değişkeni |
Doktor öğretim üyesi | 0 | 0 |
Doçent | 1 | 0 |
Profesör | 0 | 1 |
Tabloda doktor öğretim üyeleri her iki kukla değişkende de 0 değerini aldığı için referans kategoridir. Doçent olan bir kişi “Doçent” değişkeninde 1, “Profesör” değişkeninde 0 değerini alır. Profesör olan kişi ise bunun tersine, “Doçent” değişkeninde 0 ve “Profesör” değişkeninde 1 olarak kodlanır.
Bu örnekte regresyon modeli aşağıdaki gibi gösterilebilir:
Y = b₀ + b₁(Doçent) + b₂(Profesör) + e
Burada b₀, referans kategori olan doktor öğretim üyelerinin tahmin edilen ortalama değerini; b₁, doçentler ile doktor öğretim üyeleri arasındaki farkı; b₂ ise profesörler ile doktor öğretim üyeleri arasındaki farkı gösterir. Modele yaş, kıdem veya yayın sayısı gibi başka değişkenler eklendiğinde katsayılar, bu değişkenler sabit tutulduğunda kategoriler arasında beklenen düzeltilmiş farklar olarak yorumlanır.
Kukla değişken katsayıları nasıl yorumlanır?
Tamamen örnek olması amacıyla modelde b₀ katsayısının 40, doçent değişkeninin katsayısının 12 ve profesör değişkeninin katsayısının 25 olduğunu varsayalım. Doktor öğretim üyeleri her iki kukla değişkende de 0 değerini aldığından bu grubun tahmin edilen değeri 40’tır. Doçentler için tahmin 40 + 12 = 52, profesörler için ise 40 + 25 = 65 olarak hesaplanır.
Bu modelde doçent katsayısının 12 olması, doçentlerin bağımlı değişkendeki tahmin edilen değerinin referans kategori olan doktor öğretim üyelerinden 12 birim yüksek olduğunu gösterir. Profesör katsayısının 25 olması ise profesörlerin tahmin edilen değerinin doktor öğretim üyelerinden 25 birim yüksek olduğu anlamına gelir. Katsayının negatif olması ilgili kategorinin referans kategoriden daha düşük, pozitif olması ise daha yüksek bir tahmin değerine sahip olduğunu gösterir.
Referans kategori nasıl seçilir?
Referans kategorinin araştırma sorusuna göre anlamlı bir grup olması gerekir. Deneysel araştırmalarda kontrol grubu, klinik araştırmalarda tedavi uygulanmayan grup, eğitim araştırmalarında geleneksel yöntem veya uygulamada başlangıç noktası kabul edilen kategori referans olarak seçilebilir. Belirgin bir başlangıç kategorisi yoksa en sık gözlenen kategori referans alınabilir; bu tercih özellikle örneklem büyüklükleri dengesiz olduğunda katsayıların daha kararlı yorumlanmasına yardımcı olabilir.
Referans kategori yalnızca istatistiksel anlamlılığa göre seçilmemeli ve analizden önce teorik gerekçesi belirlenmelidir. Referans kategorinin değiştirilmesi modelin tahminlerini veya genel uyumunu değiştirmez; fakat sabit terimin, katsayıların ve katsayıların işaretlerinin yorumunu değiştirir. Bu nedenle tez veya makalenin yöntem bölümünde hangi kategorinin referans olarak kabul edildiği açıkça belirtilmelidir.
Kukla değişken tuzağı nedir?
Kukla değişken tuzağı, sabit terim içeren bir regresyon modeline kategorilerin tamamını temsil eden kukla değişkenlerin birlikte alınması sonucunda ortaya çıkan mükemmel çoklu bağlantı problemidir. Üç kategorili bir değişken için doktor öğretim üyesi, doçent ve profesör olmak üzere üç ayrı kukla değişken oluşturulup bunların tamamı sabit terimli modele alınırsa her satırda bu üç değişkenin toplamı 1 olacaktır. Dolayısıyla değişkenlerden biri diğerleri ve sabit terim kullanılarak tamamen açıklanabilecek, regresyon katsayıları benzersiz biçimde tahmin edilemeyecektir.
Bu problemin standart çözümü, kategorilerden birini referans kabul ederek modele yalnızca k−1 kukla değişken eklemektir. Sabit terim kullanılmayan bazı özel modellerde k kategorinin tamamı teknik olarak modele alınabilse de tez ve makalelerde kullanılan standart regresyon yaklaşımında sabit terim ve k−1 kukla değişken tercih edilir. Ayrıca hem özgün kategorik değişkeni hem de ondan üretilen kukla değişkenleri aynı modele birlikte eklemekten kaçınılmalıdır.
SPSS’te kukla değişken nasıl oluşturulur?
SPSS’te kukla değişken oluşturmak için Transform > Recode into Different Variables yolu izlenebilir. Üç kategorili akademik unvan değişkeninde doktor öğretim üyesi 1, doçent 2 ve profesör 3 olarak kodlanmışsa “Doçent” adlı yeni değişkende eski değer 2 için yeni değer 1, diğer geçerli kategoriler için 0 tanımlanır. Ardından “Profesör” adlı ikinci değişkende eski değer 3 için 1, diğer geçerli kategoriler için 0 değeri verilir.
Kodlama işlemi tamamlandıktan sonra Analyze > Descriptive Statistics > Frequencies veya çapraz tablo kullanılarak yeni değişkenlerin doğru oluşturulup oluşturulmadığı mutlaka kontrol edilmelidir. Eksik gözlemlerin otomatik olarak 0 yapılmaması özellikle önemlidir; aksi durumda eksik veriler yanlışlıkla referans kategorideymiş gibi analiz edilebilir. Doğrusal regresyonda Analyze > Regression > Linear yolu izlenerek bağımlı değişken “Dependent”, oluşturulan k−1 kukla değişken ise “Independent(s)” alanına aktarılır. Özgün akademik unvan değişkeni kukla değişkenlerle birlikte aynı modele eklenmez.
SPSS’in bazı GLM, GENLIN ve lojistik regresyon işlemlerinde kategorik değişkenler faktör olarak tanımlanabilir ve program gerekli gösterge değişkenlerini model içinde oluşturabilir. Buna karşılık klasik Linear Regression ekranında araştırmacının kukla değişkenleri önceden oluşturması yaygın bir uygulamadır. Güncel istatistik yazılımlarının kategorik değişkenleri faktör olarak tanıyabildiği, referans kategorinin değiştirilebildiği ve etkileşimlerin doğrudan tanımlanabildiği Stata’nın faktör değişkenler açıklamasında da görülebilir.
Kukla değişken lojistik regresyonda kullanılabilir mi?
Kukla değişkenler yalnızca doğrusal regresyonda değil, lojistik regresyonda da kategorik bağımsız değişkenleri temsil etmek için kullanılır. Ancak lojistik regresyonda katsayıların yorumlanması doğrusal regresyondan farklıdır. Katsayının üstel değeri olan Exp(B), diğer değişkenler sabit tutulduğunda ilgili kategorinin referans kategoriye göre odds oranını gösterir.
Örneğin tedavi türü üç kategoriden oluşuyorsa kategorilerden biri referans seçilir ve diğer iki kategori iki kukla değişkenle modele alınır. Her kukla değişken için elde edilen Exp(B) değeri, o tedavi kategorisinin sonuç odds’unu referans tedavinin odds’u ile karşılaştırır. Lojistik regresyon uygulaması ve sonuçların raporlanması için iki durumlu lojistik regresyon bulgularının yazımı başlıklı rehberimizi inceleyebilirsiniz.
Kukla değişkenlerle etkileşim nasıl incelenir?
Kukla değişkenler, kategorik bir değişken ile sürekli bir değişken arasındaki etkileşimi araştırmak amacıyla da kullanılabilir. Örneğin çalışma süresinin sınav başarısı üzerindeki etkisinin deney ve kontrol gruplarında farklı olup olmadığı incelenmek isteniyorsa “grup × çalışma süresi” etkileşim terimi modele eklenebilir. Etkileşim katsayısının anlamlı olması, çalışma süresi ile başarı arasındaki eğimin iki grupta farklılaştığını gösterir.
Etkileşim içeren modellerde yalnızca etkileşim katsayısına bakmak yeterli değildir. Modelde kukla değişkenin ana etkisi, sürekli değişkenin ana etkisi ve etkileşim terimi birlikte bulunmalı; sonuçlar mümkünse tahmin edilen değerler veya basit eğimler kullanılarak açıklanmalıdır. Sürekli değişkenin merkezlenmesi de sabit terimin ve ana etkilerin daha anlamlı yorumlanmasını sağlayabilir.
Kukla kodlama ile one-hot encoding aynı şey midir?
Bu iki kavram günlük kullanımda birbirinin yerine kullanılabilse de aralarında küçük bir ayrım vardır. One-hot encoding çoğunlukla her kategori için ayrı bir 0–1 sütunu oluşturulmasını ifade eder; üç kategori varsa üç gösterge sütunu meydana gelir. Sabit terimli klasik regresyonda kullanılan kukla kodlamada ise mükemmel çoklu bağlantıyı önlemek için bu sütunlardan biri çıkarılır ve modele k−1 değişken alınır.
Makine öğrenmesi yazılımları, kullanılan algoritmaya ve sabit terim ayarına göre bütün kategorileri veya kategorilerden bir eksik sütunu otomatik olarak kullanabilir. Bu nedenle yalnızca veri tablosunda kaç sütun oluşturulduğuna değil, analiz yazılımının referans kategoriyi ve sabit terimi nasıl ele aldığına da bakılmalıdır.
Kukla değişken oluştururken yapılan yaygın hatalar
Kategorileri 1, 2 ve 3 olarak kodladıktan sonra değişkeni doğrudan sürekli bir bağımsız değişkenmiş gibi modele almak en sık karşılaşılan hatalardan biridir. Bunun yanında k kategorinin tamamını sabit terimli modele eklemek, özgün kategorik değişkeni oluşturulan kukla değişkenlerle birlikte kullanmak, referans kategoriyi raporlamamak ve 0–1 kodlarının yönünü yanlış yorumlamak da sonuçların hatalı açıklanmasına neden olabilir.
Eksik değerleri 0 olarak kodlayarak referans gruba dâhil etmek, çok az gözlem bulunan kategorileri kontrol etmeden modele almak ve regresyon katsayısından doğrudan nedensellik sonucu çıkarmak da önemli sorunlardır. Analizden önce kategori frekansları incelenmeli, oluşturulan değişkenler çapraz tabloyla doğrulanmalı ve her katsayının hangi karşılaştırmayı temsil ettiği açıkça belirlenmelidir.
Tez veya makalede kukla değişken nasıl raporlanır?
Kukla değişkenlerin raporlanmasında özgün değişkenin kategorileri, referans kategori, oluşturulan değişken sayısı ve kodlama yönü belirtilmelidir. Sonuç bölümünde ise her katsayının referans kategoriye göre farkı temsil ettiği açıklanmalı; B katsayısı, standart hata, güven aralığı ve p değeri birlikte sunulmalıdır.
Örnek bir raporlama cümlesi şu şekilde olabilir:
Akademik unvan değişkeni regresyon analizine kukla değişkenler aracılığıyla dâhil edilmiş ve doktor öğretim üyesi kategorisi referans olarak kabul edilmiştir. Diğer değişkenler kontrol altında tutulduğunda doçentlerin bağımlı değişken puanlarının referans gruptan 12,00 puan daha yüksek olduğu görülmüştür (B = 12,00, SH = 3,20, %95 GA [5,73, 18,27], p < ,001). Profesörlerin tahmin edilen puanları da referans gruptan 25,00 puan daha yüksektir (B = 25,00, SH = 3,80, %95 GA [17,55, 32,45], p < ,001).
Bu değerler yalnızca raporlama biçimini göstermek amacıyla verilmiştir. Gerçek çalışmada katsayılar SPSS çıktısından alınmalı ve değişkenlerin ölçüm yönü, araştırma deseni ve modele eklenen diğer değişkenler dikkate alınarak yorumlanmalıdır.
Sık sorulan sorular
İki kategorili bir değişken için kaç kukla değişken gerekir?
Sabit terim içeren standart bir regresyon modelinde iki kategorili bir değişken için tek bir 0–1 değişken yeterlidir. İkinci bir kukla değişken oluşturup ikisini birlikte modele eklemek gereksizdir ve mükemmel çoklu bağlantıya yol açabilir.
Referans kategoriyi değiştirmek sonuçları değiştirir mi?
Referans kategorinin değiştirilmesi katsayıların anlamını, işaretini ve yapılan ikili karşılaştırmaları değiştirir. Bununla birlikte modelin tahmin ettiği değerler, R² gibi genel uyum ölçüleri ve modelin genel açıklama gücü değişmez.
Sıralı kategorik değişkenlere kukla kodlama yapılabilir mi?
Evet, sıralı kategorik değişkenler de kukla değişkenlerle modele alınabilir. Değişkeni 1, 2 ve 3 biçiminde sürekli bir değişken gibi kullanmak kategoriler arasında eşit aralık ve doğrusal eğilim varsaydığından, bu varsayım teorik olarak savunulamıyorsa kukla kodlama daha güvenli bir seçimdir.
Bağımlı değişken kategorikse kukla değişken yeterli midir?
Bağımlı değişken kategorik olduğunda yalnızca kodlama yapmak doğrusal regresyonu uygun hâle getirmez. İki kategorili sonuçlar için ikili lojistik regresyon, ikiden fazla sırasız kategori için multinomial lojistik regresyon ve sıralı kategoriler için ordinal lojistik regresyon gibi uygun bir model seçilmelidir.
Kukla değişkende 0, özelliğin hiç bulunmadığı anlamına mı gelir?
Her zaman değil. Sıfır değeri çoğunlukla gözlemin ilgili kategoriye ait olmadığını ve katsayının referans kategoriye göre yorumlandığını gösterir; gerçek dünyada özelliğin tamamen yok olduğu anlamına gelmeyebilir.
Sonuç
Kukla değişken, kategorik değişkenleri regresyon modellerine doğru biçimde dâhil etmek için kullanılan temel kodlama yöntemlerinden biridir. Uygulamada en önemli kurallar, k kategorili bir değişken için sabit terimli modelde k−1 kukla değişken kullanmak, araştırma sorusuna uygun bir referans kategori belirlemek, özgün kategorik değişkeni kukla değişkenlerle birlikte modele almamak ve katsayıları referans kategoriye göre yorumlamaktır.
Değişken türünüze hangi analizin uygun olduğundan emin değilseniz Hangi İstatistiksel Testi Kullanmalıyım? aracımızdan yararlanabilirsiniz. Regresyon modelinizin kurulması, kukla değişkenlerin oluşturulması, SPSS çıktılarının yorumlanması veya bulguların tez formatında raporlanması konusunda desteğe ihtiyaç duyuyorsanız istatistiksel analiz danışmanlığı hizmetimizi inceleyebilirsiniz. Daha önce gerçekleştirdiğiniz analizlerin kodlama, varsayım ve yorumlama açısından kontrol edilmesi için ise analiz kontrolü ve istatistiksel revizyon sayfasına başvurabilirsiniz.
Kaynaklar
UCLA Statistical Methods and Data Analytics. Coding Systems for Categorical Variables in Regression Analysis.
StataCorp. Factor Variables.