Senin, Agustus 15, 2016

Bermain Kartu Belajar Bayesian

Salah satu kesalah-pahaman terbesar dari para peneliti atau penulis artikel ilmiah adalah menginterpretasi nilai p sebagai probabilitas dari kebenaran / kesalahan suatu hipotesis berdasarkan kondisi data penelitian kita. Nilai p sebenarnya berbicara tentang probabilitas memperoleh hasil penelitian seperti yang kita temukan atau lebih ekstrim jika hipotesis nul benar di populasi, atau dapat diekspresikan sebagai berikut:


                                                                (1)

D dalam ekspresi tersebut adalah data penelitian yang kita peroleh, sementara H0 adalah Hipotesis Nul. Jadi nilai p sebenarnya adalah probabilitas kondisional (Conditional Probability).  Dengan kata lain, nilai p berarti besarnya probabilitas memperoleh hasil penelitian seperti yang kita peroleh atau lebih ekstrim dalam kondisi H0 benar.  Ini berarti H0 merupakan kondisi yang ditetapkan atau diketahui terlebih dulu, baru mencari probabilitas memperoleh D. 


Jadi misalnya dalam sebuah penelitian korelasional, ditemukan nilai korelasi sebesar 0.3 dengan nilai p = 0.025, ini berarti besarnya probabilitas memperoleh koefisien korelasi sebesar 0.3 atau lebih besar jika koefisien korelasi di populasi adalah nol, sebesar 0.025 atau 2.5%. Apakah ini berarti probabilitas koefisien korelasi di populasi sama dengan nol berdasarkan hasil temuan penelitian kita adalah 0.025? Tidak. Probabilitas koefisien korelasi di populasi sama dengan nol jika didasarkan pada hasil penelitian diekspresikan sebagai berikut:



                                                                   (2)

Kita ilustrasikan dengan bermain kartu remi yang berisi 52 kartu dengan 13 angka (As, 2, 3, hingga Raja) dan 4 jenis (Hati, Keriting, Sekop dan Wajik).  Anggaplah jenis kartu adalah hipotesis-hipotesis (H), dengan kartu jenis Hati sebagai H0,  sementara angka kartu adalah Data (D). 

Jika saya mengambil satu kartu dari setumpuk kartu remi yang telah dikocok. Saya menyebutkan bahwa kartu yang saya pegang adalah kartu Hati (H0). Berapa besar probabilitas kartu tersebut memiliki angka 5 (D=5)? Ini berarti pertanyaan saya terkait dengan ekspresi probabilitas yang pertama (1). Dalam kelompok kartu berjenis Hati, probabilitas memperoleh angka sebesar 5 adalah 1/13. 


Ekspresi probabilitas kedua (2) melakukan dengan cara yang terbalik dari yang saya lakukan sebelumnya. Setelah saya mengambil kartu, saya menyebutkan angkanya (D-nya) terlebih dulu, baru bertanya berapa besar probabilitas karti ini berjenis Hati (H0)? Atau dalam kelompok kartu berangka 5 (D=5), besarnya probabilitas memperoleh kartu berjenis Hati (H0) adalah 0.25. 


Dapat kita lihat bahwa besarnya  tidak sama dengan : yang pertama bernilai 1/13 yang kedua 0.25.  Nah, pertanyaannya sekarang jadi begini: jika ketertarikan peneliti sebenarnya adalah no 2 (probabilitas benar/tidak nya H0 berdasarkan data), sementara yang bisa kita peroleh adalah no 1 (probabilitas memperoleh suatu data (D) jika H0 benar), mungkinkah kita memperoleh no 2 dengan menggunakan informasi dari no 1?



Teorema Bayes

Jawabannya: Bisa dengan menggunakan teorema Bayes:

                                              (3)


Mari kita amati persamaan (3). Persamaan (3) dapat kita tulis ulang menjadi

                                              (4)

Dalam contoh kartu remi di atas ini Pr(H0|D) adalah probabilitas memperoleh kartu berjenis hati jika kita mengetahui bahwa kartu tersebut berangka lima, yaitu sebesar 0.25. Pr(D) adalah besarnya probabilitas memperoleh kartu 5 dari keseluruhan kartu remi, yaitu 4 / 52 = 1/13 (4 kartu berangka 5 dari 52 total kartu remi). Jika kita kalikan keduanya, kita memperoleh angka 1/52 (1/4 dikalikan 1/13).  Ternyata besarnya hasil perkalian ini sama dengan hasil perkalian antara Pr(D|H0) dan Pr(H0). Pr(D|H0) adalah probabilitas memperoleh kartu berangka 5 jika kita tahu bahwa kartu tersebut berjenis hati (besarnya 1/13). Sementara Pr(H0) adalah besarnya probabilitas memperoleh kartu berjenis hati dari keseluruhan kartu remi (besarnya = 13 kartu berjenis hati / 52 total kartu remi=1/4). Hasil perkaliannya sama dengan 1/52. 

Baik Pr(H0|D)Pr(D) maupun Pr(D|H0)Pr(H0) menghasilkan nilai yang menggambarkan probabilitas gabungan (Joint Probability), atau dalam contoh kartu remi di atas probabilitas kartu yang saya pegang adalah kartu berjenis Hati dan berangka 5, yaitu sebesar 1/52 (hanya ada satu kartu berjenis Hati dan berangka 5 dibagi 52 kartu remi). Keterkaitan ekspresi probabilitas no 1 dan no 2 inilah yang memungkinkan kita memperoleh Pr(H0|D) dari Pr(D|H0) atau sebaliknya. 


Informasi yang Dibutuhkan

Meskipun kita bisa memperoleh informasi mengenai Pr(H0|D) dari Pr(D|H0) atau nilai p, ada beberapa informasi tambahan yang dibutuhkan yaitu Pr(H0) dan Pr(D). Pr(H0) disebut juga sebagai Probabilitas Prior (Prior Probability atau Prior Distribution).  Tanpa mengetahui Pr(H0) ini, kita tidak dapat memperoleh apa yang kita inginkan. Informasi mengenai Probabilitas Prior ini cukup penting karena informasi keliru mengenai Probabilitas Prior ini bisa berdampak pada kesalahan perhitungan Pr(H0|D). 

Informasi kedua yang dibutuhkan adalah Pr(D). Dalam kondisi tertentu, peneliti dapat berasumsi bahwa Pr(D) bersifat menetap sehingga kita dapat berasumsi  bahwa Pr(H0|D) proporsional terhadap Pr(D|H0)*Pr(H0)


Demikian sekilas mengenai ide awal analisis menggunakan paradigma Bayesian. Dengan pendekatan Bayesian inilah muncul teknik Markov Chain Monte Carlo (MCMC) yang seringkali digunakan untuk memecahkan persamaan yang tidak memiliki closed form. 

Sabtu, Juli 30, 2016

Fun Facts Koefisien Regresi (Terstandardisasi), Korelasi Parsial dan Semi-Parsial

Ketika berbicara tentang regresi, ada dua statistik lain yang memiliki hubungan sangat dekat dengan koefisien yang dihasilkannya, khususnya slope baik yang tidak terstandardisasi (unstandardized) maupuan yang terstandardisasi (standardized). Pembahasan kali ini dilakukan dengan tujuan menunjukkan kedekatan makna statistik-statistik tersebut, kesamaan dan perbedaannya dengan harapan dapat membantu pemahaman pembaca tentang empat statistik tersebut. 


Notasi

Sebelum pembahasan dimulai, ada baiknya saya memaparkan dulu lambang-lambang yang akan saya gunakan dalam artikel ini untuk mempermudah pembaca. 
  1. Huruf kecil b digunakan untuk melambangkan koefisien regresi yang tidak terstandardisasi, mengikuti lambang yang digunakan oleh SPSS yang kiranya banyak digunakan di Indonesia. 
  2. Huruf latin  digunakan untuk melambangkan koefisien regresi yang terstandardisasi, mengikuti lambang yang digunakan oleh SPSS. 
  3. Lambang  digunakan untuk melambangkan koefisien korelasi parsial antara y dan variabel prediktor pertama (X1) dengan mengendalikan variabel prediktor kedua (X2). 
  4. Lambang  digunakan untuk melambangkan koefisien korelasi semi-parsial antara y dan X1 dengan mengendalikan X2. 
  5. Lambang  digunakan untuk melambangkan koefisien korelasi antara y dan X1. 
  6. Lambang  digunakan untuk melambangkan koefisien korelasi antara X1 dan X2

Fun Facts No 1: Memiliki Pembilang yang Sama

Baiklah ini saatnya kita membandingkan keempat rumus koefisien-koefisien tersebut. Anggaplah kita saat ini berhadapan dengan kasus analisis yang melibatkan satu variabel kriterion (Y) dan dua variabel prediktor (X1 dan X2). Ilustrasi ini dilakukan untuk membuat perbandingan antar koefisien menjadi cukup jelas. Melibatkan terlalu banyak variabel prediktor akan membuat rumus menjadi terlalu kompleks sehingga justru akan mempersulit pemahaman pembaca. 

Rumus Koefisien b
Rumus Koefisien
Rumus Koefisien
Rumus Koefisien


Kita dapat melihat bahwa pembilang dari rumus-rumus tersebut sama persis satu dengan yang lain, yang membedakan hanyalah penyebutnya saja. Penyebutnya pun tidak jauh berbeda satu dengan yang lain. Jadi sebenarnya keempat rumus tersebut dapat dikatakan menceritakan kisah yang mirip tentang hubungan antara X1 dengan Y dengan mengendalikan X2. 

Misalnya, koefisien slope dari regresi, baik yang terstandardisasi maupun yang tidak, bercerita tentang seberapa banyak Y akan berubah ketika X1 memiliki nilai 1 point lebih tinggi, dengan mengendalikan X2. Atau dengan kata lain berapa banyak Y akan berubah ketika X1 memiliki nilai 1 point lebih tinggi, pada nilai X2 yang sama. 

Fun Facts 2: Memiliki Nilai yang Berbeda, tetapi Memberikan Hasil Uji Signifikansi yang Sama. 

Karena keempat statistik tersebut memiliki penyebut yang berbeda, maka wajar kiranya jika keempatnya memberikan hasil yang berbeda. Namun demikian, meskipun nilai yang dihasilkan berbeda, tetapi uji signifikansi dari keempatnya selalu memberikan hasil yang sama. 

Untuk membuktikannya, saya akan menunjukkan suatu ilustrasi menggunakan program R (Tips: anda bisa meng-copy-paste baris-baris perintah tersebut di bawah langsung ke dalam console R dan menekan "Enter" untuk menjalankannya. Perintah dari program R saya cetak tebal dan diberi warna biru). 

1. Pertama-tama saya perlu membuat terlebih dulu data simulasi dengan cara berikut:
set.seed(8888)
x1=rnorm(100)
x2=0.4*x1+sqrt(1-0.4^2)*rnorm(100)
y=0.1*x1+0.15*x2+sqrt(1-0.02)*rnorm(100)

2. Saya menghitung semua nilai yang saya butuhkan untuk menghitung keempat statistik menggunakan rumus di atas, seperti standard deviasi, korelasi antar variabel, dll, dengan perintah berikut ini: 
s1=sd(x1)
s2=sd(x2)
sy=sd(y)
ry1=cor(x1,y)
ry2=cor(x2,y)
r12=cor(x1,x2)
z1=(x1-mean(x1))/sd(x1)
z2=(x2-mean(x2))/sd(x2)
zy=(y-mean(y))/sd(y)

3.  Rumus dari keempat statistik di atas saya aplikasikan sebagai berikut:
b=(ry1-ry2*r12)/(1-r12^2)*(sy/s1)
beta=(ry1-ry2*r12)/(1-r12^2)
par.r=(ry1-ry2*r12)/sqrt((1-r12^2)*(1-ry2^2))
semi.par.r=(ry1-ry2*r12)/sqrt((1-r12^2))

4. Hasil perhitungan keempat rumus tersebut saya bandingkan dengan hasil dari program R (lambang > menunjukkan saya mengetik perintah ini langsung di console R):
     a. Untuk nilai koefisien yang tidak terstandardisasi
>b
[1] 0.1868164
>lm(y~x1+x2)

Call:
lm(formula = y ~ x1 + x2)

Coefficients:
(Intercept)       x1       x2
-0.01433     0.18682  0.26569
   
     b. Untuk nilai koefisien yang terstandardisasi
>beta
[1] 0.1740606
>lm(zy~z1+z2)

Call:
lm(formula = zy ~ z1 + z2)

Coefficients:
(Intercept)       z1        z2
-5.449e-17 1.741e-01 2.226e-01
    
   c. Untuk nilai korelasi parsial dan semi parsial (saya menggunakan paket program R bernama ppcor. Pembaca perlu menginstal paket ini terlebih dulu sebelum menjalankan baris perintah berikut ini):
>library(ppcor)
>par.r #korelasi parsial. Bagian setelah tanda pagar adalah komentar
[1] 0.1742675
>pcor(cbind(x1,x2,y))$estimate[3,1]
[1] 0.1742675
>semi.par.r #korelasi semi-parsial. Bagian setelah tanda pagar adalah komentar
[1] 0.1678641
>spcor(cbind(x1,x2,y))$estimate[3,1]
[1] 0.1678641
    
    d. Untuk uji signifikansi, kita bandingkan dari hasil analisis menggunakan program R:
>summary(lm(y~x1+x2))$coeff[2,1:4]
    Estimate  Std. Error     t value    Pr(>|t|)
  0.18681637  0.10718053  1.74300648    0.08450135
> summary(lm(zy~z1+z2))$coeff[2,1:4]
    Estimate  Std. Error     t value    Pr(>|t|)
  0.17406065  0.09986231  1.74300648    0.08450135
> c(pcor(cbind(x1,x2,y))$statistic[3,1],c(pcor(cbind(x1,x2,y))$p.value[3,1])
[1] 1.74300648 0.08133248
> c(spcor(cbind(x1,x2,y))$statistic[3,1],c(spcor(cbind(x1,x2,y))$p.value[3,1])
[1] 1.67706738 0.09352931
Dapat kita lihat, khususnya untuk no d. bahwa meskipun nilai yang dihasilkan keempat rumus tersebut berbeda, uji signifikansi memberikan kesimpulan yang sama, bahkan juga nilai t yang sama, kecuali untuk korelasi semi-parsial. 

Fun Facts 3: Kuadrat Korelasi Semi-Parsial Sama Dengan Besarnya Perubahan R Kuadrat. 

Jika kita mengkuadratkan nilai korelasi semi-parsial, maka hasilnya akan sama dengan besarnya perubahan nilai R kuadrat dari nilai yang diperoleh dengan hanya melibatkan X2 ke nilai yang diperoleh ketika memasukkan X1 ke dalam persamaan regresi. 

Ilustrasi dapat dilihat berikut ini: 
>summary(lm(y~x1+x2))$r.squared
[1] 0.1003169
>summary(lm(y~x2))$r.squared
[1] 0.07213849
>0.1003169-0.07213849
[1] 0.02817841
>semi.par.r^2
[1] 0.02817837


Fun Facts 4: Cara Lain Memperoleh Keempat Koefisien Di Atas

1. Proses memperoleh koefisien regresi tak terstandardisasi
  • Lakukan regresi dengan X1 sebagai kriterion dan X2 sebagai prediktor, simpan residualnya (sebut saja X1*)
  • Lakukan regresi dengan Y sebagai kriterion dan X2 sebagai prediktor, simpan residualnya (sebut saja YX2*)
  • Lakukan regresi dengan YX2* sebagai kriterion dan X1* sebagai prediktor
  • Ilustrasi:
>x1.star=lm(x1~x2)$residual
>yx2.star=lm(y~x2)$residual
>lm(yx2.star~x1.star)$coeff
    (Intercept)      x1.star
 -1.421335e-17  1.868164e-01

>lm(y~x1+x2)$coeff
   (Intercept)            x1          x2 

   -0.01433446    0.18681637  0.26569439 

  • Berdasarkan proses tersebut, kita dapat melihat bahwa koefisien regresi menggambarkan efek1  dari sebagian X1 yang tidak dapat dijelaskan X2 (residu dari hasil regresi X1 pada X2) pada bagian dari Y yang tidak dapat dijelaskan oleh X2 (yaitu residu dari hasil regresi Y pada X2). 
2. Proses memperoleh koefisien regresi terstandardisasi

  • Prosesnya sama dengan no 1, hanya saja sebelum dilakukan analisis, semua variabel diubah dalam skor standard. 
3. Proses memperoleh koefisien korelasi parsial
  • Lakukan regresi dengan X1 sebagai kriterion dan X2 sebagai prediktor, simpan residualnya (sebut saja X1*)
  • Lakukan regresi dengan Y sebagai kriterion dan X2 sebagai prediktor, simpan residualnya (sebut saja YX2*)
  • Lakukan korelasi antara YX2* dan X1*
  • Ilustrasi:
>x1.star=lm(x1~x2)$residual
>yx2.star=lm(y~x2)$residual
>cor(yx2.star,x1.star)
[1] 0.1742675

>pcor(cbind(x1,x2,y))$estimate[3,1]
[1] 0.1742675

  • Berdasarkan proses tersebut kita dapat melihat keterkaitan antara korelasi parsial dengan koefisien regresi. Korelasi parsial oleh karenanya berbicara tentang korelasi antara bagian X1 yang tidak dapat dijelaskan X2 dengan bagian Y yang tidak dapat dijelaskan X2. 
  • Kuadrat dari korelasi parsial memberikan gambaran besarnya proporsi variasi Y yang tidak dapat dijelaskan X2 yang secara unik dapat dijelaskan oleh X1. 

4.Proses memperoleh koefisien korelasi semi-parsial

  • Lakukan regresi dengan X1 sebagai kriterion dan X2 sebagai prediktor, simpan residualnya (sebut saja X1*)
  • Lakukan korelasi antara Y dengan X1* 
  • Ilustrasi:
>x1.star=lm(x1~x2)$residual
>cor(x1.star,y)$coeff
[1] 0.1678641 

>spcor(cbind(x1,x2,y))$estimate[3,1]
[1] 0.1678641

  • Berdasarkan proses tersebut kita dapat melihat bahwa korelasi semi parsial merupakan korelasi antara X1 dengan bagian dari Y yang tidak dapat dijelaskan oleh X2. 
Semoga penjelasan di atas dapat memberikan gambaran tentang keterkaitan keempat koefisien tersebut maupun gambaran tambahan mengenai apa yang dapat di'kisah'kan oleh tiap koefisien tersebut. 

Kode R di atas juga dapat dilihat (di-copy dan paste) dari sini. 




1 Penulis menggunakan kata efek; hanya untuk kemudahan interpretasi. Kata 'efek' di sini tidak dimaksudkan untuk menunjukkan kemampuan regresi dalam memberikan bukti megenai hubungan sebab-akibat atau adanya pengaruh.↩

Rabu, Juli 27, 2016

Validitas Kesimpulan Penelitian (Bagian 2)

Tulisan ini merupakan lanjutan dari tulisan sebelumnya Validitas Kesimpulan Penelitian (Bagian 1). Dalam bagian ini, saya akan membahas dua tipe validitas yang berikutnya setelah dua lainnya dijelaskan di bagian pertama. 


3. Validitas Konstruk

Tipe validitas kesimpulan penelitian ini terkait dengan pertanyaan: "Apakah intervensi / tritmen dan / atau pengukuran yang dilakukan dalam suatu penelitian mewakili secara tepat konstruk yang hendak diwakili?". Misalnya jika seorang peneliti memilih melakukan perlakuan dalam bentuk berbicara di depan umum untuk mewakili konstruk situasi mencemaskan, maka apakah intervensi tersebut telah benar-benar mewakili konstruk 'situasi mencemaskan' tersebut. Validitas konstruk di sini berkenaan baik dengan intervensi maupun instrumen pengukuran. 

Ancaman terbesar terhadap validitas konstruk ini adalah "tindakan yang dimaksudkan untuk menggambarkan suatu konstruk mengenai sebab [variabel independen] atau akibat [variabel dependen] dapat ditafsirkan sebagai perwakilan dari lebih dari satu konstruk, yang masing-masing dinyatakan pada tingkatan reduksi yang sama"[1,hal 59]. Atau dengan kata lain, konstruk yang berbeda dapat memiliki operasionalisasi yang sama baik dalam bentuk intervensi maupun instrumen pengukuran. 

Beberapa ancaman lain terhadap validitas konstruk misalnya:
  1. Bias peneliti, khususnya dalam penelitian eksperimental ketika peneliti tidak melakukan blind atau double blind sehingga muncul perlakuan eksperimenter yang berbeda terhadap kelompok kontrol di luar perlakuan yang menjadi tujuan penelitian.
  2. Treatment diffusion, atau perlakuan yang 'bocor' akibat adanya komunikasi antara kelompok eksperimen dengan kelompok kontrol. 
  3. Resentful demoralization, atau menurunnya semangat kelompok kontrol karena mereka tidak 'terpilih' sebagai kelompok yang memperoleh perlakuan. 
  4. Compensatory rivalry, atau meningkatnya semangat kelompok kontrol sebagai usaha untuk menunjukkan bahwa mereka tetap memberikan hasil yang baik meskipun tidak menerima perlakuan. 
  5. Eksplikasi konstruk preoperasional yang tidak tepat terjadi ketika peneliti kurang berhati-hati dalam menentukan komponen utama dari konstruk yang hendak dijadikan dasar penyusunan intervensi atau pengukuran. Eksplikasi konstruk ini tidak hanya meliputi usaha mendefinisikan konstruk dengan komprehensif tetapi juga memberikan batasan yang jelas dari konstuk-konstruk lainnya, khususnya konstruk yang berdekatan maknanya. 
  6. Mono-operation bias, atau penggunaan hanya satu set perlakuan atau pengukuran untuk mewakili suatu konstruk, sementara ada beberapa kemungkinan set lain yang seharusnya dipertimbangkan. 

4. Validitas Eksternal

Validitas eksternal terkait dengan generalisasi hasil penelitian pada seluruh populasi atau lintas waktu dan keadaan. Kemampuan sampel untuk merepresentasikan populasi merupakan isu utama dalam validitas eksternal ini. Validitas eksternal dapat ditingkatkan dengan meningkatkan heterogenitas sampel, baik sampel subjek penelitian maupun sampel waktu dan keadaan.  


Pustaka

[1] Cook, T.D., & Campbell, D.T.(1979).Quasi-experimentation: Design and analysis issues for field settings. Chicago: Rand McNally.

Selasa, Juli 26, 2016

Validitas Kesimpulan Penelitian (Bagian 1)

Validitas kesimpulan penelitian dalam tulisan ini didasarkan pada dua buku [1,2] yang menurut saya sangat lengkap membahas validitas kesimpulan penelitian. Dalam beberapa 'ajaran' di kelas metodologi yang saya ingat, biasanya istilah yang sering digunakan untuk menggambarkan validitas pengambilan kesimpulan ini adalah validitas penelitian. Istilah ini sepertinya dipilih untuk memilahnya dari validitas pengukuran. Saya pribadi lebih sreg dengan istilah validitas kesimpulan (inferensi) penelitian, karena yang dinilai valid adalah kesimpulan penelitiannya bukan penelitiannya itu sendiri. 

Valid berarti benar atau tepat. Kesimpulan penelitian dianggap valid jika kesimpulan tersebut dengan benar atau tepat menggambarkan fenomena yang diteliti. Misalnya: ketika peneliti menyimpulkan dari hasil penelitiannya bahwa ada pengaruh A terhadap B, maka kesimpulan ini dianggap valid bila realitasnya memang ada pengaruh A terhadap B. 

Validitas kesimpulan penelitian ini tentu saja tidak bersifat dikotomis (valid-tidak valid) dan tidak dapat diketahui dengan pasti. Namun demikian, peneliti dapat merencanakan dan menjalankan desain penelitian yang dianggap dapat memberikan bukti-bukti kuat (compelling evidence) yang mendukung kesimpulan penelitian. Dengan demikian, pembaca penelitian tersebut akan semakin diyakinkan bahwa kesimpulan penelitian memang dengan tepat menggambarkan fenomena yang diteliti. 

Ada 4 tipe validitas kesimpulan penelitian, yaitu [1,2]:
  1. Validitas Kesimpulan Statistik
  2. Validitas Internal
  3. Validitas Konstruk
  4. Validitas Eksternal
Ke-empat tipe validitas ini akan dibahas dalam tulisan kali termasuk ancaman-ancaman terhadap validitas kesimpulan penelitian dalam tipe tertentu. Penjelasan mendalam dapat diperoleh melalui dua pustaka yang saya sertakan di bawah. 

1. Validitas Kesimpulan Statistik

Validitas kesimpulan statistik terkait dengan pertanyaan: "apakah kesimpulan hasil analisis statistik sudah tepat?" Salah satu kesimpulan hasil analisis statistik yang sering diambil adalah apakah kita menolak atau gagal menolak hipotesis nol (H0: H nol). Ini berarti validitas kesimpulan statistik terkait dengan:

  1. Jika kita menolak H0, apakah besarnya tipe kesalahan 1 (alpha:menolak H0 yang benar) sesuai dengan yang kita tetapkan di awal. Misalnya, jika kita telah menetapkan bahwa kita hanya mengijinkan alpha sebesar 0.05, apakah hasil analisis statistik yang kita peroleh benar-benar memiliki alpha sebesar 0.05. Ini terkait dengan isu mengenai pengujian yang terlalu liberal: pengujian statistik mengakibatkan alpha lebih besar daripada yang diharapkan. Misalnya, meskipun program analisis statistik p < 0.05, sebenarnya p memiliki nilai yang lebih besar dari alpha = 0.05. Kesalahan ini dapat mengakibatkan kita menganggap adanya efek atau korelasi atau perbedaan mean, yang sebenarnya tidak ada di populasi. 
  2. Jika kita gagal menolak H0, apakah besarnya tipe kesalahan 2 (beta: gagal menolak H0 yang salah) tergolong kecil. Misalnya jika hasil analisis statistik menunjukkan tidak adanya perbedaan mean, maka apakah hasil ini memang diakibatkan tidak adanya perbedaan mean di populasi, atau hanya diakibatkan lemahnya sensitivitas analisis atau disebut juga power.  Pengujian statistik seperti ini disebut pengujian statistik yang terlalu konservatif. 
Ada beberapa ancaman yang dapat menyebabkan pengujian statistik menjadi terlalu liberal atau terlalu konservatif.

Pengujian statistik yang terlalu liberal, dapat diakibatkan oleh beberapa hal (catt: daftar di bawah ini tidak mencatat semua kemungkinan penyebab, oleh karena itu peneliti perlu memikirkan kemungkinan lainnya):
  1.  Melakukan pengujian lebih dari satu kali untuk membuktikan satu hipotesis umum yang sama. Beberapa penulis menyebutnya sebagai familywise error rate  atau experimentwise error rate. Ancaman ini dapat diatasi dengan melakukan misalnya penyesuaian alpha yang dikehendaki dengan teknik-teknik seperti Bonferroni, Tukey, Scheffe, dan lain-lain. 
  2. Pelanggaran asumsi oleh data penelitian. Pelanggaran asumsi dapat mengakibatkan baik uji statistik menjadi terlalu liberal atau konservatif. Ancaman ini dapat dikurangi dengan memilih analisis statistik yang robust terhadap pelanggaran asumsi oleh data. 
  3. Estimasi efek yang bias karena didasarkan pada sampel. Misalnya estimasi R kuadrat merupakan estimasi yang bias terhadap kondisi R kuadrat di populasi. Oleh karena itu ada beberapa teknik yang ditawarkan untuk mengoreksi estimasi ini agar lebih mendekati nilai di populasi. 
  4. Adanya researcher degrees of freedom [3,4], yaitu pilihan-pilihan peneliti yang terkait dengan desain penelitian yang dilakukan secara sembarangan, seperti pemilihan besarnya sampel, pemilihan variabel, dll. Misalnya peneliti mengumpulkan data mengenai banyak variabel kemudian 'memancing' variabel-variabel mana yang sekiranya berkorelasi satu dengan lain. Praktek ini akan meningkatkan probabilitas munculnya false positive  atau probabilitas kesalahan pengambilan kesimpulan mengenai parameter populasi ketika penelitian menunjukkan hasil yang signifikan.
  5. Kesalahan spesifikasi model dalam analisis. Kesalahan ini akan menyebabkan bias estimasi parameter yang dapat berakibat pada hasil analisis yang terlalu liberal. Kesalahan ini dapat terjadi ketika peneliti mengabaikan variabel yang penting atau relevan di dalam analisisnya. Peneliti dapat menghindari kesalahan ini dengan melakukan studi literatur yang sekomprehensif mungkin dan memasukkan selengkap mungkin variabel-variabel yang penting dalam analisis. 
Pengujian statistik yang terlalu konservatif, atau dapat dipandang juga sebagai lemahnya power dari analisis yang dilakukan.  Lemahnya power ini merupakan kendala yang dialami banyak penelitian di Psikologi [5]. Ancaman ini dapat muncul karena beberapa hal: 
  1. Ukuran sampel terlalu kecil. Cara yang paling sederhana untuk mengatasi ancaman ini adalah dengan merencanakan ukuran sampel sebelum penelitian. Ini dapat dilakukan dengan menggunakan power analysis [5]. 
  2. Reliabilitas pengukuran yang terlalu rendah. Reliabilitas yang rendah akan berdampak pada melebarnya standard error dan bias estimasi parameter. Ini akan membuat analisis cenderung memberikan hasil yang tidak signifikan dibandingkan yang seharusnya. 
  3. Variasi yang sangat besar pada subjek penelitian sehingga mengakibatkan besarnya standard error dari estimasi parameter. Ancaman ini dapat diatasi dengan mengendalikan variasi individu ini, misalnya dengan menggunakan statistik dengan memperlakukan variabel dengan variasi yang besar sebagai kovariat atau dengan memilih desain penelitian yang dapat mengurangi variasi ini seperti penggunaan desain penelitian amatan ulang atau penggunaan matched-pairs. 
  4. Pelanggaran asumsi oleh data juga dapat menyebabkan lemahnya power dari analisis, oleh karena itu transformasi data atau penggunaan analisis statistik yang robust dapat dijalankan untuk mengatasi ancaman ini. 

2. Validitas Internal

Validitas internal merupakan validitas terkait dengan pengambilan kesimpulan mengenai hubungan kausal / adanya pengaruh antara variabel independen dan variabel dependen. Validitas internal akan makin tinggi ketika penelitian dapat menyajikan dukungan yang meyakinkan akan adanya hubungan kausal ini. Ada beberapa ancaman yang dapat membuat keyakinan akan hubungan kausal ini melemah: 
  1. Bias seleksi; yaitu ketika karakteristik partisipan yang dikenai intervensi dan yang tidak memiliki perbedaan mencolok yang juga dapat mempengaruhi variabel dependen. Jika dalam penelitian tersebut diperoleh adanya perbedaan efek yang signifikan, maka akan muncul keraguan apakah efek ini dapat berasal dari intervensi yang diberikan atau akibat perbedaan karakteristik partisipan tadi. 
  2. Subjek gugur / mortalitas; yaitu ketika partisipan dengan karakteristik tertentu tidak lagi dapat diambil datanya atau memutuskan tidak mau lagi terlibat dengan penelitian. Karakteristik partisipan ini berkaitan dengan variabel dependen, sehingga keluarnya partisipan ini akan mempengaruhi hasil analisis. Keraguan akan muncul mengenai efek yang terlihat atau tidak terlihat, apakah ini diakibatkan intervensi atau karena berkurangnya partisipan yang memiliki karakteristik penting. 
  3. Pengetesan; yaitu perubahan skor tes dari subjek penelitian yang tidak diakibatkan oleh intervensi melainkan karena terbawanya efek saat pengetesan pertama. Ancaman ini relevan ketika peneliti merancang desain yang melibatkan amatan ulang. 
  4. Regresi; yaitu perubahan skor seseorang pada variabel dependen, khususnya ketika orang tersebut memiliki skor yang ekstrim, yang diakibatkan oleh fenomena statistik bukan karena intervensi. 
  5. Kematangan; yaitu perubahan skor tes yang tidak diakibatkan oleh intervensi, melainkan oleh kematangan subjek penelitian secara alami. 
  6. Sejarah; yaitu perubahan skor tes yang tidak diakibatkan oleh intervensi, melainkan oleh peristiwa yang terjadi bersamaan dengan dilakukannya intervensi. 



Pustaka
[1]  Shadish, W., Cook. T. D., & Campbell, D. T.(2002). Experimental and quasi-experimental designs for generalized causal inference. Boston: Houghton Mifflin Company.

[2] Maxwell, S. & Delaney, H. (2004). Designing experiments and analyzing data : A model comparison perspective. New York, NY.: Psychology Press.

[3] Simmons, J., Nielson, L., and Simonsohn, U., (2011), False-positive psychology: Undisclosed flexibility in data collection an analysis allows presenting anything as significant. Psychological Science. 22(11): 1359 - 1366.

[4] John, L.K., Loewenstein, G., & Prelec, D. (2012). Measuring the Prevalence of Questionable Research Practices With Incentives for Truth Telling. Psychological Science 23(5):524 to 532.

[5] Cohen, J.(1998) Statistical power analysis for the behavioral sciences. Hillsdale, NJ: Lawrence Erlbaum Associates.

Senin, Mei 02, 2016

Kritik Artikel tentang Statistik: "Seven Deadly Sin of Statistical Analysis"[1]

Artikel yang saya kritik ini merupakan salah satu contoh artikel yang ditulis untuk 'membetulkan' praktek analisis statistik, tetapi justru memperkenalkan kesalahan-kesalahan lain di dalamnya. Saya menduga, penulis artikel ini bukan orang yang benar-benar mempelajari statistik dengan seksama (statistik bukan area utama yang dipelajari mereka). Kritik yang saya berikan ini juga menunjukkan bahwa kita juga perlu berhati-hati dalam mempelajari artikel-artikel yang ditulis mengenai praktek statistik, yang ditulis dalam Bahasa Inggris yang diterbitkan dalam media di luar negeri. Tidak semua penulis tentang topik statistik memahami benar apa yang mereka tulis. Perlu kiranya membandingkan tulisan-tulisan seperti ini dengan tulisan lain yang ditulis oleh orang yang dikenal memiliki publikasi dalam bidang statistik. Dalam hal ini, tulisan saya sendiri tidak terlepas dari kemungkinan memperkenalkan kesalahan-kesalahan juga. 

Sin 1: Using parametric analysis for ordinal data


Artikel tersebut me-rancukan antara analisis parametrik dan analisis yang mensyaratkan data kontinum pada variabel dependen. Analisis parametrik tidak sama dengan analisis yang berasumsi data pada variabel dependen memiliki sifat kontinum. Analisis parametrik adalah analisis yang berasumsi bahwa statistik mengikuti distribusi tertentu. Kebanyakan analisis yang dikenal selama ini memang mengasumsikan statistik mengikuti distribusi normal, yang tergolong dalam distribusi data kontinum, namun demikian sangat banyak bentuk distribusi lainnya yang tidak masuk dalam kategori kontinum. Misalnya regresi poisson (atau regresi log-linear) yang berasumsi data variabel dependen mengikuti distribusi poisson yang diskrit, atau regresi logistic yang berasumsi data variabel dependen mengikuti distribusi binomial yang juga diskrit. Kedua analisis tersebut termasuk dalam analisis parametrik, bukan non-parametrik, karena berasumsi mengenai distribusi statistik di populasi.
            Saran yang diberikan bahwa peneliti sebaiknya menggunakan analisis non-parametrik jika berurusan dengan data ordinal, tidak cukup layak diikuti karena dua hal. Pertama seperti yang disebutkan di atas, jika kita bisa berasumsi bahwa distribusi dari data variabel dependen mengikuti distribusi tertentu, dan menyusun cara estimasi parameter berdasarkan distribusi tersebut, maka analisis yang kita gunakan tergolong parametrik. Kedua, dalam banyak kejadian, seperti yang diamati oleh Howell (1982) dan Nunnally (tahun lupa), ketika data memiliki sifat ordinal dan dianalisis menggunakan teknik yang mengakomodasi data ordinal maupun kontinum, hasil yang diperoleh tidak jauh berbeda: Kesimpulan yang diperoleh hampir selalu sama. Ini khususnya jika data ordinal tersebut memiliki nilai yang variatif (misal jika skor bisa bergerak dari 0 hingga 7, maka hasil analisis dengan teknik analisis data ordinal maupun kontinum akan saling mendekati).  Hasil analisis baru akan memberikan hasil yang berbeda secara kentara, ketika data ordinal hanya memiliki kategori yang sangat sedikit.

 Sin 2: Inappropriate use of parametric analysis


Sepertinya penulis enggan berkomentar tentang pemenuhan asumsi pertama: the study must be randomly drawn… Karena dapat dikatakan, hampir tidak ada data yang dapat diambil secara random, kecuali dalam studi simulasi. Asumsi ini mendasari semua teknik analisis statistik yang ada selama ini, oleh karena itu jika penulis mengatakan should only be employed if they can be fulfilled, maka tidak ada satupun teknik analisis statistik yang dapat digunakan. Jadi ?
            Penulis sepertinya juga tidak benar-benar memahami permasalahan di seputar pengujian asumsi normalitas. Jika p>0.05, dapatkah dinyatakan asumsi dipenuhi? Tidak. Ini terkait dengan kesalahan interpretasi nilai p yang dianut orang selama ini.
            Permasalahan lain dengan uji non-parametrik adalah rendahnya power. Oleh karena itu, penggunaan analisis non-parametrik akan beresiko gagal mengidentifikasi efek yang sebenarnya ada di populasi. Sementara itu saat ini mulai banyak modifikasi analisis (analisis yang robust) yang dikembangkan yang memberikan hasil yang cukup memuaskan ketika pelanggaran asumsi baik distribusi maupun jenis data dilanggar.

 Sin 3: Failure to consider type 2 statistical error


Istilah yang digunakan penulis,  type 2 statistical error , tidak lazim. Istilah yang lebih lazim digunakan adalah type 2 error, yang terkait dengan keputusan yang diambil. Statistical error memiliki impresi ‘standard error’ bukan keputusan yang diambil mengenai hasil analisis.
            Penulis menuturkan bahwa ketika peneliti tidak melaporkan Beta (probabilitas melakukan kesalahan tipe 2), maka ini dianggap sebagai kesalahan serius. Permasalahannya adalah, Beta tidak dapat dihitung tanpa pengetahuan mengenai efek di populasi (bukan di sampel seperti yang tersirat dalam artikel tersebut). Definisi yang diberikan oleh penulis mengenai D juga keliru: D bukan perbedaan mean antara dua sampel melainkan perbedaan mean antara dua populasi. Penulis menggunakan lambang yang benar (mu) tetapi menginterpretasikannya secara keliru. Tentu saja kita dapat mengatakan bahwa D di sampel itu merupakan estimasi yang unbiased terhadap D di populasi, tetapi perlu diingat pula bahwa, karena berupa estimasi, maka D juga berfluktuasi. Oleh karena itu, D yang kita peroleh di sampel bisa saja berbeda dengan penelitian replikasi. Berikutnya, ini membuat Beta yang diperoleh bisa keliru jika D di sampel sangat jauh dari D di populasi. Ini sebabnya, Beta jarang dianjurkan untuk dipaparkan. Kita juga bisa mendekati D di populasi dengan informasi dari penelitian-penelitian sebelumnya. Namun demikian, ini berarti Beta yang kita peroleh tidak spesifik terkait dengan penelitian kita, sehingga kita tidak dapat mengevaluasi penelitian kita berdasarkan Beta ini.
            Analisis power untuk menentukan besarnya sampel, memang penting untuk dilakukan. Analisis power juga membutuhkan nilai D di populasi yang biasanya didekati dengan informasi dari penelitian-penelitian sebelumnya. Berbeda dengan pelaporan Beta di atas, penggunaan D dari penelitian-penelitian sebelumnya memiliki manfaat untuk menentukan besarnya sampel dalam penelitian yang akan dilakukan, agar power dari analisis yang kita lakukan memadai.
            Catt: Sejauh ini saya belum menemukan analisis power yang melibatkan analisis non-parametrik. Ini salah satu kesulitan lain penggunaan analisis non-parametrik.

 Sin 4: Using unmodified t-test for multiple comparisons


Pertama, penulis memperkenalkan istilah yang kurang lazim mengenai apa yang disebutnya cumulative probability of erroneously rejecting the null hypothesis. Yang sebenarnya dibahas oleh penulis bukan cumulative… tetapi familywise error rate  atau experimentwise error rate. Berapa kalipun melakukan pengujian statistik untuk hipotesis yang sama, cumulative … akan tetap sama dengan alpha yang ditentukan oleh peneliti, misalnya 0.05. Tetapi dalam suatu kejadian riset tertentu, pengujian hipotesis berkali-kali akan meningkatkan familywise error rate.
            ‘Rumus’ dasar yang dipaparkan oleh penulis merupakan rumus sederhana yang tidak aplikatif dalam kondisi tertentu. Contoh sederhana, jika saya hendak menggunakan alpha sebesar 0.05, maka dengan tiga puluh kali melakukan pengujian, yang penulis sebut sebagai cumulative…  akan sama dengan 1.5, yang mana tidak mungkin karena probabilitas tidak mungkin lebih dari satu. Rumus yang sebenarnya adalah

Di sini, p adalah besarnya alpha yang ditentukan dan k adalah banyaknya pengujian yang dilakukan. Dengan rumus ini, maka familywise error rate dengan tiga puluh kali pengujian akan sama dengan 0.7853.

Sin 5: Underutilized of ANCOVA, multivariate regression, nonlinear regression, and logistic regression


Ide penulis mengenai ancova terlalu sempit, hanya menekankan fungsi kontrol terhadap confounding variables, sementara fungsi ancova lain, misalnya untuk meningkatkan power dari analisis tidak dibahas.
            Penulis secara keliru menyebutkan jenis variabel kontinum (tanpa menyebut kriterion atau prediktor) sebagai batasan analisis multivariate regression, dan dalam contoh yang diberikan, melakukan generalisisasi berlebihan pada variabel-variabel prediktornya, padahal analisis regresi multivariate dapat mengakomodasi penggunaan variabel-variabel prediktor yang tidak kontinum, misalnya dengan menggunakan dummy coding.
            Penulis juga secara keliru menyebutkan bahwa regresi logistik dapat digunakan ketika variabel independen kategorik dimasukkan dalam analisis. Regresi logistic digunakan hanya ketika variabel dependen yang memiliki sifat kategorik bukan variabel independennya.

 Sin 6: Reporting standard error instead of standard deviation


Pertama, penulis menunjukkan ketidakpahamannya dengan standard error, meskipun definisi teknis yang diberikannya benar. Standard error adalah ‘standard deviasi’ dari statistik di populasi: rata-rata penyimpangan statistik dari parameternya. Definisi non-teknis ini sudah cukup untuk menjelaskan pentingnya melaporkan standard error dalam sebuah penelitian. Jika standard error besar maka hasil analisis yang kita peroleh memiliki tingkat kepercayaan yang lebih rendah (misalnya ketika membuat 95% CI yang lebar karena standard errornya besar).
            Meskipun standard deviasi juga merupakan informasi penting untuk disajikan karena memberitahu pembaca mengenai sebaran data di sampel, standard error memberikan informasi yang sama sekali berbeda yang juga dibutuhkan untuk menjustifikasi hasil analisis. Penulis gagal menunjukkan pentingnya kedua informasi ini untuk disajikan karena hanya menekankan pada kemudahan interpretasi dari standard deviasi. Maka sebenarnya ia juga melakukan dosa karena melaporkan SD hanya karena ‘mudah diinterpretasi’.


Referensi


[1] Kuzon, W.M.,Urbanchek, M.G., & McCabe, S. (1996). The seven deadly sins of statistical analysis. Annals of Plastic Surgery. Vol 37(3) : 265 - 272.

Kamis, April 28, 2016

Kritik Penelitian: Perbandingan antara Mendengarkan Lantunan Kitab Suci* dan Mendengarkan Musik Klasik

Penelitian yang saya kritik ini adalah penelitian sesungguhnya, namun demikian judul penelitian saya ubah untuk menghindari sentimen agama. Ini saya lakukan dengan harapan pembaca lebih fokus pada kelemahan penelitian yang dilakukan, dan tidak terganggu dengan 'bungkus' agama-nya. Ini juga saya lakukan untuk menyadarkan pembaca, bahwa tidak semua penelitian yang terbit di luar negeri dan berbahasa inggris pasti benar. Banyak penelitian yang memiliki kelemahan yang cukup serius termasuk penelitian yang saya kritik ini. 


Sekilas mengenai Penelitian Ini

Penelitian ini hendak membandingkan pengaruh mendengarkan lantunan kitab suci dan mendengarkan musik klasik terhadap gelombang otak alpha yang diukur menggunakan EEG. Meningkatnya frekuensi gelombang alpha menunjukkan peningkatan kondisi rileks partisipan. Penelitian ini hendak membandingkan pola gelombang otak antara kedua intervensi, baik sebelum, pada saat dan setelah intervensi.

Partisipan penelitian terdiri dari 28 orang berusia antara 20 hingga 28 tahun. Peneliti memilih salah satu kitab dalam Kitab Suci untuk dilantunkan, sementara musik klasik yang dipilih adalah Canon D major oleh Palchelbel [1]. 

Prosedur eksperimen yang dijalankan sebagai berikut:
  1. Sebelum eksperimen dimulai, peneliti mengambil data gelombang alpha partisipan terlebih dulu selama 5 menit sebagai sampel. Partisipan diminta untuk menutup mata dan dalam posisi rileks.Kemudian partisipan diberi waktu istirahat selama 1 menit. 
  2. Peneliti memperdengarkan musik klasik selama 5 menit, sementara partisipan mendengarkan dengan menutup mata. Selama mendengarkan, gelombang alpha juga dicatat oleh peneliti. Kemudian partisipan diberi waktu istirahat selama 1 menit. 
  3. Peneliti mengambil data gelombang alpha kembali selama 5 menit, dengan partisipan menutup mata. 
  4. Sesi diakhiri dengan beristirahat, berbincang atau membaca majalah. 
  5. Prosedur ini diulang di hari kedua dengan memperdengarkan lantunan Kitab Suci. 
Peneliti juga melakukan interview dengan menggunakan kuesioner untuk menggali beberapa informasi seperti seberapa sering mendengarkan musik, alasan mendengarkan musik, dan apakah mereka setuju bahwa mendengarkan lantunan Kitab Suci memberikan lebih banyak manfaat daripada musik. 

Hasil Penelitian Berdasarkan Laporan Peneliti

Hasil Interview
Delapan puluh persen (80%) partisipan mengaku bahwa mereka senantiasa mendengarkan musik, sementara 20% partisipan mengaku jarang. Alasan mendengarkan musik yang memiliki persentase terbesar adalah bosan (28%), disusul untuk kesenangan (26%) dan meredakan ketegangan (22%). Sementara 14% mendengarkan musik sebagai hobi dan 10 % mendengarkan musik karena sedih. 

Dari 28 partisipan tersebut, 97% setuju bahwa mendegarkan lantunan Kitab Suci memberi manfaat lebih besar daripada mendengarkan musik. 

Analisis Data EEG
Peneliti melaporkan partisipan no 11, 12, 23, 21, 25, serta mean dari tiap sesi, untuk tiap belahan otak untuk tiap intervensi. 

Partisipan no 11 dilaporkan mengalami keseimbangan gelombang otak alpha lebih besar ketika mendengarkan lantunan Kitab Suci dibandingkan ketika mendengarkan musik. Hasil yang sama juga tampak pada partisipan no 12. 

Partisipan no 23 menunjukkan penurunan gelombang otak alpha (yang menunjukkan kondisi makin tidak rileks) ketika mendengarkan musik, sementara mengalami kenaikan ketika mendengarkan lantunan Kitab Suci. 

Partisipan no 21 mengalami kenaikan gelombang otak alpha yang lebih besar ketika mendengarkan lantunan Kitab Suci dibandingkan ketika mendengarkan musik. 

Partisipan no 25 memiliki gelombang alpha yang stabil setelah mendengarkan lantunan Kitab Suci meskipun lebih kecil dibandingkan mendengarkan musik. Peneliti menyimpulkan dampak psikoterapi religius lebih bertahan lama. 

Perbandingan mean antara kedua intervensi, menunjukkan bahwa ketika mendengarkan musik klasik gelombang alpha pada otak kanan mengalami peningkatan sebesar 8.9%. Grafik yang ditampilkan juga menunjukkan keseimbangan gelombang alpha antara otak kanan dan kiri baik setelah mendengarkan musik maupun lantunan Kitab Suci. 

Besarnya korelasi antara besarnya gelombang alpha pada otak kanan dan kiri juga dipaparkan sebagai bukti keseimbangan antara otak kanan dan kiri akibat intervensi. Peningkatan nilai korelasi sebesar 12.67% terjadi ketika partisipan mendengarkan lantunan Kitab Suci, dibandingkan dengan peningkatan sebesar 9.96% ketika mendengarkan musik. 

Kesimpulan
  1. Peneliti menyatakan adanya efek dari kedua intervensi terhadap gelombang otak. 
  2. 12.67% sampel menunjukkan peningkatan gelombang alpha sebelum dan setelah mendengarkan lantunan Kitab Suci, sementara hanya 9.96% peningkatan ditemukan ketika mendengarkan musik.
  3. Mendengarkan lantunan Kitab Suci dapat menghasilkan kondisi yang lebih rileks dan meningkatkan perhatian (more alert). 

Kritik Saya terhadap Penelitian Ini

Ada beberapa kelemahan dalam penelitian ini yang membuat saya sangat meragukan kesimpulan yang diambil. Saya mengklasifikasikannya dalam beberapa kategori [3,4]: Validitas Kesimpulan Statistik, Validitas Internal, Validitas Konstruk, dan Validitas Eksternal.

Validitas kesimpulan statistik.
Pada dasarnya dalam kategori ini sebuah penelitian diuji apakah kesimpulan yang diambil mengenai ada/tidak adanya efek / korelasi, sudah benar.

Saya memfokuskan pada hasil analisis data EEG saja dalam kritik ini. Peneliti melakukan kesalahan sangat fatal dalam mengambil kesimpulan penelitian yang diperoleh. Kesalahan tersebut adalah kesimpulan hanya didasarkan pada data yang mendukung dugaan peneliti saja. Sementara, gejala umum yang terjadi sebenarnya tidak mendukung dugaan peneliti. Misalnya:

1. Gejala umum yang dilihat dari mean gelombang alpha menunjukkan mendengarkan lantunan Kitab Suci cenderung menurunkan frekuensi gelombang alpha. Berikut screen shot dari histogram yang dibuat oleh peneliti dalam artikelnya.


Jika kita melihat grafik batang di atas, trend umum yang terjadi ketika mendengarkan lantunan Kitab Suci adalah gelombang alpha yang makin kecil (menunjukkan keadaan yang makin kurang rileks). Sementara ketika mendengarkan musik klasik, pola gelombang alpha berbeda antara belahan kanan dan kiri.

2. Jika kita menghitung proporsi partisipan yang mengalami peningkatan, maka


dapat disimpulkan bahwa proporsi partisipan yang mengalami peningkatan frekuensi gelombang alpha cenderung lebih banyak ketika kelompok mendengarkan musik klasik.

Dengan melihat pada dua grafik deskriptif ini, kita sudah bisa melihat kecerobohan peneliti dalam mengambil kesimpulan mengenai data.

3. Kelemahan berikutnya terkait dengan tidak dilakukannya uji signifikansi dalam penelitian tersebut. Saya melakukan uji signifikansi terhadap data tersebut dan menemukan bahwa, ketika mendengarkan musik klasik, tidak ada perbedaan frekuensi gelombang alpha yang signifikan antara sebelum, saat mendengarkan, dan sesudah mendengarkan musik klasik. Pada saat mendengarkan lantunan Kitab Suci, terdapat perbedaan gelombang alpha yang signifikan antara:

  • Sebelum dan sesudah intervensi, pada belahan otak kiri: sebelum intervensi frekuensi gelombang alpha lebih tinggi daripada setelah intervensi. 
  • Pada saat dan sebelum intevensi, pada belahan otak kanan: sebelum intervensi, frekuensi gelombang alpha lebih tinggi daripada saat intervensi.
  • Sebelum dan sesudah intervensi, pada belahan otak kanan: sebelum intervensi frekuensi gelombang alpha lebih tinggi daripada setelah intervensi. 
Kesimpulan dari uji signifikansi tersebut menunjukkan bahwa mendengarkan lantunan Kitab Suci justru menurunkan frekuensi gelombang alpha yang merupakan indikasi kondisi partisipan makin tidak rileks. 

4. Dalam melakukan analisis korelasional antara belahan otak kanan dan kiri, peneliti hanya melaporkan besarnya peningkatan koefisien korelasi sebelum dan pada saat intevensi. Ketika mendengar musik klasik, peningkatan korelasi hanya 7.60% sementara ketika mendengar lantunan Kitab Suci terjadi peningkatan korelasi sebesar 12.67%. Peneliti tidak melaporkan penurunan korelasi yang terjadi setelah intervensi dilakukan. Penurunan korelasi setelah mendengarkan musik klasik hanya 6.02% sementara penurunan korelasi setelah mendengarkan lantunan kitab suci sebesar 11.18%. Peneliti hanya melaporkan bagian pertama untuk menunjukkan kelebihan dari mendengarkan lantunan kitab suci, sementara tidak melaporkan bagian kedua yang menunjukkan kelebihan musik klasik. (Catatan: angka 7.60 dan 6.02 merupakan hasil hitungan saya sendiri, karena hasil hitungan dalam penelitian tersebut berbeda dengan yang saya temukan). 

Kesalahan pengambilan kesimpulan ini sangat berbahaya karena mengarahkan orang untuk mempercayai adanya efek positif yang sebenarnya tidak ada atau yang sebenarnya bersifat negatif.  

5. Peneliti juga tidak mengendalikan variabel gender, padahal dalam beberapa studi ditunjukkan adanya perbedaan gelombang alpha antara laki-laki dan perempuan ([2]). Hasil analisis, oleh karena itu, berpotensi bias. 

Validitas Internal
Ada beberapa kelemahan penelitian dari segi ini:
  1. Peneliti tidak melakukan counter-balancing urutan pemberian intervensi, meskipun memberikan jarak antara intervensi pertama dan kedua. Urutan pemberian intervensi bisa menyebabkan keraguan adanya efek, misalnya efek pada intervensi kedua bisa muncul karena efek yang terbawa dari intervensi pertama atau adanya efek Maturasi. 
  2. Pemilihan partisipan juga kurang dijelaskan secara detil, misalnya apakah yang dipilih sebagai partisipan adalah mahasiswa yang beragama sama dengan acuan Kitab Suci yang dilantunkan. Selain itu familiaritas terhadap musik klasik nampaknya juga tidak dipertimbangkan dalam pengambilan partisipan. Agama dan familiaritas dapat berpengaruh terhadap hasil penelitian. 
  3. Lamanya intervensi yang ditetapkan tidak memiliki basis argumen yang memadai: apakah secara teoretik lamanya intervensi (5 menit) memadai untuk menimbulkan efek.
Validitas Konstruk 
Ada paling tidak satu isu dalam penelitian ini terkait dengan validitas konstruk, yaitu penggunaan intervensi yang terbatas: hanya lantunan dari satu kitab saja tetapi digeneralisasi pada lantunan Kitab Suci dan hanya satu musik klasik saja tetapi digeneralisasikan pada Musik Klasik secara umum. Kelemahan ini terkait dengan mono-operation bias [3,4]. 

Validitas Eksternal
Penelitian ini memiliki keterbatasan validitas eksternal karena jumlah subjek yang terbatas sekaligus pengambilan sampel yang terbatas. Saya sangat memahami kondisi ini yang dapat diakibatkan besarnya biaya untuk melakukan eksperimen.  



Kesimpulan

Penelitian yang dirancang sangat baik sekalipun tidak akan lolos dari kelemahan-kelemahan penelitian, karena adanya keterbatasan waktu, tenaga dan biaya. Namun demikian, dalam pandangan saya, peneliti dalam artikel ini tergolong sangat ceroboh, jika tidak dapat dianggap dengan sengaja membengkokkan hasil penelitian agar terlihat mendukung dugaan peneliti. Peneliti mengabaikan banyak fakta dalam hasil penelitiannya yang tidak mendukung dugaannya, dan melaporkan efek penelitian yang mendukung secara berlebihan. 

Selain itu, entah karena sengaja atau karena ketidakpahaman, peneliti menuliskan kesimpulan dengan memelesetkan temuan. Dalam temuan angka 12.67% terkait dengan peningkatan korelasi antara belahan otak kanan dan otak kiri, tetapi dalam kesimpulan disebutkan 12.67% sampel mengalami peningkatan gelombang alpha. Pernyataan seperti ini jelas misleading informasi mengenai hasil temuan. 

Laporan penelitian seperti ini tidak selayaknya diterbitkan atau dikonsumsi publik. 

Catatan

*Kata "Kitab Suci" merupakan pengganti nama kitab suci yang disebutkan spesifik dalam tulisan aslinya. Saya memutuskan tidak menuliskannya di sini untuk menghindari perdebatan tidak perlu terkait dengan isu agama. Saya hanya ingin berdiskusi tentang permasalahan metode penelitian dalam penelitian ini saja.

Referensi

[1] Canon D Major by Palchebel. 

[2] M Matsuura ,K Yamamoto, H Fukuzawa, Y Okubo, H Uesugi, M Moriiwa, T Kojima, Y Shimazono. (1985). Age development and sex differences of various EEG elements in healthy children and adults — Quantification by a computerized wave form recognition method. Clinical Neurophysiology. Vol 60 (5): 394 - 406. DOI: http://dx.doi.org/10.1016/0013-4694(85)91013-2

[3] Shadish, W., Cook. T. D., & Campbell, D. T.(2002). Experimental and quasi-experimental designs for generalized causal inference. Boston: Houghton Mifflin Company. 

[4] Maxwell, S. & Delaney, H. (2004). Designing experiments and analyzing data : A model comparison perspective. New York, NY.: Psychology Press.

Selasa, April 26, 2016

Kisah Sebuah Pertanyaan di Kelas Siang

Saya teringat sebuah diskusi dengan seorang mahasiswa mengenai pertanyaan mengapa mahasiswa psikologi perlu belajar metode penelitian dan mengerjakan skripsi? Diskusi itu tidak hanya dilakukan di kelas tapi juga di kantor. Saya sangat menghargai keterbukaan mahasiswa tersebut menanyakan pertanyaannya, yang saya yakin sebenarnya juga ada dalam pikiran banyak orang, tidak hanya mahasiswa. Berikut adalah kisah pertanyaan tersebut dan jawaban-jawaban saya. Tentu saja kejadian sebenarnya tidak tepat seperti yang dikisahkan, jawaban-jawaban saya dalam artikel ini juga sudah melalui pemikiran yang lebih lama. 

Pertanyaan itu (Kalo dalam Bahasa Inggris: The Question)

"Pak, mengapa kita perlu menulis skripsi? Mengapa perlu belajar metode penelitian?",seorang mahasiswa bertanya dengan gamblangnya di sebuah siang, ketika kuliah seminar (semacam persiapan penulisan skripsi) berlangsung.

"Sebelum saya jawab, saya tanya dulu ya. Apa yang kamu bayangkan tentang psikologi ketika kamu memilih untuk kuliah di bidang psikologi?", demikian tanggapan saya.

"Ya, saya belajar tentang teori-teori psikologi dan bagaimana menerapkannya dalam praktek nyata," jawabnya.

"Bisakah memberikan contoh agar pendapatmu menjadi lebih jelas?", tanya saya.

"Misalnya begini, Pak," jawab mahasiswa tersebut,"Saya belajar tentang psikologi perkembangan anak. Dari sana saya mengetahui bahwa kita harus melakukan ini dan itu agar seorang anak dapat bertumbuh optimal. Kalau saya nanti bekerja sebagai guru atau psikolog anak, saya dapat menerapkan pengetahuan ini untuk menolong anak bertumbuh optimal."

"Jadi boleh dibilang kamu mengharapkan akan belajar teknik-teknik, cara-cara, dan semacam tips dan trik aplikasi psikologi, begitukah?", saya menyimpulkan.

"Ya kurang lebih begitu, Pak", jawabnya.

"Pertanyaan saya berikutnya: Bagaimana kamu tahu kalau apa yang diajarkan oleh dosen itu benar?", tanya saya.

"Yah, kan dosen sudah ahlinya, Pak. Bisa juga baca di buku apakah penjelasan dosen sudah sesuai dengan buku acuannya. Kan nggak mungkin lah, Pak, dosennya sembarangan ngajarnya", jawabnya.

"Ya. Berasumsi bahwa semua dosen dan penulis buku memiliki integritas, maka mereka pasti tidak akan sembarangan mengajar atau menulis. Nah, kalaupun asumsi ini benar, mereka juga punya keterbatasan dalam menggali sumber-sumber untuk mengupdate pengetahuan mereka. Sementara ilmu pengetahuan terus berkembang" jawab saya.

"Tapi apakah ini berarti mahasiswa harus mengupdate semua pengetahuan mereka dengan melakukan semua penelitian sendiri?" ia bertanya lagi.

"Tentu saja tidak. Kalau seperti itu entah kapan kamu akan menguasai bahkan hal paling dasar tentang psikologi", jawab saya.

"Jadi?", mahasiswa itu kembali bertanya.

Psikologi adalah Bagian dari Ilmu Pengetahuan

Psikologi adalah bagian dari Ilmu Pengetahuan. Ya, banyak orang akan bilang,"Saya tahu". Tapi mungkin banyak dari yang merasa tahu itu tidak menyadari konsekuensi dari pernyataan tersebut. Konsekuensi dari "Psikologi adalah bagian dari ilmu pengetahuan" adalah metode untuk memproduksi pengetahuan menjadi isu penting, sama pentingnya dengan pengetahuan yang ingin didapatkan.

Bahkan lebih jauh lagi, metode untuk memproduksi pengetahuan menjadi kriteria untuk menilai apakah pengetahuan yang dihasilkan dapat dipercaya atau tidak. Jika metode yang digunakan tidak baik, maka pengetahuan yang dihasilkan tentunya akan diragukan 'kebenarannya'. Ini berarti :

  1. Penilaian hanya dapat diberikan jika metode yang digunakan dalam memproduksi pengetahuan dipaparkan secara memadai. 
  2. Penilaian mengenai 'kebenaran' pengetahuan yang dipaparkan sangat bergantung pada 'kebenaran' metode yang digunakan. 
Kembali pada pendapat dosen atau ahli, dapatkah kita percaya pada kebenaran pendapat mereka? Jika pendapat mereka didasarkan pada metode yang tepat, maka tentu saja kita bisa mempercayainya. Dalam hal ini, pendapat dosen dan para ahli baru bisa dinilai 'benar' hanya jika mereka juga memaparkan metode memperoleh pengetahuan mereka. 

Bagaimana jika mereka mengacu pada sumber-sumber lain? 
Jika demikian adanya, maka penilaian mengenai 'kebenaran' pendapat mereka bergantung pada ketepatan penggunaan metode dalam sumber-sumber yang diacu. Ini berarti, jika kita hendak mengetahui apakah pendapat dosen atau para ahli itu benar, kita perlu membaca sumber-sumber yang menjadi acuan mereka juga. 


Metode Penelitian dan Berpikir Logis-Kritis

Nah, untuk bisa menilai apakah metode yang digunakan dalam sumber-sumber itu sudah tepat, perlu bagi mahasiswa untuk memahami metode penelitian. Dengan demikian, mahasiswa dapat menilai apakah pengetahuan yang mereka peroleh dapat dipercaya, dengan menilai apakah metode memperoleh pengetahuan tersebut sudah tepat. Lebih jauh, kelak setelah mereka lulus, mereka dapat menilai sendiri pengetahuan-pengetahuan yang akan mereka temukan dalam kehidupan mereka. 

Belajar metode penelitian juga mendorong mahasiswa berpikir logis dan kritis. Pilihan metode tertentu harus didasarkan pada pertanyaan apa yang hendak dijawab penelitian, hasil review literatur, dan hipotesis / pertanyaan penelitian yang diajukan. Kesimpulan dari hasil penelitian juga harus sesuai dengan metode yang digunakan. Misalnya, tanpa metode eksperimental, sulit sekali untuk mengambil kesimpulan mengenai hubungan kausal. Nah, dalam sumber-sumber yang dibaca tersebut, evaluasi mengenai apakah semua komponen ini sudah selaras dapat dilakukan mahasiswa, hanya jika ia menguasai metode penelitian.

Bagaimana dengan skripsi? 
Saya sendiri berpendapat bahwa Skripsi merupakan sarana pembelajaran metode penelitian yang cukup menyeluruh bagi mahasiswa. Di dalamnya mahasiswa tidak hanya belajar statistik saja, atau metode penelitian saja tetapi berusaha menggabungkan semua pengetahuan mengenai metode penelitian (dan kuliah terkait) di dalamnya. Untuk memilih satu metode misalnya, mahasiswa perlu mengetahui metode-metode alternatif dan argumen tidak memilih argumen metode alternatif tersebut. 

Skripsi juga memberi kesempatan pada mahasiswa untuk melatih kemampuan mengambil kesimpulan logis dari berbagai sumber yang dibaca dan dari data, memikirkan strategi yang paling tepat berdasarkan sumber bacaan, mengantisipasi pelaksanaan rencana, membangun argumen yang tajam namun sopan, mengkomunikasikan baik diri sendiri maupun hasil penelitian, dll. Banyak sekali ketrampilan yang dilatih dalam pengerjaan skripsi. 

Membaca Artikel Hasil Penelitian

"Tentu saja mahasiswa tidak akan diminta untuk melakukan semua penelitian untuk menjustifikasi informasi yang ia dapatkan. Mahasiswa bisa membaca artikel-artikel hasil penelitian dan mengevaluasi apakah informasi yang ia didukung oleh temuan-temuan terkini", saya menjelaskan kembali. 

"Dalam membaca hasil penelitian ini",saya melanjutkan,"perlu kiranya pembaca tidak hanya membaca bagian diskusi atau kesimpulan atau abstraknya saja - seperti yang sering dilakukan selama ini oleh banyak mahasiswa (dan akademisi juga). Metode penelitian merupakan bagian yang sama pentingnya dengan hasil penelitian untuk dibaca. Karena bagian metode inilah yang dapat digunakan untuk menilai apakah kesimpulan yang diambil oleh peneliti dapat dipertanggungjawabkan. Saya memiliki contoh penelitian yang sangat sembrono dalam menarik kesimpulan (bisa dibaca di sini)". 

Kerugian yang Ditimbulkan Pseudoscience

"Tapi, Pak. Mengapa kita perlu getol sekali mengejar informasi yang benar? Kalaupun tidak benar, tidak ada masalah serius kan, Pak? Misalnya ada yang menyebutkan bahwa musik klasik ciptaan mozzart dapat meningkatkan inteligensi. Kalaupun toh itu salah juga tidak ada masalah serius bukan?" tanya mahasiswa tadi. 

"Ada dua kerugian yang bisa ditimbulkan oleh informasi yang keliru, atau saya sebut dengan pseudoscience:
  1. Kerugian langsung baik dalam bentuk fisik, psikis, ekonomi, dll. Contoh paling konkret adalah praktek terapi yang keliru. Praktek terapi yang keliru bisa berujung pada bunuh diri, jika klien yang dilayani memiliki kecenderungan depresif berat. Atau bisa juga menyebabkan munculnya gangguan psikologis yang awalnya tidak diderita. Kasus lain misalnya terkait dengan kesaksian ahli yang berkontribusi menentukan nasib seorang terdakwa. Jika ahli tersebut memiliki informasi keliru, bisa terjadi seorang terdakwa yang berbahaya dilepaskan atau sebaliknya orang yang tidak bersalah masuk penjara. 
  2. Kerugian tidak langsung dapat berupa teralihkannya sumber-sumber daya yang seharusnya bisa dialokasikan pada usaha-usaha yang lebih berguna. Misalnya pada kasus efek mozzart: Dana yang seharusnya bisa digunakan untuk meningkatkan gizi, yang jelas-jelas didukung secara ilmiah dapat meningkatkan inteligensi, akan teralihkan pada pembelian CD musik mozzart atau alat lain pendukungnya. 
Kerugian-kerugian seperti ini seringkali tidak terdeteksi karena psikologi berurusan dengan 'barang yang tidak kelihatan' yang dipengaruhi oleh banyak sekali faktor dan dampak yang tidak langsung. Oleh karena itu dampak dari kesalahan tidak segera dirasakan, karena 'tidak terlihat'. Selain itu, korban penderita dapat senantiasa dijadikan alasan penyebab ketidakmanjuran intervensi. Kita sering mendengar 'ahli' berkata,"Ya itu tergantung pada orang masing-masing," atau,"Semua ini kembali pada individu nya sendiri-sendiri", atau,"Klien, dalam ketidak-sadarannya, menolak intervensi", dan lain-lain."

Pengalaman dan Testimoni

"Tapi, Pak. Bukankah kita juga bisa belajar dari pengalaman?", tanya mahasiswa tersebut. 

"Benar. Tetapi pengalaman pribadi sangatlah terbatas dalam hal generalisasi dan kontrol terhadap bias. Jika saya melakukan intervensi tertentu, sangat manusiawi jika saya mengharapkan intervensi tersebut berhasil. Dan harapan ini akan berpengaruh pada penilaian saya mengenai keberhasilan intervensi, meskipun saya sudah berusaha jujur. 

Ada satu bab dalam buku 'House of Cards: Psychology and Psychotherapy Build on Myth' karya Robin M Dawes yang memaparkan kelemahan 'pengalaman' dalam menjustifikasi kebenaran informasi atau intervensi.

Hal yang sama juga dengan testimoni saya kira.

Itulah mengapa mahasiswa psikologi perlu belajar tentang metode penelitian. Untuk membekali dirinya sendiri agar terlindung dari pendapat 'ahli' yang keliru dan tidak berdasar, sekaligus melindungi masyarakat juga agar praktek psikologi dari lulusan psikologi tidak sembrono", jawab saya sekaligus menutup diskusi itu. 

Apa pendapatmu?