วันพุธที่ 27 เมษายน พ.ศ. 2559

มันคืออำนาจจำแนกของแบบสอบถามจริงหรือ


            คำถามว่าทำไม เป็นคำถามที่ดีสำหรับคนที่ต้องการค้นหาคำตอบ เพราะคำว่าทำไมทำให้เกิดการหาคำตอบของคำว่าทำไม และแล้ววันหนึ่งคำว่าทำไมของผมก็เขามาเกี่ยวกับกับการหาอำนาจจำแนกของแบบสอบถามในโปรแกรม SPSS ซึ่งดูแล้วมันขัดแย้งกันในเชิงนิยาม
            เราต้องมาดูความหมายของอำนาจจำแนก หมายถึง ความสามารถของข้อคำถามที่สามารถจำแนกออกได้ตามสิ่งที่เราต้องการ เช่น แบบสอบถามเจตคติเกี่ยวกับการเรียน อำนาจจำแนกในกรณีนี้จะหมายถึง ข้อคำถามที่สามารถจำแนกคนออกเป็น 2 กลุ่มคือ คนที่มีเจตคติเกี่ยวกับการเรียน และคนที่ไม่มีเจตคติเกี่ยวกับการเรียน จากได้ศึกษาวิธีการสร้างและหาคุณภาพเครื่องมือ ในครั้งนี้เจาะจงแค่แบบสอบถามที่ให้ตอบเป็นแบบ Rating scale โดยจะเริ่มจากการนิยามศัพท์เฉพาะ สร้างข้อคำถามให้ครอบคลุมกับนิยามศัพท์ จากนั้นผ่านกระบวนการหาคุณภาพเครื่องมือ ไม่ว่าจะเป็นความตรงจากผู้ทรงคุณวุฒิ หาอำนาจจำแนกรายข้อ รวมถึงหาคุณภาพทั้งฉบับ ผู้เขียนจึงได้ทำการศึกษาวิธีการหาคุณภาพเครื่องมือของต่างประเทศผ่านการใช้โปรแกรม SPSS จึงได้พบกับความจริงบางอย่างที่ในไทยยังเข้าใจคลาดเคลื่อน




         ในเมืองไทยจะพบว่าการหาอำนาจจำแนกผ่านโปรแกรม SPSS จะดูค่าที่ช่อง Corrected Item-Total Correlation แล้วกำหนดค่า 0.2 ถึง 1.00 เป็นค่าที่บ่งชี้ว่าข้อดังกล่าวที่มีอำนาจจำแนก ซึ่งเป็นความเข้าใจที่คลาดเคลื่อนอย่างมากเพราะช่อง Corrected Item-Total Correlation ถือได้ว่าเป็น Correlation จากการคำนวณ จำเป็นอย่างยิ่งต้องเปิดตารางเพื่อหาค่าวิกฤตไว้เปรียบเทียบ ซึ่งค่าไหนที่มากกว่าค่าวิกฤตถือว่าเป็นข้อที่มีอำนาจจำแนก แต่ก็มีนักวิจัยส่วนใหญ่ที่ยังถ่ายทอดและทำผิดโดยยึดเกณฑ์ 0.2 ถึง 1.00 (เป็นเกณฑ์ของระบบคำตอบที่เป็น Dichotomous ตอบผิดกำหนดให้เป็น 0 ตอบถูกกำหนดให้เป็น 1) 
         จากความเข้าใจคลาดเคลื่อนเรื่องของการใช้เกณฑ์อำนาจจำแนกผิดประเภทแล้ว คำถามต่อมาคือ ช่อง Corrected Item-Total Correlation คือ ช่องที่ระบุอำนาจจำแนกจริงหรือ



          ซึ่งเมื่อตรวจสอบและการคำนวณแล้วค่าจากช่อง Corrected Item-Total Correlation  ไม่ตรงกับความหมายของอำนาจแจกแนก ซึ่งความหมายที่แท้จริงแล้วคือ จากที่ยกตัวอย่างแล้วมีข้อคำถามทั้งสิ้น 65 ข้อ ค่า Corrected Item-Total Correlation ข้อที่ b1 = .725 หมายถึง สหสัมพันธ์ระหว่างข้อมูลของข้อที่ b1 กับ ผลรวมข้อข้อที่ b2 ถึง b65 หรือ  สหสัมพันธ์ระหว่างข้อมูลของข้อที่ b1 กับ ค่าเฉลี่ยของข้อที่ b2 ถึง b65

  
              ซึ่งจะหมายถึงความสัมพันธ์ของ ข้อ b1 สัมพันธ์กับ ข้อที่เหลือเท่าไร ซึ่งขัดแย้งกับความหมายของอำนาจจำแนก หรืออาจจะกล่าวไว้ช่อง ช่อง Corrected Item-Total Correlation เป็นการหาความสอดคล้องของข้อคำถามรายข้อกับภาพรวมกับข้อคำถามที่เหลือ
              หากปรับเปลียนและทำความเข้าใจที่ถูกต้องยอมรับฟังด้วยเหตุและผลจะทำให้ระเบียบวิธีการวิจัย การสร้างเครื่องมือการหาคุณภาพของเครื่องมือมีความถูกต้องและมีความน่าเชื่อถือมากขึ้น

ความสุขของอิสระ
27 เมษายน 2559
เขียนที่คอนโดหรูใกล้หาดบางแสน

วันจันทร์ที่ 11 เมษายน พ.ศ. 2559

การกำหนดจำนวนกลุ่มตัวอย่างใน SEM

การกำหนดจำนวนกลุ่มตัวอย่างใน SEM
            จำนวนกลุ่มตัวอย่างที่นำมาเพื่อคำนวณ หาคำตอบในงานวิจัยเชิงปริมาณนั้นมีกฎเกณฑ์ในการตั้งไว้อยู่มากหมาย เมื่อกำหนดความพอเพียงต่อการคำนวณทดสอบสมมติฐานได้ก็จะทำให้งานวิจัยเพิ่มความน่าเชื่อถือมากขึ้น โดยในการกำหนดขนาดความพอเพียงได้มีนักวิชาการทั้งไทยและเทศได้กำการกำหนดไว้ เช่น การนับจำนวนตัวแปรสังเกตได้ แล้วทำการคูณด้วย 5 ถึง 20 เท่า ก็จะเป็นจำนวนที่กลุ่มตัวอย่างที่ต้องการ หรือการนับค่าพารามิเตอร์ที่ต้องการประมาณค่า แล้วทำการคูณด้วย 20 เท่า วันนี้ผู้เขียนอยากแนะนำเว็บไซต์ที่ใช้คำนวณขนาดหรือจำนวนกลุ่มตัวอย่างของสมการโครงสร้าง SEM นั้นคือhttp://www.danielsoper.com/statcalc/calculator.aspx?id=1 เมื่อเข้าไปแล้วจะพบกับเว็บไซต์ดังนี้
          

         
            จากนั้นเลือกให้โปรแกรมเพื่อคำนวณขนาดกลุ่มตัวอย่าง Sample Size

            เลือก A-priori Sample Size Calculator for Structural Equation Models  เพื่อคำนวณหาจำนวนกลุ่มตัวอย่างที่ต้องการ

                   จากนั้นกรอกลายละเอียดเกี่ยวกับ ข้อมูลที่ใช้ในการวิเคราะห์ ดังนี้ 
             Anticipated effect size = คือการกำหนด effect size คือ 0.1 0.3 และ 0.5 เรียงลำดับจาก effect size เล็ก กลางและใหญ่
             Desired statistical power level = คือค่า 1-Type II error
           Number of latent variables  = คือจำนวนตัวแปรแฝง แน่นอนว่าผู้วิจัยต้องรู้และวาดโมเดลของตนเป็น
           Number of observed variables = คือจำนวนตัวแปรสังเกตได
           Probability level = การตั้งค่าโอกาสในการมีนัยสำคัญทางสถิติหรือ Type I error


                 
         จากตัวอย่างนี้ผู้เขียนได้ยกตัวอย่าง ในงานวิจัยของผู้เขียนเอง คือการวิเคราะห์องค์ประกอบเชิงยืนยันของความต้องการจำเป็นของครูด้านการรู้การประเมินในชั้นเรียน วิเคราะห์ CFA  มีตัวแปรแฝง 1 ตัวและตัวแปรสังเกตได้ 7 ตัวทำการกำหนดค่าต่าง ๆ ลงในโปรแกรมเพื่อคำนวณจำนวนกลุ่มตัวอย่าง
             Anticipated effect size  กำหนด เป็น 0.1 หมายถึง effect size effect size เล็ก 
             Desired statistical power level กำหนดค่า P ที่ 0.8 
            Number of latent variables  กำหนดเป็น 1 เพราะ จากโมเดลของผู้วิจัยมีตัวแปรแฝง 1 ตัว
            Number of observed variables กำหนดเป็น 7 เพราะ จากโมเดลของผู้วิจัยมีตัวสังเกตได้ 7 ตัว
            Probability level กำหนดเป็น 0.05 

           โปรแกรมจะคำนวณหากลุ่มตัวอย่างในครั้งนี้ได้จำนวน ต่ำสุดที่แนะนำคือ 400 คน นำหลักการนี้ไปใช้คำนวณหากลุ่มตัวอย่างกับการทดสอบสถิติอื่น ๆ ได้นะครับ 

ความสุขของอิสระ
11 เมษายน 2559
เขียนที่คอนโดหรูใกล้ชายหาดบางแสน


วันศุกร์ที่ 1 เมษายน พ.ศ. 2559

ความเข้าใจที่คลาดเคลื่อน เกี่ยวกับการรายงานผลคะแนนโอเน็ต กรณีศึกษาจากการโพสผ่านสื่อสังคมออนไลน์

ความเข้าใจที่คลาดเคลื่อน เกี่ยวกับการรายงานผลคะแนนโอเน็ต กรณีศึกษาจากการโพสผ่านสื่อสังคมออนไลน์
          คะแนนทดสอบระดับชาติ (O-NET) ของไทย ได้ประกอบผลสอบแล้ว ได้มีหน่วยงานได้รายงานคะแนนในเชิงเปรียบเทียบ รวมถึงรายงานในรูปของพัฒนาการแล้วจัดลำดับคะแนน จากการได้รับรู้จากสังคมออนไลน์และได้ทำการสังเกตวิธีการจัดเรียงลำดับพบว่าผู้ที่มีส่วนเกี่ยวข้องได้ทำการเปรียบเทียบหรือรายงานแบบเกิดความเข้าใจที่คลาดเคลื่อนไปมา ตัวอย่างแรกที่ผู้เขียนได้พบ

ความคลาดเคลื่อนที่พบ 1
            คะแนนผลการทดสอบของโรงเรียนแห่งหนึ่งทั้ง 5 วิชา เป็นดังนี้
ไทย      44.10    คณิต     35.68    วิทย์      36.60    สังคม    47.40    อังกฤษ  32.80
            มีหลายท่านได้ทำการรวมร้อยละจาก 5 วิชา ดังนี้
(44.10 + 35.68+ 36.60 + 47.40+ 32.80)/5 = 39.32
            ซึ่งกรณีเช่นนี้เป็นการรวมตัวของคะแนนจากต่างวิชา ดังนั้นจึงควรปรับให้อยู่ในรูปคะแนนมาตรฐานก่อน โดยสามารถศึกษาได้จากบทความที่แล้วมา  http://issarabuu.blogspot.com/2016/03/o-net.html ซึ่งผู้มีส่วนเกี่ยวข้องควรให้ความสำคัญในการทำความเข้าใจของคะแนนมาตรฐานเป็นอย่างมาก เพราะมีการรายงานผลที่คลาดเคลื่อนออกไปในวงกว้าง ถึงแม้ว่าช่วงคะแนนแนนของทั้ง 5 วิชาจะมีช่วง 100 ช่วงที่เท่ากันก็ตาม

ความคลาดเคลื่อนที่พบ 2 
            ได้มีการเปรียบเทียบคะแนนระหว่างปีการศึกษา เช่น เปรียบเทียบคะแนนรวมปีศึกษา 2558 กับ 2559
วิชา/ปีการศึกษา
2558
2559
ไทย
42.64
44.10
คณิต
32.40
35.68
วิทย์
37.63
36.60
สังคม
42.24
47.40
อังกฤษ
30.62
32.80
ค่าเฉลี่ย
37.11
39.32
ส่วนเบี่ยงเบนมาตรฐาน
5.51
6.15



           





ตารางกรณีดังกล่าว ก็จะมีการรายงานว่า ปีการศึกษา 2559 มีค่าเฉลี่ยรวม 39.32 ปีการศึกษา 2558
มีค่าเฉลี่ยรวม 37.11 โดยทั่วไปที่ผู้เขียนพบเจอก็จะรายงานว่ามีพัฒนาการขึ้น 39.32 – 37.11= 2.21 ถือว่าผิดไหมในฐานนะนักวัดผลก็จะตอบว่า น่าจะทำให้ครบกระบวนการแล้วนำมาเปรียบเทียบน่าจะให้รายงานผลพัฒนาการที่น่าเชื่อถือกว่า นั้นก็คือการแปลงเป็นคะแนนมาตรฐาน T-SCORE หรือแปลงเป็นคะแนนมาตรฐาน Z-SCORE

การปรับความเข้าใจคลาดเคลื่อนไปสู่ความเข้าใจที่ถูกต้องทำอย่างไร
วิชา/ปีการศึกษา
2558
T-SCORE
2559
T-SCORE
ไทย
42.64
60.04
44.10
57.78
คณิต
32.40
41.46
35.68
44.09
วิทย์
37.63
50.95
36.60
45.58
สังคม
42.24
59.32
47.40
63.14
อังกฤษ
30.62
38.23
32.80
39.40
ค่าเฉลี่ย
37.11
50
39.32
50
SD
5.51
10
6.15
10
           
ปีการศึกษา
2558
2559
ค่าเฉลี่ย
SD
คะแนนรวม
37.11
39.32
38.22
1.11
T-SCORE
40
60
50
10

            เมื่อแปลงเป็นคะแนนมาตรฐานแล้วพบว่า คะแนนมาตรฐานเป็นการปรับคะแนนสอบทั้ง 2 ปีการศึกษามีความทัดเทียมกัน สังเกตจาก ค่าเฉลี่ย และส่วนเบี่ยงเบนมาตรฐานที่เท่ากัน (ค่าเฉลี่ย=50, SD= 10) ทำการเปรียบเทียบเป็นรายวิชา
            ในส่วนของคะแนนรวมเมื่อแปลงเป็นคะแนนมาตรฐานแล้วจะพบว่าในปีการศึกษา 2559 โรงเรียนแห่งนี้มีพัฒนาการทางบวกคิดเป็น 60-40 = 20 ซึ่งเมื่อมีหลายโรงเรียนควรปรับเปลี่ยนให้อยู่ในคะแนนมาตรฐานแล้วจึงนำมาเรียงลำดับตามพัฒนาการจึงจะมีความเหมาะสมกว่า การลบกันของค่าเฉลี่ย

1 เมษายน 2559
ความสุขของอิสระ
เขียนที่คอนโดหรูย่านมหาวิทยาลัย ดังแถวบางแสน





วันอาทิตย์ที่ 27 มีนาคม พ.ศ. 2559

การรายงานผลคะแนนอย่างเหมาะสม กรณีตัวอย่างรายงานผลคะแนน O-NET



         คะแนการทดสอบระดับชาติของไทย O-NET ก็เริ่มประกาศผลการทดสอบมาแล้ว คนที่ลุ้นมากกว่านักเรียนก็คือครูผู้สอน มีหลายโรงเรียนและหลายเขตพื้นที่การศึกษาได้ทำรายงานเพื่อรายงานผลคะแนนออกมาแล้ว ซึ่งในรายงานดังกล่าวถูกต้องไหม ผมตอบว่าถูกแต่ก็ยังไม่ถูกหลักและความเหมาะสมเลยทีเดียว  สทศ ที่เป็นหน่วยงานสถาบันที่เกี่ยวข้องกับเรื่องนี้เต็มๆ และผมเน้นย้ำอีกนะครับว่าจุดมุ่งหมายของการประกาศผลสอบในครั้งนี้ไม่ได้เป็นการมุ่งหวังเพื่อเปรียบเทียบ แต่ใช้เป็นสารสนเทศในการจัดการด้านการศึกษาต่อไป
        จากประสบการณ์การเป็นข้าราชการครูประมาณ 5 ปี ได้มีโอกาศทำงานด้านวิชาการอยู่บ้าง ยังไม่มีหน่วยงานให้ความรู้ในเรื่องดังกล่าวอย่างถูกต้อง วันนี้ผมในฐานคุณครูและนักวิจัย นักวัดผลและเป็นส่วนหนึ่งของหัวข้อดุษฏีนิพนธ์ เรื่อง การพัฒนาการรู้การประเมินของครู ด้วยการประเมินเพื่อการเรียนรู้แบบเสริมพลังอำนาจ โดยการรู้การประเมินของครู (Assessment Literacy) นั้นเป็นเรื่องที่ต้องได้รับการส่งเสริมอย่างถูกต้องและถูกวิธี อย่างยั่งยืน และมีองค์ประกอบหนึ่งที่เกี่ยวข้องโดยตรงเลยคือ เรื่อง การรายงานผลคะแนนอย่างเหมาะสม เพื่อเป็นการส่งเสริมความความเข้าที่ถูกต้องและเหมาะสม จึงอยากจะขอยกกรณีตัวอย่าง การรวมผลคะแนนโอเน็ตในระดับโรงเรียน โดยเป็นวิธีการที่ถูกต้องที่สุดไหม ผมตอบว่าไม่ แต่เป็นวิธีการที่เหมาะสมและมีความน่าเชื่อถือ

ตัวอย่าง ผลการทดสอบ O-NET
วิชา Mean SD
ไทย 52.08 6.02
คณิต 50.00 5.00
วิทย์ 43.42 5.22
สังคม 52.33 7.16
อังกฤษ 45.42 9.83
Mean รวม 48.65
SD รวม 3.60

         เมื่อผลการทดสอบประกาศมา ก็จะมีการจัดทำรายงานโดยก็จะรายงานเป็น ในภาพรวมของโรงเรียนแห่งนี้ มีผลการทดสอบรวม เท่ากับ 48.65 (ไทย+คณิต+วิทย์+สังคม+อังกฤษ) ส่วนเบี่ยงเบนมาตรฐาน เท่ากับ 3.06 (ไทย+คณิต+วิทย์+สังคม+อังกฤษ) 
         การรวมกันทั้ง 5 วิชานั้น โดยช่วงคะแนนเท่ากัน คือทุกวิชาคะแนนเต็ม 100 เท่ากัน แต่ทางการวัดผลถือว่าเป็นการรวมสิ่งที่ต่างกัน ยกตัวอย่างเช่น การรวมกันของ มะนาว มะพร้าม ส้มโอ แตงโม และลำไย ดังนั้นแล้วหากต้องการรวมสิ่งเหล่านี้เข้าด้วยกันก็ควรมีการปรับให้ทุกอย่างอยู่ภายใต้เงื่อนไขเดียวกัน จึงควรปรับให้เป็นคะแนนมาตรฐาน (รายงานเป็น Z-SCORE หรือ T-SCORE) แล้วจึงรายงานผล
จะทำให้ผลการรายงานมีความน่าเชื่อถือเพิ่มมากขึ้น ใช้เป็นสารสนเทศในการบริหารจัดการต่อไป

การแปลงเป็นคะแนน Z-SCORE จากสูตร (คะแนนรายวิชา-MEAN5วิชา)/SDรวม5วิชา

การแปลงเป็นคะแนน T-SCORE จากสูตร (10Z+50)

ดังนั้นจะหา T-SCORE ได้ ต้องทราบค่า Z-SCORE ก่อน

ตัวอย่าง ปรับคะแนนวิชาภาษาไทยเป็นคะแนน Z-SCORE  = (52.08-48.65)/3.60  = 0.952
ตัวอย่าง ปรับคะแนนวิชาภาษาไทยเป็นคะแนน T-SCORE  = 10(0.952)+50 = 59.519

และทำการแปลทุกรายวิชา

วิชา Mean SD Z-SCORE T-SCORE
ไทย 52.08 6.02 0.952 59.519
คณิต 50.00 5.00 0.375 53.747
วิทย์ 43.42 5.22 -1.451 35.485
สังคม 52.33 7.16 1.021 60.213
อังกฤษ 45.42 9.83 -0.896 60.213
Mean รวม 48.65
SD รวม 3.60


          รายงานผลเราก็รายงานในภาพรวม แต่ในครั้งนี้เราจะใช้คะแนนมาตรฐานเป็นตัวรายงาน ซึ่งถือว่าเป็นวิธีที่เหมาะสม ในครั้งนี้ผู้เขียนจะแสดงการรายงานผลทั้ง Z-SCORE และ T-SCORE

กรณี  Z-SCORE 
     วิชาภาษาไทย Z-SCORE = 59.519 หมายความว่า คะแนนภาษาไทย มีผลการทดสอบที่สูงกว่าค่าเฉลี่ยของโรงเรียน
      วิชาคณิต Z-SCORE = 0.375 หมายความว่า คะแนนคณิต มีผลการทดสอบที่สูงกว่าค่าเฉลี่ยของโรงเรียน
       วิชาวิทย์ Z-SCORE = -1.451 หมายความว่า คะแนนวิทย์ มีผลการทดสอบที่ต่ำกว่าค่าเฉลี่ยของโรงเรียน
       วิชาสังคม Z-SCORE = 1.021 หมายความว่า คะแนนสังคม มีผลการทดสอบสูงกว่าค่าเฉลี่ยของโรงเรียน
       วิชาอังกฤษ Z-SCORE = -0.896 หมายความว่า คะแนนอังกฤษ มีผลการทดสอบที่ต่ำกว่าค่าเฉลี่ยของโรงเรียน
   ****หากแปลงเป็นคะแนน Z-SCORE เครื่องหมายเข้ามาเกี่ยวข้อง คือ + และ - โดยหากผลไปในทิศทางบวกแสดงว่ามากกว่าค่าเฉลี่ย และในทางตรงกันข้ามหากมีทิศทางไปด้านลบก็จะหมายถึงต่ำกว่าค่าเฉลี่ย****

กรณี  T-SCORE 
         วิชาภาษาไทย T-SCORE = 0.952 หมายความว่า คะแนนภาษาไทย มีผลการทดสอบที่สูงกว่าค่าเฉลี่ยของโรงเรียน
          วิชาคณิต T-SCORE = 53.747 หมายความว่า คะแนนคณิต มีผลการทดสอบที่สูงกว่าค่าเฉลี่ยของโรงเรียน
          วิชาวิทย์ T-SCORE = 35.485 หมายความว่า คะแนนวิทย์ มีผลการทดสอบที่ต่ำกว่าค่าเฉลี่ยของโรงเรียน
           วิชาสังคม T-SCORE = 60.213 หมายความว่า คะแนนสังคม มีผลการทดสอบสูงกว่าค่าเฉลี่ยของโรงเรียน
           วิชาอังกฤษ T-SCORE = 60.213 หมายความว่า คะแนนอังกฤษ มีผลการทดสอบสูงกว่าค่าเฉลี่ยของโรงเรียน
         ****หากแปลงเป็นคะแนน T-SCORE มากกว่า 50 แสดงว่ามากกว่าค่าเฉลี่ย และน้อยกว่า 50 แสดงว่าต่ำกว่าค่าเฉลี่ย****

            ผู้เขียนหวังเป็นอย่างยิ่งว่า ผุ้ที่มีส่วนเกี่ยวข้องจะได้ใช้ความรู้จากการอ่านในครั้งนี้ไปปรับใช้กับการรายงานผลคะแนน  จุดประสงค์ของ สทศ ที่ปรับให้หน่วย 100 เท่ากัน ก็เพื่อที่จะให้ครูผู้สอนใช้เปรียบเทียบภายในโรงเรียน หรือรายวิชานั้นๆ ในภาคเรียนนั้นๆ เท่านั้น  หากจะปรับหรือเปรียบเทียบหรือรวมกัน จึงควรปรับให้เป็นคะแนนมาตรฐานดังตามตัวอย่างข้างต้น
             ถือแม้ว่าการรายงานผล ความหมายจะไม่เปลี่ยนจากการรายงานโดยใช้ค่าเฉลียเลย แต่ผู้เขียนก็อธิบายแล้วว่า คะแนนมาตรฐานเป็นการปรับแก้สิ่งที่ต่างกันให้สามารถเปรียบเทียบกันได้อย่างมีความน่าเชื่อถือนะครับ
                                                                                                                        อิสระ กุลวุฒิ 28/03/2559
                                                                                                                   เขียนที่ร้าน Together coffee



วันอาทิตย์ที่ 6 มีนาคม พ.ศ. 2559

ความยากของข้อสอบสำคัญไหม

          ก่อนจะพิจารณาว่าความยากของข้อสอบสำคัญไหม เรามาทำความรู้จักกับความยากของแบบทดสอบกันก่อน โดยในการเขียนแสดงความคิดเห็นครั้งนี้เป็นการใช้กรณีศึกษาของแบบทดสอบผลสัมฤทธิ์ทางการศึกษาทั่วไปที่เป็นกรณีตอบถูกกำหนดให้เป็น 1 และตอบผิดกำหนดให้เป็น 0
1.      ความยากข้อข้อสอบคืออะไร ตอบแบบทางการหน่อยมันก็คืออัตราส่วนของผู้ที่ตอบถูกหารด้วยผู้ที่
เข้าสอบทั้งหมดโดยพิจารณาเป็นรายข้อ จะเห็นได้ว่าหากผู้ที่ตอบถูกในข้อนั้นๆ มากจะทำให้ค่าความยากมีค่าสูง(ข้อนี้คนตอบถูกเยอะน่าจะง่าย) ในทางตรงกันข้ามหากมีผู้ที่ตอบข้อสอบข้อนั้นถูกจำนวนไม่มากก็จะทำให้ค่าความยากมีค่าน้อย (ข้อนี้คนตอบถูกน้อยน่าจะยาก)
ตัวอย่าง มีผู้เข้าสอบทั้งหมด 10 คน ในข้อที่ 1 ตอบถูกทั้งสิ้นจำนวน 8 คน ค่าความยากจะเท่ากับ 8/10=0.80 และในข้อที่ 2 ตอบถูกทั้งสินจำนวน 3 คน ค่าความยากจะเท่ากับ 2/10= 0.20 คน
2.      0.20 ถึง 0.80 เป็นค่าที่ถือว่าข้อสอบมีคุณภาพจริงหรือ หากศึกษาจากตำราไทยร้อยละ 99.99
มีทิศทางเดียวกันคือ ค่าความยากตั้งแต่ 0.20 ถึง 0.80 ถือว่าข้อสอบข้อนั้นมีค่าความยากที่ถือว่าใช้ได้ ควรเก็บข้อคำถามนั้นไว้ใช้เก็บข้อมูลจริงได้ คำถามในใจต่อมาจริงหรือ ต้องตอบก่อนว่าเหตุผลที่ตำราไทยให้คำแนะนำว่าข้อสอบควรมีค่าความยากระหว่าง 0.20 ถึง 0.80 เพราะในการทดสอบที่ใช้ข้อสอบแบบกรณี 2 ค่า (Dichotomous) คือกำหนดให้ตัวเลือก (Choice) ตอบถูกกำหนดให้มีค่าเป็น 1 ตอบผิดให้มีค่าเป็น 0 จะเชื่อโยงเข้าไปสู่ความแปรปรวนรายข้อ คือกำหนดช่วงให้มีขนาดกว้างมากขึ้นจะทำให้ความแปรปรวนรายข้อของข้อสอบข้อนั้นลดต่ำลง และเมื่อความแปรปรวนของข้อคำถามลดต่ำลงก็จะเป็นปัจจัยที่นำไปสู่ความเที่ยงของข้อสอบกรณีอิงกลุ่ม (KR-20, KR-21) สูงขึ้นนั้นเอง ดังนั้นแล้วสารสนเทศที่ได้จากค่าความยากของข้อสอบจึงบอกความมีคุณภาพได้ไม่มาก จึงควรใช้เกณฑ์การหาคุณภาพของข้อสอบอื่นๆ ร่วมด้วย
3.      เราไม่ต้องการความยากได้ไหม ในการแสดงความคิดเห็นครั้งนี้เน้นนะครับคือการยกตัวอย่างบริบท
จริงกับแบบทดสอบผลสัมฤทธิ์ทางการเรียน ที่ครูใช้กับนักเรียนโดยทั่วไป ตอบครับหากต้องการทำให้ถูกต้องตามกระบวนการวิจัยหรือระเบียบวิธีวิจัยไทยที่ทำตามกันมา การหาความยากก็ไม่เสียหายอะไร แต่ในมุมมองที่เปิดกว้างทางการศึกษาด้านสังคมศาสตร์และพฤติกรรมศาสตร์เราไม่จำเป็นต้องการค่าความยากก็ได้หากตัวครูผู้สอนสร้างข้อคำถามได้มีความตรง (Validity) คำเตือน หากท่านทำงานวิจัยเพื่อเลื่อนวิทยฐานะควรทำตามกติกา เพราะเนื่องจากกรรมการที่ตรวจงานของท่านมักไม่เปิดมุมมองข้างต้น แต่หากพูดถึงกรณีการนำความยากไปใช้ประโยชน์ทางตรงกรณีที่โรงเรียนมีการใช้ระบบคลังข้อสอบหรือพัฒนาคลังข้อสอบ (Item bank)
4.      อยากให้ครูนำประโยชน์จากความยากไปใช้ กรณีนี้อาจจะไม่ถึงระบบคลังข้อสอบก็ได้ ยกตัวอย่าง
โต้งสอบวิชาวิทยาศาสตร์ตก ครูผู้สอนหากคำนึงถึงความได้เปรียบเสียเปรียบความเท่าเทียบกัน ครูก็ต้องใช้ข้อสอบข้อใหม่แต่มีความยากที่ใกล้เคียงกันหรือเท่ากับของเดิมซึ่งเป็นได้ได้ยากและเสียเวลามากถ้าไม่มีระบบคลังข้อสอบ
จากประโยชน์ข้างต้นทำให้ทุกวันนี้ถูกพัฒนาไปในเรื่องของการทำหน้าที่ต่างกันของข้อสอบ ภาษานักวัดผลจะพูดว่าข้อสอบข้องนั้น diff ไหม

          ความยากข้อสอบสอบเป็นการแสดงจำนวนคนหรืออัตราส่วนที่ตอบถูกในข้อนั้นๆ ประโยชน์ที่ได้จากการหานำไปใช้ประโยชน์ได้น้อย หากผู้ประเมินผลการวิจัยที่ตั้งตนเป็นผู้เชี่ยวชาญแต่ไม่เชี่ยวชาญเปิดใจรับฟังเหตุผลจะทำให้ครูประหยัดเวลาอาจจะไม่มาก แต่ก็หากแล้วไม่ได้ใช้ประโยชน์อะไรต่อ  แต่หากโรงเรียนของท่านมีระบบคลังข้อสอบ (Item bank) หรือกำลังพัฒนาภายใต้การวัดแบบดั่งเดิมความยากจำเป็นอย่างมากที่ครูจำเป็นต้องหา

วันพุธที่ 11 กุมภาพันธ์ พ.ศ. 2558

The Ruiz-Primo and Furtak model

The Ruiz-Primo and Furtak model
รูปแบบการประเมินในชั้นเรียนของ Ruiz-Primo and Furtak เป็นรูปแบบการประเมินที่ใช้วงรอบการประเมินแบบ ESRU (คำถามกระตุ้นเร้าเพื่อนำเข้าบทเรียน Elicit question, การตอบสนองของนักเรียน Student response, การพึงระลึกโดยครูผู้สอน Recognition by teacher, การใช้สารสนเทศที่ได้จากนักเรียน Use of information) การประเมินผลระหว่างเรียนตามรูปแบบของ Ruiz-Primo and Furtak จะเป็นการประเมินที่เป็นวงรอบ มีเหตุเกิดขึ้นก่อนหลัง เริ่มด้วยในขั้นของ คำถามกระตุ้นเร้าเพื่อนำเข้าบทเรียน (Elicit question) ครูจะเป็นผู้ที่ป้อนข้อคำถามเพื่อให้นักเรียนได้คิด ค้นหา ร่วมหาแนวทางในการหาคำตอบ อาจจะมีลักษณะเป็นการอธิปรายย่อย ขั้นการตอบสนองของนักเรียน (Student response) เป็นขั้นที่ครูต้องสังเกตไม่ว่านักเรียนจะตอบสนองออกมา ทางรูปแบบใดรูปแบบหนึ่งครูต้องอาศัยประสบการณ์ในสังเกต การพึงระลึกโดยครูผู้สอน (Recognition by teacher) จะเป็นขึ้นที่ต่อเนื่องโดยครูเมื่อเห็นพฤติกรรมการตอบสนองของนักเรียนก็จะทราบทันทีว่านักเรียนมีการรับรู้เกี่ยวกับเรื่องที่เรียนได้มากน้อยเพียงใด ขั้นสุดท้ายคือ การใช้สารสนเทศที่ได้จากนักเรียน (Use of information) เป็นขั้นที่ครูต้องนำสารสนเทศในขั้นต่าง ๆ มาเพื่อใช้ประโยชน์เพื่อให้นักเรียนได้เกิดการเรียนรู้ได้มากที่สุด จะเป็นขึ้นที่คอยตรวจสอบขั้นตอนต่าง ๆ
ถึงแม้ว่าการประเมินผลระหว่างเรียนด้วยรูปแบบของ Ruiz-Primo and Furtak จะดำเนินเป็นวงรอบ ESRU แต่ครูผู้สอนอาจปรับเปลี่ยนเพื่อให้ได้ข้อมูลที่ดีและปรับใช้ เช่น E-S-R-E-S-R แต่หากนักเรียนมีพฤติกรรมที่บ่งชี้ว่ามีความเข้าใจก็ใช้วงรอบเพียงรอบเดียว หรือหากต้องการใช้เพื่อวินิจฉัยครูผู้สอนอาจใช้วงรอบแบบ E-S-R-E-S-R-E-S-R ส่วนในขั้น U จะมีลักษณะคล้ายการตัดสินจากข้อมูลที่ผ่านจากวงรอบต่าง ๆ มา หรือในชั้นของคำถามเมื่อกระตุ้นการเรียนรู้อาจใช้ 2 วงรอบก็ได้ขึ้นอยู่กับบริบทและเนื้อหาวิชาที่ผู้ประเมินต้องการ
ในการวางแผนการประเมินระหว่างเรียนนั้นเป็นสิ่งที่ครูต้องจัดกระทำ เพราะครูผู้สอนจะได้ทราบพัฒนาการของนักเรียน หรือคอยช่วยเหลือหากนักเรียนยังมีปัญหาในการเรียน แต่สิ่งหนึ่งที่ครูต้องตระหนักคือความรู้แกนหลัก (Concept) ต้องถูกต้อง แต่กระบวนการค้นหาคำตอบอาจมีวิธีการที่หลากหลาย ครูผู้สอนเองก็ควรใช้วิธีการประเมินผลระหว่างเรียนให้เหมาะสมกับบริบทการสอนหรือนักเรียนของตนให้มากที่สุด ดังเช่นวงรอบการประเมินผลระหว่างเรียนของ Ruiz-Primo and Furtak ซึ่งจะเป็นวงรอบ ESRU จุดสิ้นสุดจะอยู่ที่ขั้น U แต่เป็นเรื่องที่ยากยิ่งเพราะในขั้น E-S หรือ S-R หรือ  E-S-R จะเป็นขั้นที่ทับซ้อนกัน เช่น เมื่อครูเริ่มที่ชั้น E ซึ่งเป็นขั้นใช้คำถามเพื่อนำสู่บทเรียน เมื่อครูถามแล้วเด็กนักเรียนอาจแสดงออกโดยฉับพลัน รวมไปถึงตัวครูเมื่อทราบถึงพฤติกรรมที่นักเรียนตอบสนองมาแล้ว ต้องใช้ประสบการณ์ในการตัดสิน อาจต้องใช้ผู้ที่มีความเชี่ยวชาญกว่ามาเป็นผู้พิจารณา โดยครูผู้สอนต้องบันทึกผลไว้ จะเห็นได้ว่าเป็นรูปแบบการประเมินผลระหว่างเรียนที่มีความยืดหยุ่นมาก เหมาะสำหรับการนำไปใช้ในห้องเรียน (Ruiz-Primo & Furtak, 2006)


Ruiz-Primo, M. A., & Furtak, E. M. (2006). Informal formative assessment and scientific
inquiry: Exploring teachers' practices and student learning. Educational

Assessment, 11(3/4), 205-235.

วัตถุประสงค์การวิจัย 3 ข้อ สูตรยาผีบอก

      นโยบายเปลี่ยน การปฏิบัติก็เปลี่ยน การทำวิจัยในครูก็ยิ่งลดลง เนื่องด้วยการประเมินวิทยฐานะแบบใหม่หรือเรียกกันติดปากว่า ว.21 วันนี้จะมาพ...