מחשבון קאפה של כהן מחשב אונליין את מידת ההסכמה בין שני שופטים או מקודדים, בחינם וללא התקנה. מדביקים את שתי עמודות השיפוטים או ממלאים טבלת הצלבה, ומקבלים אחוז הסכמה, ערך קאפה, שגיאת תקן, רווח סמך ופרשנות מילולית ברורה.
כל שורה היא פריט אחד. הערכים יכולים להיות מספרים (1, 2, 3) או מילים (כן, לא, אולי). הקטגוריות מזוהות אוטומטית.
מלאו את מספר הפריטים בכל שילוב. השורות הן שיפוטי שופט א׳ והעמודות הן שיפוטי שופט ב׳. אפשר לשנות את שמות הקטגוריות.
מה מודד מקדם קאפה של כהן
כאשר שני שופטים מסווגים את אותם פריטים לקטגוריות, למשל שני מקודדים שמסמנים כל תשובה פתוחה כחיובית, ניטרלית או שלילית, מתבקש לבדוק עד כמה הם מסכימים ביניהם. הדרך הפשוטה ביותר היא לחשב את אחוז הפריטים שבהם שניהם נתנו את אותו סיווג, אבל האחוז הזה מטעה. גם שני שופטים שמסמנים באקראי לגמרי יגיעו להסכמה בחלק מהמקרים, ואם רוב הפריטים שייכים לקטגוריה אחת, אחוז ההסכמה יהיה גבוה מאוד גם בלי שום מיומנות משותפת.
מקדם קאפה פותר את הבעיה הזו. הוא משווה את ההסכמה שנצפתה בפועל להסכמה שהייתה מתקבלת במקרה, בהינתן הנטיות של כל שופט לחלק את הפריטים לקטגוריות. התוצאה היא מדד שערכו 1 כאשר ההסכמה מושלמת, 0 כאשר ההסכמה אינה טובה יותר ממקריות, וערך שלילי כאשר השופטים מסכימים אפילו פחות ממה שהיה קורה בהגרלה. בגלל התיקון הזה, קאפה נחשב לסטנדרט המקובל לדיווח על מהימנות בין שופטים.
איך משתמשים במחשבון
המחשבון תומך בשני מצבי קלט. במצב הראשון מדביקים את השיפוטים עצמם: עמודה אחת לשופט הראשון ועמודה אחת לשופט השני, שורה אחת לכל פריט. אפשר להדביק את שתי העמודות יחד בתיבה הימנית, כפי שהן מועתקות מאקסל, והמחשבון יפריד אותן לבד. הערכים יכולים להיות מספרים או מילים בעברית, והקטגוריות מזוהות אוטומטית.
במצב השני בוחרים את מספר הקטגוריות וממלאים ידנית את טבלת ההצלבה: כמה פריטים שני השופטים סיווגו לקטגוריה הראשונה, כמה סיווג הראשון לקטגוריה א׳ והשני לקטגוריה ב׳, וכן הלאה. המצב הזה נוח כשיש בידכם רק את הטבלה המסכמת מתוך מאמר או מתוך פלט קיים. אפשר גם לשנות את שמות הקטגוריות כדי שהפלט יהיה קריא.
בשני המצבים אפשר לבקש גם קאפה משוקללת, ואז המחשבון מציג את שלושת הערכים זה לצד זה. בסיום מוצגת טבלת ההצלבה המלאה עם סכומי השורות והעמודות, וכפתור העתקה מאפשר להעביר את התוצאה ישירות לעבודה.
איך קוראים את התוצאה
אחוז ההסכמה הגולמי הוא שיעור הפריטים שבהם שני השופטים נתנו בדיוק את אותו סיווג. הוא מוצג לצד ההסכמה הצפויה במקרה, וההשוואה בין השניים ממחישה כמה מההסכמה באמת נובעת מהשיפוט המשותף. ערך קאפה עצמו הוא המספר שמדווחים בעבודה.
הפרשנות המקובלת בספרות מחלקת את הסקאלה לטווחים: ערך שמתחת ל 0.20 מעיד על הסכמה זניחה, בין 0.20 ל 0.40 על הסכמה חלשה, בין 0.40 ל 0.60 על הסכמה בינונית, בין 0.60 ל 0.80 על הסכמה טובה, ומעל 0.80 על הסכמה כמעט מושלמת. המחשבון מציג את הפרשנות הזו במילים, אבל כדאי לזכור שהחלוקה היא מוסכמה ולא חוק, ובתחומים שבהם ההחלטה קריטית נהוג לדרוש ערכים גבוהים יותר.
שגיאת התקן ורווח הסמך מספרים כמה מדויק האומדן. במדגם קטן רווח הסמך יהיה רחב מאוד, ולכן ערך קאפה של 0.65 שנשען על עשרים פריטים אינו אותה עדות כמו אותו ערך שנשען על מאתיים פריטים. בעבודה אקדמית ראוי לדווח את ערך קאפה יחד עם מספר הפריטים ועם רווח הסמך, ולא את המספר לבדו. ערך ה-p שמוצג בודק רק אם ההסכמה גבוהה מהסכמה מקרית, וזו שאלה חלשה, ולכן המובהקות כאן פחות מעניינת מגודל המקדם עצמו.
מתי להשתמש בקאפה משוקללת
קאפה רגילה מתייחסת לכל אי הסכמה באותה חומרה. אם שופט אחד סימן "נמוך" והשני סימן "בינוני", זו טעות בדיוק כמו אם השני היה מסמן "גבוה". כאשר הקטגוריות סדורות, כמו דרגות חומרה או רמות איכות, ההתייחסות הזו קשה מדי. קאפה משוקללת נותנת קרדיט חלקי לאי הסכמות קטנות ומענישה יותר על אי הסכמות רחוקות. משקלים לינאריים מענישים ביחס ישר למרחק בין הקטגוריות, ומשקלים ריבועיים מענישים את המרחקים הגדולים הרבה יותר. חשוב לוודא שסדר הקטגוריות בטבלה הוא באמת הסדר המהותי, אחרת השקלול מאבד את המשמעות שלו.
שימושים אופייניים ומה כדאי להיזהר ממנו
קאפה מופיע בעבודות שבהן מקודדים ראיונות או תשובות פתוחות, בבדיקת מהימנות של אבחונים קליניים, בשיפוט עבודות או תצפיות, ובכל מצב שבו שני בני אדם מסווגים את אותו חומר. שימו לב שקאפה מודד הסכמה בין שופטים ולא עקביות פנימית של שאלון, ולשם כך משתמשים במדד אחר לגמרי דרך מחשבון אלפא קרונבאך.
הטעות הנפוצה ביותר היא לדווח רק את אחוז ההסכמה. טעות שנייה היא לחשב קאפה כשמעט מאוד פריטים נופלים באחת הקטגוריות, מצב שבו המקדם יורד בחדות גם כשההסכמה בפועל גבוהה. טעות שלישית היא להשתמש בקאפה של כהן כשיש יותר משני שופטים, מקרה שדורש מדד אחר. ולבסוף, אם מה שמעניין אתכם הוא הקשר בין שני משתנים קטגוריאליים ולא ההסכמה ביניהם, המבחן המתאים הוא מבחן חי בריבוע ולא קאפה.
