שירותי מחקר לסטודנטים
בכל התארים

ספירת מילים ותדירות מילים – כלי לניתוח תוכן ולעבודות אקדמיות אונליין

כלי חינם לספירת מילים ולניתוח תדירות מילים בעברית ובאנגלית. מדביקים טקסט ומקבלים אונליין ספירת מילים, תווים, משפטים ופסקאות, טבלת שכיחויות ממוינת, סינון מילות תפקוד וספירה של צירופי מילים לניתוח תוכן.

הטקסט נשאר בדפדפן שלכם בלבד ואינו נשלח לשום שרת. הכלי סופר מילה ככל רצף של אותיות או ספרות, ולכן ספירת המילים עשויה להיבדל בכמה מילים מספירה של תוכנת עריכה.


ad

מה הכלי סופר

הכלי עונה על שתי שאלות שונות לגמרי שנשאלות על אותו טקסט. הראשונה היא כמותית ופשוטה: כמה מילים יש כאן. השנייה עמוקה יותר: אילו מילים חוזרות, באיזו תדירות, ומה זה מלמד על הטקסט. שני החלקים מוצגים יחד אחרי הדבקת הטקסט.

חלק הסיכום כולל את מספר המילים, מספר התווים כולל רווחים ובלעדיהם, מספר המשפטים, מספר הפסקאות, אורך משפט ממוצע וזמן קריאה מוערך. נוסף עליהם מוצג מספר המילים הייחודיות ומדד המגוון הלקסיקלי, כלומר היחס בין מספר המילים השונות לבין סך המילים שנספרו. מדד גבוה מעיד על אוצר מילים עשיר, ומדד נמוך מעיד על טקסט חזרתי.

חלק התדירויות הוא טבלה ממוינת מהמילה השכיחה ביותר ומטה, עם השכיחות המוחלטת ועם האחוז מסך המילים שנספרו. אפשר לסנן שכיחות מזערית, לקבוע כמה שורות להציג, ולהעתיק את הטבלה כולה בלחיצה אחת להדבקה באקסל.

ספירת מילים בעבודה אקדמית

כמעט כל מטלה אקדמית מגיעה עם מגבלת מילים: תקציר של מאתיים וחמישים מילים, פרק מבוא של אלף וחמש מאות, עבודה סמינריונית של עשרת אלפים. הכלי מאפשר לבדוק קטע מסוים בלי לספור את כל הקובץ, וזה שימושי במיוחד כשרוצים למדוד תקציר, פרק בודד או פסקה אחת בלי הכותרות, הביבליוגרפיה והנספחים.

חשוב להבין איך נספרות מילים כאן: מילה היא רצף של אותיות או ספרות. מספר עם נקודה עשרונית נספר כמילה אחת, ומילה מחוברת במקף נספרת כשתי מילים. לכן ייתכן הפרש קטן, בדרך כלל של כמה מילים בודדות, בין הספירה כאן לבין הספירה בתוכנת עריכת התמלילים. כשמגבלת המילים נוקשה, כדאי להשאיר מרווח ביטחון של אחוז או שניים ולא לכוון בדיוק לגבול.

שימוש נוסף הוא בקרה על סגנון הכתיבה. אורך משפט ממוצע של יותר מעשרים וחמש מילים הוא בדרך כלל סימן למשפטים ארוכים מדי, שקשה לעקוב אחריהם. טבלת התדירויות חושפת גם מילות מילוי שחוזרות יותר מדי, כמו מאוד, בעצם או למעשה, ומאפשרת לצמצם אותן בעריכה.

ad

תדירות מילים בניתוח תוכן איכותני

בניתוח תוכן, ספירת מילים אינה מטרה אלא נקודת פתיחה. כשעובדים על ראיונות מתומללים, על תשובות לשאלות פתוחות או על טקסטים מהרשת, קריאה של טבלת תדירויות לפני הקריאה הצמודה עוזרת לזהות במה הטקסט עוסק בפועל, ולא במה שציפינו שיעסוק.

דרך עבודה מקובלת היא לנתח כל קבוצת משתתפים בנפרד ולהשוות בין הטבלאות. אם בקבוצה אחת חוזרות מילים של קושי ובקבוצה אחרת מילים של תמיכה, יש כאן כיוון לתמה מרכזית שכדאי לבדוק בקריאה איכותנית. ההשוואה נעשית תמיד באחוזים ולא בשכיחות מוחלטת, מפני שטקסטים באורך שונה אינם ניתנים להשוואה ישירה.

אחרי שזיהיתם מילים ותמות מרכזיות, השלב הבא הוא בדרך כלל קידוד של הקטגוריות למספרים לצורך ניתוח סטטיסטי. אפשר להיעזר לשם כך בכלי הקידוד לנתונים שבאתר.

הסתייגות חשובה: שכיחות אינה חשיבות. מילה שנאמרה פעם אחת ברגע טעון עשויה להיות משמעותית יותר ממילה שחזרה שלושים פעם. הספירה מכוונת את תשומת הלב, היא אינה מחליפה את הפרשנות.

מילות תפקוד ולמה כדאי לסנן אותן

בכל טקסט טבעי המילים השכיחות ביותר הן מילות קישור ומילות יחס, ולא מילות תוכן. בלי סינון, ראש הטבלה יהיה תפוס במילים כמו של, את, על ו-the, שאינן מלמדות דבר על הנושא. סימון של אפשרות הסינון מפעיל רשימה מובנית של מילות תפקוד בעברית ובאנגלית.

הרשימה פתוחה לעריכה, וזה חשוב: כל תחום מחקר מייצר מילים שכיחות משלו. במחקר על מערכת החינוך המילה תלמיד עשויה להופיע בכל משפט ולהסתיר הבדלים מעניינים יותר, ואז נכון להוסיף אותה לרשימה. אפשר גם למחוק מילים מהרשימה, למשל כשמילות שלילה חשובות לניתוח שלכם. כפתור השחזור מחזיר בכל רגע את רשימת ברירת המחדל.

צירופי מילים לניתוח מדויק יותר

מילים בודדות מאבדות הקשר. המילה חרדה יכולה להופיע בצירוף חרדת בחינות, חרדה חברתית או הפרעת חרדה, ולכל אחד מהם משמעות אחרת. לכן הכלי מאפשר לספור גם צירופים של שתי מילים ושל שלוש מילים.

הספירה אינה חוצה גבולות משפט, כדי שלא ייווצרו צירופים מלאכותיים בין סוף משפט אחד לתחילת המשפט הבא. כאשר סינון מילות התפקוד פעיל, צירוף שמכיל מילת תפקוד אינו נספר, וכך נמנעות שרשראות מלאכותיות שנוצרו מהשמטת מילים באמצע. צירופים שחוזרים שלוש פעמים ומעלה בטקסט אחד הם בדרך כלל המועמדים הטובים ביותר לקטגוריה בניתוח תוכן.

מה חשוב לדעת בטקסט בעברית

ניתוח תדירות בעברית מציב אתגר שלא קיים באנגלית. אותיות השימוש ו, ה, ב, ל, כ, מ ו-ש נצמדות למילה עצמה, ולכן הבית, בבית ומהבית נראות למחשב כשלוש מילים שונות. הכלי אינו חותך אותיות שימוש באופן אוטומטי, מפני שחיתוך כזה משבש מילים רבות: המילה הר תהפוך לאות בודדת, והמילים משפט או שלום ייפגעו אף הן.

מה שכן קיים הוא אפשרות ממוקדת אחת: התעלמות מה' הידיעה בתחילת מילה. בסימון האפשרות הזו הבית והבתים מתאחדים עם בית ובתים, בלי לפגוע במילים קצרות בנות שתי אותיות. מעבר לכך, הכלי מסיר ניקוד לפני הספירה, כך שמילה מנוקדת ומילה שאינה מנוקדת נספרות יחד, ומזהה ראשי תיבות עם גרשיים כמילה אחת. באפשרות הסרת סימני הפיסוק, צה"ל וצה״ל נספרות כאותה מילה גם כשהוקלדו בגרשיים שונים.

שאלות נפוצות

הטקסט שלי נשלח לשרת כלשהו? לא. כל הניתוח מתבצע בדפדפן שלכם. הטקסט אינו נשמר ואינו עובר לשום מקום, ולכן אפשר לנתח גם ראיונות ותכנים רגישים.

כמה טקסט אפשר להדביק? עד כשש מאות אלף תווים, כלומר עבודה שלמה. ניתוח של טקסט ארוך מאוד עשוי לקחת שנייה או שתיים.

אפשר לנתח טקסט בעברית ובאנגלית יחד? כן. הכלי מזהה את שתי השפות באותו טקסט וסופר אותן יחד, ורשימת מילות התפקוד כוללת את שתיהן.

למה מספר המשפטים שונה ממה שספרתי? משפט מזוהה לפי נקודה, סימן שאלה, סימן קריאה או סוף שורה. כותרת בשורה נפרדת נספרת כמשפט, ולכן בטקסט עם כותרות רבות המספר יהיה גבוה מהצפוי.

איפה אפשר למצוא כלים נוספים? ריכזנו את כל המחשבונים בדף המחשבונים והכלים, ובהם כלים לסטטיסטיקה תיאורית, למובהקות ולניקוד שאלונים.

עוד מאמרים על: , , , ,