האם דגמי שפה גדולים (LLMs) באמת מחזיקים ביכולות דומות לאדם בתיאוריית הנפש (ToM)? השאלה הזו מעסיקה חוקרים רבים בעולם ה-AI. כעת מושק CogToM – בנצ'מרק מקיף ומבוסס תיאורטית שכולל למעלה מ-8,000 דוגמאות דו-לשוניות ב-46 פרדיגמות שונות. המדד, שפותח בהשראת מנגנוני חשיבה אנושיים, נבדק על ידי 49 מרקמים אנושיים ומציע מבט רחב יותר על יכולות ה-AI מעבר לבדיקות צרות כמו משימות אמונה שגויה.
CogToM בוחן מגוון רחב של יכולות קוגניטיביות, החל מהבנת כוונות ועד זיהוי רגשות מורכבים. לפי הדיווח, הבנצ'מרק נועד לתפוס את הספקטרום המלא של תיאוריית הנפש האנושית, בניגוד לבנצ'מרקים קיימים שמתמקדים במשימות מוגבלות. הוא כולל דוגמאות בשתי שפות כדי להבטיח תקפות גלובלית, והאימות האנושי מבטיח איכות גבוהה. זהו כלי חיוני לחוקרים שבוחנים את גבולות היכולות הקוגניטיביות של LLMs.
בבדיקה שיטתית של 22 מודלים מייצגים, כולל מודלים מתקדמים כמו GPT-5.1 ו-Qwen3-Max, נחשפו הבדלי ביצועים משמעותיים. חלק מהמודלים הצטיינו בפרדיגמות מסוימות, אך כולם נתקלו בצווארי בקבוק במימדים ספציפיים. הניתוח חושף היטרוגניות בביצועים ומצביע על אתגרים מתמשכים ביכולות ToM של ה-AI המודרני.
התוצאות מעלות שאלות על ההבדלים בין מבנה החשיבה של LLMs לבין זה האנושי. בעוד שבני אדם מפתחים ToM באופן אינטואיטיבי, ה-LLMs נשענים על נתונים סטטיסטיים, מה שיוצר פערים. מחקר זה מספק פרספקטיבה חדשה על גבולות הקוגניציה ב-AI ומדגיש צורך בשיפורים כדי להתקרב לרמה אנושית.
עבור מנהלי עסקים ישראליים בתחום הטכנולוגיה, CogToM הוא כלי חיוני לבחון מודלי AI לפני שילובם ביישומים רגישים כמו שירות לקוחות או ניתוח התנהגות. כיצד זה ישפיע על פיתוח AI מקומי? כדאי לעקוב אחר התפתחויות אלו כדי להישאר צעד אחד קדימה.