למה חשוב לדעת איך מודלי AI 'חושבים'?
הבנת הדרך שבה מודלי שפה גדולים (LLM) פועלים הפכה למשימה קריטית יותר מתמיד, בייחוד ככל שהם הופכים עוצמתיים ומסוכנים יותר. חברת אנתרופיק (Anthropic), המובילה את החזית במחקר ובטיחות AI, שמה לה למטרה לבנות מערכות בינה מלאכותית אמינות, ניתנות לפרשנות (interpretability) וניתנות לשליטה. עבודות קודמות שלנו חשפו כי LLM משנים את אישיותם והתנהגותם עם שינויים בסקיילינג (scaling) ובכמות הכוונון העדין (fine-tuning) שעברו.
כדי להבין לעומק את השינויים הללו, עלינו לחדור ללב המודלים ולראות כיצד הם עובדים. האם הפלט שלהם מבוסס על שינון פשוט של נתוני האימון, או שמא מדובר בעיבוד מתוחכם יותר? פיצוח המנגנונים הפנימיים של מודלי שפה צפוי להשפיע באופן דרמטי על היכולת שלנו לחזות את התפתחות ה-AI וכן על גישות ליישור (alignment) מערכות AI עם העדפות אנושיות.
פרשנות מכניסטית נוקטת בגישה מלמטה-למעלה להבנת מודלי למידת מכונה (machine learning): פירוק מפורט של התנהגות יחידות בודדות או מעגלים בקנה מידה קטן. אולם, אנו רואים ערך גם בגישה מלמעלה-למטה – להתחיל בהתנהגויות ניתנות לצפייה ובדפוסי הכללה של המודל, ולחקור לעומק אילו נוירונים ומעגלים אחראים להן. היתרון בגישה מלמעלה-למטה הוא שהיא מאפשרת לנו לחקור ישירות תופעות קוגניטיביות ברמה גבוהה המעניינות אותנו, אשר מתגלות רק בקנה מידה גדול, כמו חשיבה (reasoning) ומשחקי תפקידים. בסופו של דבר, שתי הגישות צפויות להיפגש באמצע.
פונקציות השפעה: שיטה חדשנית להבנת הכללת מודלים
במאמר המחקר האחרון שלנו, "Studying Large Language Model Generalization with Influence Functions", אנו מאמצים גישה מלמעלה-למטה להבנת מודלים. "פונקציות השפעה" (Influence functions) הן טכניקה סטטיסטית קלאסית שמטרתה לזהות אילו דוגמאות אימון תורמות באופן משמעותי לפלטי המודל. הן מנוסחות כתנאי סף היפותטי: אם עותק של דוגמת אימון נתונה היה מתווסף למאגר הנתונים, כיצד זה ישנה את הפרמטרים המאומנים (ובהרחבה, את פלטי המודל)? ה"השפעה" של דוגמת אימון היא קירוב לאופן שבו היא משפיעה על הפרמטרים הסופיים. לרוב, אנו מתחילים ממדד עניין מסוים (כמו ההסתברות שהמודל מקצה לתגובה נתונה) ומנסים לזהות את דוגמאות האימון המשפיעות ביותר.
התבוננות בדפוסי השפעה אלה מספקת רמזים לגבי האופן שבו המודלים שלנו מבצעים הכללה מנתוני האימון שלהם. לדוגמה, אם המודלים היו מגיבים לפרומפטים (prompts) של משתמשים על ידי הרכבת רצפים מתוך ערכת האימון, היינו מצפים שרצפים משפיעים עבור תגובת מודל נתונה יכללו ביטויים של מחשבות כמעט זהות. לעומת זאת, רצפים משפיעים הקשורים ברמה נושאית מופשטת יותר יהוו סימן לכך שהמודל רכש מושגים או ייצוגים ברמה גבוהה יותר.







