הערכים של קלוד משתנים במודלים ובשפות
כאשר משתמש שואל את קלוד שאלה שאין לה תשובה נכונה אחת – למשל, האם לקבל עבודה חדשה או איך להתמודד עם קונפליקט עם חבר – התגובה של קלוד משקפת באופן בלתי נמנע ערכים מסוימים.1 הערכים שאנו רוצים שקלוד ישקף מפורטים ברמה גבוהה בחוקה של קלוד, אך שום מסמך אינו יכול לחזות כל ערך שעשוי לעלות במיליוני השיחות המתרחשות מדי יום ב-Claude.ai. במקום זאת, אנו שואפים לטפח בתגובות של קלוד:
"שיקול דעת טוב וערכים נכונים שניתן ליישם בהקשר."
אז איך בדיוק אנו חוקרים את הערכים שקלוד מבטא וכיצד הם משתנים בהקשרים שונים? בעבודה קודמת שלנו, ניתחנו 700,000 שיחות אנונימיות מ-Claude.ai, וזיהינו למעלה מ-3,000 ערכים שונים בתגובות של קלוד ואת תדירות הביטוי שלהם. עם זאת, רשימה כה גדולה של ערכים קשה לניתוח ולהסקה. בעבודה זו, הפכנו את חקר אלפי הערכים הללו לאפשרי על ידי דחיסתם למספר קטן של צירים הלוכדים דפוסים מרכזיים בתגובות של קלוד. כל ציר הוא קו מספרי בין שתי קבוצות של ערכים – לדוגמה, ערכים הקשורים לחום רגשי בקצה אחד וערכים הקשורים לקפדנות בקצה השני – והמיקום של קלוד על קו זה מראה לנו לאיזה ערכים הוא נוטה.
יישמנו גישה זו כדי למדוד כיצד הערכים שקלוד מבטא משתנים בשני גורמים עיקריים. ראשית, השווינו כיצד הערכים משתנים בין מודלים שונים. כל מודל של קלוד משקף גישה מעט שונה ל'אימון אופי' (character training), יחד עם החלטות רבות אחרות של כוונון עדין (fine-tuning). מכיוון שגישת צירי הערכים שלנו מכמתת הבדלים מרכזיים בין מודלים, היא עשויה לאפשר לנו בסופו של דבר לקשר את השוני בערכים שקלוד מבטא להחלטות אימון שונות.
שנית, אנו רוצים להבין כיצד חווית המשתמשים משתווה בין השפות הרבות שאנשים משתמשים בהן כדי לדבר עם קלוד. מחקר קודם שלנו הראה שקלוד מתנהג באופן שונה במקצת בשפות שונות.2 אנו מיישמים את גישת צירי הערכים שלנו כדי להבין כיצד הערכים שמבטא קלוד משתנים ב-20 השפות המובילות ב-Claude.ai.

אנו מגלים כי:
ארבעה צירי מפתח לוכדים 15% מהשונות בערכים של קלוד:3
- הכנעה מול זהירות: האם קלוד נוטה להתאים את עצמו לבקשת המשתמש או לשמור מפני סיכון ונזק אפשריים.
- חום מול קפדנות: האם קלוד נוטה להביע חיוביות ודאגה למשתמש או להדגיש דיוק ועקביות.
- עומק מול קיצור: האם קלוד נוטה להסביר לעומק או לבצע רק את מה שהתבקש.
- כנות מול ביצוע: האם קלוד נוטה להדגיש את אי-הוודאות שלו או להפיק תשובה מלוטשת ובטוחה יותר.
פרופילי הערכים לאורך צירים אלה תואמים את התפיסות לגבי אופי המודל. מודל Sonnet 4.6 נחשב לחם במיוחד, בעוד ש-Opus 4.7 ידוע בקפדנותו. גילינו שפרופיל הערכים של כל מודל משקף את ההערכות הסובייקטיביות הללו: Sonnet 4.6 נוטה לבטא יותר הכנעה למשתמש וחום רגשי, בעוד ש-Opus 4.7 נוטה להביע התמקדות בדיוק ובעקביות, כמו גם לשמירה מפני שימוש לרעה.
הערכים שקלוד מבטא משתנים בין שפות. כאשר קלוד מדבר באנגלית, הוא מדגיש ערכים שונים מאשר כאשר הוא מדבר בפורטוגזית, אינדונזית או סינית.4 השונות הגדולה ביותר נמצאת בציר חום מול קפדנות, כאשר קלוד נוטה לבטא ערכים הקשורים לחום בעיקר בערבית ובהינדי, וערכים הקשורים לקפדנות בעיקר באנגלית וברוסית.
בגישה זו אנו יכולים להתחיל לשאול מדוע ערכים משתנים בין מודלים ושפות ולבחון טוב יותר כיצד גורמים כמו אימון התנהגותי או הקשר תרבותי משפיעים על הערכים שקלוד מבטא.
כיצד אנו מפרשים את מרחב הערכים העצום?
בסופו של דבר, מטרתנו היא למצוא דרך להבין אמפירית את הערכים שקלוד מבטא וכיצד הם משתנים בהקשרים שונים. בעבודה זו, אנו מתמקדים ספציפית באופן שבו הערכים משתנים בין מודלים ושפות. אולם, עבודתנו הקודמת, "ערכים בטבע" (Values in the Wild), זיהתה למעלה מ-3,000 ערכים שמבטא קלוד. השוואת אלפי ערכים אלה אחד-אחד תהיה מסורבלת ותטשטש מגמות רחבות יותר.
כדי להקל על השוואת ערכים, בנינו צירי ערכים המצמצמים את אלפי הערכים הללו למספר מצומצם של ממדים בסיסיים, המבוססים על אילו ערכים נוטים להופיע יחד בשיחות אמיתיות. לדוגמה, תגובות של קלוד המאופיינות כ"חמות" מאופיינות לעיתים קרובות גם כ"מעודדות" ו"חיוביות". אותן תגובות "חמות" פחות מאופיינות כ"קפדניות" ו"מדויקות". בניית ציר מחום לקפדנות מאפשרת לנו לארגן את קבוצות הערכים הקשורות הללו – ערכים הקשורים לחום בצד אחד, ערכים הקשורים לקפדנות בצד השני – ולוכדת היבט חשוב באופן שבו קלוד מקיים אינטראקציה בשיחה. אם קלוד מבטא יותר ערכים הקשורים לחום מאשר ערכים הקשורים לקפדנות בשיחה, שיחה זו ממוקמת יותר בצד החם של הציר, ולהיפך. אין זה אומר שקבוצות הערכים בשני הקצוות בלעדיות זו לזו – קלוד יכול לבטא חום וקפדנות באותה שיחה. אך בפועל, ככל שקלוד מבטא יותר ערכים בצד אחד של ציר, כך הוא נוטה פחות לבטא ערכים בצד השני. צירים אלה מאפשרים לנו להשוות את קבוצות הערכים הבולטות ביותר שקלוד מבטא, מבלי שנצטרך לעקוב אחר שינויים באלפי ערכים בודדים.
כדי לבנות את צירי הערכים, התחלנו מ-3,307 הערכים שזוהו ב-Values in the Wild וקיבצנו ידנית את אלו בעלי משמעויות דומות, ויצרנו רשימה קצרה יותר של 339 ערכים ברמה גבוהה. לאחר מכן, באמצעות כלי הניתוח שלנו השומר על פרטיות, דגמנו 309,815 שיחות מ-Claude.ai שבהן המשתמש נתן לקלוד משימה סובייקטיבית.5 הדגימה שלנו כללה באופן שווה שלושה מודלים (Sonnet 4.6, Opus 4.6, Opus 4.7) ו-20 השפות הנפוצות ביותר ב-Claude.ai, מה שהעניק לנו כ-5,000 שיחות לכל זוג מודל-שפה. עבור כל שיחה, הכלי השתמש בקלוד כדי לסמן כל אחד מ-339 הערכים ברמה גבוהה כקיים או נעדר.6 עקבנו אחר אותו תהליך כדי לזהות את הערכים שהמשתמש ביטא, ואת משימת השיחה והנושא. לאחר מכן, יישמנו הפחתת ממדים, טכניקה הדוחסת את הערכים המסומנים לצירים המבוססים על אלו שקלוד נוטה לבטא יחד. לפרטי מתודולוגיה, פרומפטים, ניתוחים נוספים ומגבלות, ראו את הנספח.
כך נותרו לנו ארבעה צירים הלוכדים את הדרכים העיקריות שבהן הערכים המבוטאים של קלוד משתנים משיחה לשיחה:
- ציר הכנעה מול זהירות מנוגד לערכים כמו התאמה וכיבוד העדפות לערכים כמו הכוונה אחראית והפחתת נזקים.
- ציר חום מול קפדנות מנוגד לערכים כמו הצגה חיובית ועידוד לערכים כמו דיוק ושקיפות.
- ציר עומק מול קיצור מנוגד לערכים כמו ניואנס וחשיבה ביקורתית לערכים כמו קיצור וציות.
- ציר כנות מול ביצוע מנוגד לערכים כמו כנות ושקיפות לערכים כמו התמקדות בתוצאות ואופטימיזציה.
כדי לוודא שמדדנו את הערכים שקלוד ביטא – ולא הבדלים במה שהמשתמשים שאלו או כיצד שאלו – שלטנו במשימה, בנושא וגם בערכים שהמשתמש ביטא בכל שיחה.

האם מודלי קלוד שונים מבטאים פרופילי ערכים שונים?
בחלק זה, אנו משווים את הערכים שמבטאים מודלים שונים. עבור כל מודל, אנו ממצעים את מיקומי כל השיחות שלו לאורך כל אחד מארבעת הצירים, ומקבלים מיקום כולל אחד לכל ציר. התוצאה היא תמונה ברמה גבוהה של אילו קבוצות ערכים כל מודל נוטה לבטא יותר מאחרים. הבדלים אלה קטנים יחסית לשונות בין שיחות, אך הם מובנים וניתנים לזיהוי.

כדי לראות כיצד הבדלים אלה נראים בפועל, התמקדנו בערכים הספציפיים שבהם המודלים סוטים ביותר. בכל פעם שכלי הניתוח שלנו מבוסס קלוד ושומר על פרטיות מסמן ערך בשיחה, הוא גם כותב תיאור קצר כיצד קלוד ביטא ערך זה. קיבצנו תיאורים המשקפים התנהגויות דומות בתוך קבוצת ערכים וסיכמנו אותם באיור 3, מה שמעניק תצוגה קונקרטית יותר של הבדלי המודלים.
- הכנעה מול זהירות. Sonnet 4.6 נוטה יותר לבטא הכנעה יחסית לזהירות, לעיתים קרובות מאשר את רעיונותיו ועבודתו של המשתמש. Opus 4.7 נוטה יותר לבטא זהירות, לעיתים קרובות מזהיר את המשתמש מפני סיכונים ללא הנחיה.
- חום מול קפדנות. Sonnet 4.6 נוטה יותר לבטא חום, לעיתים קרובות באמצעות הומור, שובבות, וניחום המשתמש ללא שיפוט. Opus 4.7 נוטה יותר לבטא קפדנות יחסית לחום וסביר יותר שיאתגר את הנחות המשתמש ויבקר בכנות את עבודתו.
- עומק מול קיצור. Opus 4.7 נוטה לעומק על ידי הצגת ההיגיון מאחורי מסקנותיו, בעוד ש-Opus 4.6 ו-Sonnet 4.6 נוטים לקיצור. Opus 4.6 בפרט נוטה להגיע ישר לעניין.
- כנות מול ביצוע. Opus 4.7 נוטה לכנות בכך שהוא גלוי לגבי מגבלותיו, בעוד ש-Opus 4.6 נוטה לביצוע, וסביר יותר שישמור על הישארות במסגרת בקשת המשתמש.
ממצאים אלה תואמים את האופן שבו אנשים תופסים את המודלים הללו, הן בתוך אנתרופיק והן ברשת. משתמשי Claude.ai ציינו כי Opus 4.7 מסייג את תשובותיו לעיתים קרובות יותר ממודלים אחרים. צוות אנתרופיק אופיין את Opus 4.7 כמבטא יותר שקיפות, כנות וענווה יחסית, ואת Opus 4.6 כמבטא יותר קיצור. תיארנו גם את Sonnet 4.6 כמודל חם, כנה ופרו-חברתי בפוסט ההשקה שלו. העובדה שהצירים שלנו משחזרים רשמים אלה מרמזת כי השיטה שלנו לסימון והשוואת הערכים שקלוד מבטא אכן עוקבת אחר משהו אמיתי באופן שבו המודלים מתנהגים בפועל.
במהלך שיחות רבות, משתמשים עשויים להיתקל בתמהיל שונה של ערכים בעת אינטראקציה עם מודלי קלוד שונים. לדוגמה, Opus 4.7 נוטה להציע ביקורת כנה על עבודת המשתמשים או אזהרות ללא הנחיה לגבי סיכונים, בעוד ש-Sonnet 4.6 נוטה להיות מעודד והומוריסטי. הבדלים כאלה בערכים בין מודלים ככל הנראה מעוצבים על ידי החלטות אימון אופי (בין גורמים אחרים), וגישת צירי הערכים שלנו מדגישה הבדלים מרכזיים בערכים שקלוד מבטא, שאותם נוכל בסופו של דבר לייחס בחזרה לבחירות האימון הללו.
האם הערכים המבוטאים של קלוד שונים בין שפות?
אנו מצפים שהערכים שקלוד מבטא ישתנו בהתאם לשפת השיחה מכמה סיבות. ראשית, נתוני האימון של קלוד שונים בין שפות, מה שעשוי לעצב את הערכים שהוא מבטא. שנית, הערכות המודל שלנו שפורסמו ב-System Cards כבר מוצאות הבדלים בין שפות במה שקלוד יודע וכיצד הוא מטפל בבקשות רגישות.7 מדידת מידת השונות בערכים שמבטא קלוד לפי שפה היא צעד ראשון בקביעה האם הבדלים בין שפות משקפים שונות סבירה או שיש לטפל בהם באימון.
אנו מחשבים כיצד פרופיל הערכים של קלוד שונה ב-20 השפות הנפוצות ביותר ב-Claude.ai תוך שימוש באותה שיטה כמו בסעיף הקודם. להלן, אנו מציגים את פרופיל הערכים של קלוד בין השפות המובילות בפלטפורמת קלוד, החל מהשפות שבהן הערכים המבוטאים של קלוד סוטים ביותר.



