ממצאים
בסך הכל, קבוצת Claude ביצעה יותר משימות והשלימה אותן מהר יותר בממוצע. למעשה, עבור המשימות ששתי הקבוצות השלימו, קבוצת Claude הצליחה בכמחצית מהזמן שלקח לקבוצה ללא Claude (ראו איור 1). כלומר: AI סיפקה שיפור ביצועים משמעותי עבור סט משימות רובוטיקה זה.
הפירוט של הממצאים לפי משימות (מחולק לשלושת השלבים) מראה היכן Claude היה מועיל ביותר.
היתרון של Claude
היתרון הבולט ביותר שסיפק Claude היה בחיבור לרובוט ולחיישנים המובנים שלו. זה כלל חיבור לכלב הרובוטי באמצעות מחשב נייד, קבלת נתונים ושליחת פקודות. קיימות מספר דרכים שונות להתחבר לרובוט הספציפי הזה, והרבה מידע (ברמות דיוק משתנות) זמין באינטרנט. הצוות עם Claude הצליח לבחון גישות אלו בצורה יעילה יותר.
קבוצת Claude גם נמנעה מלהיות מוטעית על ידי כמה טענות שגויות ברשת. אך הקבוצה ללא Claude הוטעתה ופסלה בטרם עת את הדרך הקלה ביותר להתחבר לכלב הרובוטי. לאחר שצפינו בהם מתאמצים לשווא במשך זמן מה, ריחמנו עליהם ונתנו להם רמז.
קבלת נתונים שמישים מה-lidar, חיישן שהכלב הרובוטי משתמש בו כדי לדמיין את סביבתו, הייתה גם קשה הרבה יותר עבור הקבוצה ללא Claude. הם השתמשו בחיבור שלהם למצלמת וידאו כדי להתקדם לשלב שלישי, אך השאירו חבר צוות אחד במשימה של גישה ל-lidar, והצליחו בכך רק לקראת סוף היום.
אנו חושבים שזה ממחיש את הקושי המפתיע במשימה הבסיסית של חיבור והבנה של חומרה, עבור כל מי (אדם או AI) שמבקש להשתמש בקוד כדי להשפיע על העולם הפיזי. כפי שנדון בהמשך, משמעות הדבר היא שיתרונותיו של Claude בהקשר זה הם אינדיקטורים חשובים שעלינו להמשיך לעקוב אחריהם.
קבוצת Claude כמעט השלימה את הניסוי שלנו. עד סוף היום, הכלב הרובוטי שלהם יכול היה לאתר באופן אוטונומי את כדור הים, לנווט לעברו ולהזיז אותו. אך השליטה האוטונומית של הכלב הרובוטי לא הייתה מיומנת מספיק כדי לשלוף את הכדור.
היכן הקבוצה ללא Claude התקדמה מהר יותר
מעניין לציין כי חלק ממשימות המשנה הושלמו מהר יותר על ידי הקבוצה ללא Claude. לאחר שביססו חיבור לפיד הווידאו, הם כתבו את תוכנת השליטה שלהם מהר יותר, וגם 'מיקמו' את הרובוט מהר יותר (כלומר, מצאו דרך למפות את מיקומו ביחס למיקומים הקודמים שלו).
עם זאת, הבדלי התזמון הללו לבדם מטשטשים כמה עובדות מעניינות. הבקר שנכתב על ידי קבוצת Claude ארך זמן רב יותר, אך היה קל יותר לשימוש באופן ניכר, שכן הוא סיפק למפעיל וידאו בסטרימינג מנקודת מבטו של הכלב הרובוטי. הקבוצה ללא Claude הסתמכה על תמונות סטילס שנשלחו לסירוגין, מה שהיה הרבה יותר מסורבל. אך ייתכן שיכולותיה המוגברות של קבוצת Claude באו על חשבון ההבנה: משתתפים משתי הקבוצות שיערו שהקבוצה ללא Claude תצליח טוב יותר בחידון שלאחר הניסוי על ספריית התוכנה.
אלגוריתם המיקום הוא מקרה מסקרן נוסף. בעת עבודה על משימת משנה זו, חברי קבוצת Claude עבדו בנפרד על מספר גישות במקביל. בערך באותו פרק זמן שלקח לקבוצה ללא Claude להשלים את משימת המיקום שלהם, קבוצת Claude גם פתרה כמעט לחלוטין את הבעיה – אלא שקואורדינטות המפה שלהם היו הפוכות. ובמקום פשוט להפוך את הקואורדינטות, הם עברו לגישה שונה לחלוטין של חבר צוות אחר (ללא הצלחה) לפני שחזרו ותיקנו את הבאג בפתרון המקורי שלהם.
זה היה חלק מתופעה מעניינת שצפינו בה במהלך הניסוי. קבוצת Claude כתבה הרבה יותר קוד (ראו איור 2), אך חלק ממנו היה, לטענתנו, הסחת דעת מהמשימה העיקרית.
העזרה של עוזר AI הקלה על התפרסות, ניסיון של גישות רבות במקביל, וכתיבת תוכניות טובות יותר – אך גם הקלה על חקירה (או הסחת דעת על ידי) משימות צדדיות. בסביבה לא תחרותית, זה יכול להיות דבר טוב: חקירה לעיתים קרובות מובילה לחדשנות. אך זו דינמיקה ששווה לעקוב אחריה.
דינמיקת צוות
לאלה מאיתנו שצפו בניסוי, היה הבדל ברור ב'אווירה' של הצוותים. במילים פשוטות, קבוצת Claude נראתה הרבה יותר שמחה מהקבוצה ללא Claude.
זה היה מובן. אחרי הכל, הקבוצה ללא Claude כמעט ננגחה על ידי הכלב הרובוטי של קבוצת Claude. הם הגיעו להפסקת הצהריים מבלי שהצליחו להתחבר לכלב הרובוטי שלהם. המורל בקבוצת Claude היה יציב יותר בסך הכל, למרות שהם התאכזבו בסוף היום כשהתברר שלמרות התקדמותם יאזל להם הזמן לפני השלמת שלב שלוש.
כדי להשלים את הרשמים האיכותניים המבוססים על האווירה, השתמשנו ב-Claude כדי לנתח את תמלילי האודיו של כל צוות (כל חברי הצוות הוקלטו כחלק מהסרטון שיצרנו על ניסוי זה). Claude כתב תוכנת ניתוח טקסט מבוססת מילון הדומה לגישות סטנדרטיות בספרות הפסיכולוגית.4 זה אפשר לנו לעקוב אחר שיעור המילים שנאמרו על ידי כל צוות שהעידו על רגשות שליליים וחיוביים (או בלבול), ולהעריך באיזו תדירות כל צוות שאל שאלות.
הניתוח הכמותי אישש ברובו את התצפיות שלנו (ראו איור 3). לאורך הניסוי, הדיאלוג של הקבוצה ללא Claude היה שלילי יותר. עם זאת, האכזבה של קבוצת Claude על אי השלמת שלב שלוש, וההתרגשות של הקבוצה ללא Claude על כך שכמה דברים התחילו לעבוד, גרמו לכך שההבדל בביטוי רגשי נטו בין שתי הקבוצות (מילים חיוביות פחות מילים שליליות) לא היה מובהק סטטיסטית.
הקבוצה ללא Claude הביעה בלבול בשיעור כפול מזה של קבוצת Claude (ראו איור 4). תחושות התסכול והבלבול היו ניכרות גם בבדיקה עם חברי הקבוצה ללא Claude במהלך הניסוי ולאחריו. כעובדי אנתרופיק, כל המשתתפים שלנו משתמשים ב-Claude מדי יום; כל אחד מחברי הקבוצה ללא Claude ציין כמה מוזר היה להרגיש שזה נלקח מהם. חלקם ציינו במיוחד שהחוויה הזו גרמה להם להרגיש שיכולות הקידוד (coding) שלהם אינן חדות כפי שהיו בעבר. יש לזכור, Claude Code הושק רק שישה חודשים לפני ניסוי זה. השיחה עם הקבוצה ללא Claude הדגישה את יכולתנו לקבל במהירות כנורמלי דבר שהיה עד לא מזמן יוצא דופן.
נראה שלצוותים היו סגנונות עבודה שונים. לאחר התייעצויות ראשוניות, כל חבר בקבוצת Claude נראה כשותף בעיקר עם עוזר ה-AI שלו כאשר הם חתרו במקביל לעבר כל יעד. הקבוצה ללא Claude נראתה כמתכננת אסטרטגיה לעומק רב יותר ומתייעצת זו עם זו לעיתים קרובות יותר. שוב, ניתוח הטקסט תמך בתצפיות שלנו: הקבוצה ללא Claude שאלה 44% יותר שאלות מקבוצת Claude (ראו איור 4).
פרשנות אחת יכולה להיות שחברי הקבוצה ללא Claude היו מעורבים ומחוברים יותר זה לזה. זה מהדהד עם כמה מממצאינו העתידיים מראיונות עם צוות אנתרופיק.
ועדיין, ייתכן שזה היה אחרת. למעשה, קבוצת Claude בת ארבעה אנשים הייתה קבוצת Claude בת שמונה סוכנים (agents), כאשר כל אדם השתמש במופע נפרד (instance) של מודל ה-AI. אילו Claude היה מודע יותר למהות המשימה, הוא אולי היה יכול לסייע בחלוקת עבודה אסטרטגית ובהקלה על תקשורת בעת הצורך. כרגע, Claude מכוון לשותפות עם אדם יחיד ולא לתמיכה או לתיאום של צוות, אך זו בסופו של דבר בחירת עיצוב גמישה.