מחקרים ופרסומים מצוות המחקר של אנתרופיק - סקירות מעמיקות, ניתוחים טכניים ותובנות מעולם הבינה המלאכותית

האם החוזקות הייחודיות של מודלי שפה גדולים (LLM) ניתנות להעברה גם לתחום הרובוטיקה? זו השאלה שאנתרופיק (Anthropic) ביקשה לבחון במחקר חדש, שבדק האם מודל AI יכול לתפוס סצנה, להבין את מצבו של רובוט ולהוציא פקודות אמינות המשפיעות על העולם הפיזי. החברה העמידה את מודלי השפה שלה, ובפרט את קלוד (Claude), במבחן שליטה על מגוון רובוטים, תוך שימוש בממשקי בקרה שונים – מפקודות מנוע ישירות ועד פיקוח על מדיניות מתוכנתת מראש. הממצאים מצביעים על כך שמודלי שפה משתפרים במהירות בתחום, אך יכולתם תלויה קריטית באופן שבו הם מחוברים לרובוט, עם עדיפות ברורה לממשקי שליטה ברמה גבוהה יותר.

חברת אנתרופיק (Anthropic), בשיתוף פעולה עם AE Studio, חושפת ממצאי מחקר פורצי דרך המציגים שיטה חדשנית לשליטה בגישה ליכולות AI שעלולות להיות דו-שימושיות או מסוכנות. השיטה, המכונה GRAM, מאפשרת למודלי שפה גדולים לאגור ידע ספציפי בתאים נפרדים, ובכך לאפשר הדלקה או כיבוי סלקטיביים של יכולות אלו ללא פגיעה בביצועי המודל הכוללים. מדובר בצעד משמעותי לקראת פתרון בעיית אבטחת מודלים חזיתיים ושימוש אחראי בבינה מלאכותית.

מחקר חדש של אנתרופיק חושף לראשונה מנגנון פנימי ייחודי במודלי שפה גדולים (LLM) כמו Claude, המכונה J-space. מנגנון זה מתפקד כ'מרחב עבודה' גלובלי, בדומה לאופן שבו נוירונים במוח האנושי מטפלים במחשבות נגישות למודעות. מדובר בתבניות נוירוניות פנימיות שמאפשרות למודל לחשוב, להסיק מסקנות ולתכנן פעולות באופן שקט, מבלי לכתוב אותן בפועל. ממצאים אלו משנים את הבנתנו לגבי אופן הפעולה של מודלי שפה ומספקים כלים חדשים לפיקוח על כוונותיהם הנסתרות, ואף מעלים שאלות לגבי תודעה ב-AI.

בדוח המדד הכלכלי האחרון של אנתרופיק, אנו בוחנים מתי אנשים פונים לקלוד, מה הם מייצרים באמצעותו, וכיצד הם תופסים את השפעת ה-AI על עבודתם. המחקר חושף תבניות שימוש יומיומיות ושבועיות המשקפות את קצבי החיים והעבודה, ומראה כיצד מודל ה-AI הופך לכלי מרכזי במגוון רחב של משימות. הוא גם מציג ממצאים ראשוניים מסקר חדש הבוחן את תפיסת המשתמשים לגבי עתיד העבודה בעידן ה-AI, ומגלה שאופטימיות קשורה לשימוש אוטומטי יותר ב-AI.

חברת אנתרופיק (Anthropic) מפרסמת את תוצאות השלב השני של פרויקט Fetch, ניסוי שבו נבחנה יכולתו של מודל ה-LLM שלה, קלוד (Claude), לסייע במשימות רובוטיקה מורכבות. הממצאים החדשים מראים כי Claude Opus 4.7, שפעל ללא כל סיוע אנושי, היה מהיר פי 20 מהצוות האנושי המהיר ביותר בכל המשימות שהושלמו על ידי משתתפים בניסוי המקורי לפני פחות משנה. המחקר מדגיש את ההתקדמות המהירה ביכולות ה-AI ואת הפוטנציאל לראות מודלים מבצעים משימות פיזיות באופן סוכני.

מחקר חדש של אנתרופיק (Anthropic) על השימוש ב-Claude Code חושף תובנות מרתקות על עתיד הקידוד הסוכני. הניתוח, שכלל כ-400 אלף סשנים, מראה חלוקת עבודה ברורה בין אדם ל-AI: המשתמש מקבל את החלטות התכנון, בעוד שקלוד מבצע את העבודה. ממצאי המחקר מצביעים על כך שמומחיות בתחום, ולא בהכרח ניסיון קידוד, היא המפתח להצלחה, כאשר מומחי תוכן מצליחים יותר וקלוד מבצע יותר עבודה עבורם. כמו כן, חלה עלייה משמעותית בערך הכלכלי של המשימות המבוצעות, ושינוי בתמהיל העבודות לכיוון שימוש סוכני מקצה לקצה.

מחקר חדש של אנתרופיק (Anthropic) מציג את האתגרים בפני סוכני AI המנסים לנווט בתשתיות נתונים ביולוגיות מורכבות. הכתבה, המבוססת על מקרה מבחן בתחום הוירולוגיה, מדגימה כיצד מודלי שפה גדולים (LLM) מובילים לאי-דיוקים וחוסר עקביות בשליפת נתונים ממסדי מידע כמו NCBI Virus, בשל המבנה הלא אחיד שלהם. עם זאת, כאשר שולבו כלי שליפה דטרמיניסטיים כמו gget virus, דיוק הסוכנים עלה כמעט ל-100%. הממצאים מדגישים את הצורך הקריטי בתכנון מסדי נתונים ביולוגיים תוך התחשבות בסוכני AI כמשתמשים בקנה מידה רחב, כדי לאפשר גילויים מדעיים אמינים.

בתחום אבטחת הסייבר, חלק ניכר מהנזק בעולם האמיתי נובע מפרצות N-day: אלו חולשות אבטחה שכבר נחשפו בפומבי, אך תוקנו רק בחלק מההתקנים. אקספלויטים אלו מנוצלים בחלון הזמן שבין חשיפת התיקון לפריסתו הרחבה. בכתבה זו, אנו בוחנים עד כמה מודלי שפה גדולים (LLMs) יכולים לזרז ולהפוך לאוטומטי את תהליך הפיתוח של אקספלויטים מסוג N-day. הממצאים מצביעים על שינוי דרמטי במהירות ובנגישות של פיתוח אקספלויטים, מה שדורש התייחסות מחודשת לאסטרטגיות הגנה.