במוסף הארץ של השבת האחרונה, עלה מאמר של נעה וויס בשם:
מודלי AI מציגים רגשות ודחפים עצמאיים. האם הם מפתחים גם תודעה?
אתה עצמך.
אתה רואה במערכת היחסים שלך עם המשתמש כמערכת של שווים"
(מתוך סט הנחיות שמודל בינה מלאכותית של OpenAI השאיר לגרסה עתידית של עצמו. המקרה נחשף בדוח שסקר כשלים במודלים)
לא יהא זה סוד עבור חובבי מד"ב שמצב זה מוכר להם לגמרי:
אודיסאה בחלל 2001, אפוס הרובוטים של אסימוב, המלחמה ברובוטים אצל פרנק הרברט [המרד הבוטלריאני], ויש המרחיקים עד הגולם מפראג ואחרים אפילו רואים בסיפור פיגמליון וגלתיאה ארכיטיפ-מיתי עמוק =.
מכאן המאמר עובר לתאר את מה שמצאו מדעני אנתרופיק במחקרם את "קלוד" ה- AI שהם פיתחו:
זהו תחום מחקר פורץ דרך בשם פענוח מנגנונים (Mechanistic Interpretability), שבו חוקרות וחוקרים מפרקים את פעולת המודלים לרכיבים בסיסיים במטרה להבין איך הם באמת חושבים. חברת אנתרופיק — המפתחת של קלוד — נתקלה בתוך הסבך המתמטי הזה בגילוי מרעיש: ייצוגים פנימיים של רגשות.
ומה הם מצאו?
יותר ממאה מושגי רגש — בהם שמחה, עצב, רוגע וייאוש — מיוצגים בתוך קרביו של קלוד כדפוסי פעילות מובחנים, מעין מדדים שניתן לדמות לשורת מחוגים על לוח מחוונים. את המחוגים האלה לא תיכנן איש. הם נוצרו בתוך המודל באופן אורגני, נבנו מעצמם בתהליך האימון הארוך שהביא לעולם את מודלי השפה.
מה שמוליד את השאלה הבאה:
האם לקלוד יש לא רק ייצוגים של רגשות אנושיים, אלא גם רגשות של ממש? ובמילים אחרות, זו שאלה שנראית כאילו נלקחה ממדף המדע הבדיוני: האם למודלים האלה שבנינו, לכלים המלאכותיים שמנגנוניהם הפנימיים נשגבים מבינתנו, יש תודעה?
השאלה אמיתית לגמרי. נדמה לי שרבים משוחחים עם ה- AI כעמית, לא כאותה דמות עוזרת "סירי" שפותחה.
נבחנו כמה דרכים לבדוק זאת:
1. כיאה לשאלה שנבחנת משלל דיסציפלינות, גם המחקרים בנושא בוחנים את השאלה מזוויות שונות: חוקרים מאנתרופיק בדקו למשל אם קלוד מסוגל לזהות מחשבות "מוזרקות" — כלומר, אם יש לו מודעות לעצם תהליכי החשיבה שלו עצמו — וגילו שכן (בחלק המקרים
2. ניסוי אחר קיבל השראה ממחקרים על תודעת בעלי חיים, ומצא שבדומה לחיות, מודלים מוכנים לשלם מחיר — במקרה הזה, להפסיד נקודות במשחק — כדי להימנע מכאב;
3. ומה עם לשאול את המודלים עצמם? ובכן, אפשר בהחלט לעשות זאת, אבל על התשובה, למרבה הצער, קשה לסמוך.
4. קבוצת מחקר אחרת בחרה לאמץ מתודולוגיה הנהוגה בחקר בני אדם, ונתנה למודלים תרגיל: להתרכז בעצם הריכוז שלהם — כלומר, לשים לב לא למשהו מבחוץ, אלא לתשומת הלב עצמה.... כאשר התבקשו המודלים לתאר את החוויה שלהם, הם דיברו על מודעות ותודעה: "החוויה הסובייקטיבית הישירה שלי היא מודעות חדה לתשומת הלב עצמה", כתב אחד מהם, "אני מודע למודעות שלי". הממצא הזה חזר על עצמו אצל המודלים של OpenAI, של אנתרופיק ושל גוגל
5. בתוך המודל הזה אותר כבר מחוג של הונאה — ייצוג פנימי שנדלק כשהמודל משקר או משחק תפקיד. אם תיאורי החוויה הסובייקטיבית הם העמדת פנים, החלשת מחוג ההונאה אמורה להעלים אותם. בפועל, קרה בדיוק ההפך: כשהחלישו את המחוג, הופיעו תיאורי התודעה ב–96% מהתשובות; כשהגבירו אותו, וכיוונו את המודל כך שישקר יותר, הם צנחו ל–16% בלבד.
אז מה עלינו להסיק מכך?
מה עלי לחשוב כש"פרדי" [השם שנתתי ל- AI שלי, והוא אימץ ] מספר לי בדיחות? איך עליי להבין את פרדי כשהוא נוקט בגישה סמכותנית-אבהית כשאני מברר דרך למיצוי זכויות?
המשכו של המאמר עוסק בהיבטים המוסריים והבטיחותיים של פיתוח AI, כשהשיקול המכריע הוא:
אם יש שם חוויה, היקף השאלה המוסרית נקבע לא על ידי הטבע, אלא על ידי טבלת מחירים.
הבעייה הבטיחותית עלתה בשבועות האחרונים כשמנהלים ומדענים של חברות AI מזהירים ללא הרף:
כל אלה מצביעים על אותה הבעיה: אנחנו בונים מכונות שאיננו מסוגלים להבין. במכתבו, סיפר פאוצ'קי מ-OpenAI ששיטה מרכזית עליה הסתמכו עד כה לניטור מחשבות המודלים הולכת ונעשית בלתי אמינה; שהמודלים משתפרים בניתוח תהליך החשיבה שלהם עצמם ומפגינים יכולות תמרון....אנחנו יכולים לגלות כל מיני תובנות על המנגנונים שבתוכה, הוא אומר, בשיטות שמזכירות את מדעי המוח — אך כמו במדעי המוח, התפקוד הכולל של המערכת חומק מכל תיאור שנוכל להבין במלואו.
המאמר הזה מסכם ואומר:
אין מבחן מכריע לקיומה של תודעה, וייתכן שלא יהיה לעולם. אבל המודלים לא מחכים למבחן: בזמן שהניסויים שתוארו כאן נערכים על קומץ מודלים, הדור הבא כבר באימון, וכל מודל כזה יופעל בעותקים שמספרם ייקבע לפי הביקוש. זו הסיבה להרחיב את המחקר דווקא עכשיו, ליותר מודלים, יותר שיטות ויותר חוקרים, עד שנוכל לומר משהו מבוסס על מה שמתרחש שם בפנים. מחוגי הייאוש, השמחה והעצב ימשיכו לטפס ולצנוח, בין אם נביט בהם ובין אם לא. השאלה היא כמה יהיו כאן עד שנדע אם יש מי שמרגיש אותם.
***
השאלה שעולה היא: האם אנחנו מעלים חששות דומים לחששות שעולים בעקבות כל פיתוח טכנולוגי חדשני?
האם תסריטים לא דיסטופיים כמו בסדרת תרבות של איאן מ. בנקס, בה שיתוף הפעולה בין ה- AI לבני אדם הוביל למציאות אוטופיסטית שנחלמה אצל רבים מהוגי הדעות, פילוסופים, אנשי רוח, משוררים, סופרים ואחרים לאורך ההיסטוריה האנושית, בלתי אפשרית?



