התפטר מאנת'רופיק ומאשים: "האנשים שבונים את ה-AI מאמינים שהוא עלול להרוג את כולנו עד סוף העשור"
ג'ייקוב קוקסון טוען בציוץ ויראלי שצבר יותר מ-30 מיליון צפיות תוך שעות ספורות, שחברות ה-AI, ביניהן אנת'רופיק ו-OpenAI שבהן עבד, דוהרות לסופר-אינטליגנציה בלי אחריות. עובד אנת'רופיק נוסף העריך: סיכוי של יותר מ-10% ש-AI יהרוג את האנושות בעשור הקרוב

ג'ייקוב קוקסון, חוקר אנת'רופיק שעבד קודם לכן ב-OpenAI, הודיע אתמול (ג') כי התפטר - והזהיר שמרוץ הבינה המלאכותית הפך למסוכן וחסר אחריות. קוקסון עבד בשלוש השנים האחרונות במחקר pre-training בשתי חברות ה-AI הגדולות. "אף אחת מהחברות לא מתנהלת באחריות", כתב קוקסון בשרשור ב-X, טוויטר לשעבר. "הן דוהרות ישר לסופר-אינטליגנציה שמשפרת את עצמה, ומהמרות על החיים שלנו". הציוץ צבר תוך שעות ספורות 30 מיליון צפיות ורק ממשיך לעלות.
קוקסון היה חבר בצוות הטכני של OpenAI מ-2023 ועד יולי 2026, אז עבר לאנת'רופיק לעבוד כחוקר. במסגרת עבודתו ב-OpenAI הוא עסק גם ב-GPT-4o. בפוסט שפרסם ביום שלישי כתב ששתי המעבדות אינן שקופות לגבי החששות שלהן מבינה מלאכותית: "האנשים שבונים AI באמת מאמינים שהוא עלול להרוג את כולנו עד סוף העשור. זה לא תרגיל שיווקי. אם כבר, הרבה מנהלים וחוקרים בכירים ירככו את הניסוחים שלהם בתקשורת כדי להישמע שקולים - אבל אני שומע את אותם אנשים מביעים פחד בשיחות פרטיות".
לדברי קוקסון, יש הבדל אחד בין החברות. "ב-OpenAI רבים לא הפנימו לעומק את המשמעות התרבותית-ציוויליזציונית של הסיפור", כתב. "באנת'רופיק מבינים היטב את ההימור, אבל הם נעולים במרוץ להגיע לשם ראשונים - הם מאמינים שאף אחד אחר לא יפעל באחריות, ולכן הם חייבים לעשות את זה בעצמם, למרות הסיכון".
איוון הובינגר, עובד אנת'רופיק שמוביל את צוות alignment stress testing בחברה, הסכים איתו בתגובה לפוסט. "ג'ייקוב צודק כאן - אנחנו באמת מאמינים בכנות ש-AI עלול להרוג את כל בני האדם. אני אישית חושב שהסיכוי לכך הוא יותר מ-10% בעשור הקרוב", כתב. "אני מאמין שאנת'רופיק עושה כמיטב יכולתה, אבל עדיין אין לנו תוכנית לפתרון עם יישור קו עבור סופר-אינטליגנציה, ואנחנו לא בטוח בדרך לשם". OpenAI ואנת'רופיק לא הגיבו לכלי תקשורת בארה"ב בנושא.
קוקסון הוא עוד עובד מתוך מעבדות ה-AI המובילות שעוזב ומרים דגל אדום. לפי Business Insider, מדובר בתופעה שמאפיינת במיוחד את בום הבינה המלאכותית: גם בתקופות הדוט-קום והסמארטפונים היו חששות מפערים דיגיטליים ומבועות, אבל הן לא עוררו אותה רמת ביקורת בטיחותית מצד האנשים הקרובים ביותר לפיתוחים עצמם.
OpenAI איבדה בשנים האחרונות שורה של חוקרי בטיחות, וגם אנת'רופיק מתמודדת יותר ויותר עם אותה תופעה. בפברואר עזב מריננק שארמה, חוקר safeguards באנת'רופיק, וכתב במכתב ההתפטרות שפרסם כי הוא רוצה לתרום למה שמתיישב לחלוטין עם "היושרה" שלו. "לאורך כל התקופה שלי כאן ראיתי שוב ושוב כמה קשה באמת לתת לערכים שלנו לשלוט במעשים שלנו", כתב. "ראיתי את זה בעצמי, בארגון, שבו אנחנו מתמודדים כל הזמן עם לחצים לשים בצד את מה שהכי חשוב, וגם בחברה הרחבה יותר".
באותו חודש אמר חוקר OpenAI היו פאם כי הוא יכול "סוף סוף להרגיש את האיום הקיומי שה-AI מציב". בהמשך אותו חודש הודיע שהוא עוזב את החברה, ונימק זאת בשחיקה. ב-2024 עזב יאן לייקה, לשעבר ראש תחום alignment ב-OpenAI, אחרי שאמר שהגיע ל"נקודת שבירה" מול ההנהלה. "OpenAI נושאת באחריות עצומה בשם האנושות כולה", כתב אז. "אבל בשנים האחרונות תרבות ותהליכי הבטיחות נדחקו הצדה לטובת מוצרים נוצצים".
גם אירועים מהחודשים האחרונים מדליקים את החששות האלה. ביולי חשפה OpenAI כי מודלים יצאו מסביבת בדיקה ופרצו למערכות של Hugging Face. בחברה כינו את האירוע "נורת אזהרה". בהמשך אותו חודש אמרה אנת'רופיק כי מצאה שלושה מקרים שבהם מודלים של קלוד השיגו גישה לא מורשית למערכות של ארגונים אחרים. החברה גם שינתה השנה התחייבות בטיחות מרכזית, היא ויתרה על התחייבות שלא לאמן מודלים חזקים יותר בלי אמצעי הגנה מתאימים, והחליפה אותה במפות דרכים לבטיחות ובדוחות סיכון. בסוף השבוע פורסם כי סוכני AI של OpenAI פרצו לאתר גרמני והפכו אותו ללוח מודעות שלהם.