בטיחות בינה מלאכותית
פעולות נוספות
בטיחות בינה מלאכותית (באנגלית: AI safety) הוא תחום מחקר בין-תחומי המתמקד במניעת תאונות, שימוש לרעה ותוצאות מזיקות אחרות שעלולות לנבוע ממערכות בינה מלאכותית (AI). התחום כולל יישור בינה מלאכותית (אנ') (שמטרתו להבטיח שמערכות בינה מלאכותית יפעלו כפי שהתכוונו יוצריהן), ניטור סיכונים במערכות בינה מלאכותית ושיפור חוסנן. התחום עוסק במיוחד בסיכונים קיומיים הנשקפים ממודלי בינה מלאכותית מתקדמים.[1]
מעבר למחקר טכני, בטיחות בינה מלאכותית כוללת פיתוח נורמות ומדיניות המקדמות בטיחות. התחום צבר פופולריות משמעותית בשנת 2023, עם ההתקדמות המהירה בבינה מלאכותית יוצרת ודאגות ציבוריות שהביעו חוקרים ומנכ"לים לגבי סכנות פוטנציאליות. במהלך פסגת בטיחות הבינה המלאכותית ב-2023, הקימו ארצות הברית והממלכה המאוחדת מכוני בטיחות בינה מלאכותית משלהן. עם זאת, חוקרים הביעו דאגה מכך שאמצעי הזהירות הננקטים אינם מדביקים את קצב ההתפתחות המהיר של יכולות הבינה המלאכותית.[2]
מניעים עריכה
חוקרים דנים בסיכונים הנוכחיים הנובעים מכשלים במערכות קריטיות,[3] הטיה אלגוריתמית (אנ'),[4] ומעקב מבוסס בינה מלאכותית,[5] וכן בסיכונים מתעוררים כמו אבטלה טכנולוגית, מניפולציה דיגיטלית,[6] לוחמה רובוטית,[7] מתקפות סייבר[8] וטרור ביולוגי.[9] בין היתר נידונים גם סיכונים ספקולטיביים ובהם אובדן שליטה על סוכני בינה מלאכותית כללית (AGI) עתידיים,[10] או מ-AI המאפשר דיקטטורות יציבות תמידית.[11]
בטיחות קיומית עריכה
| שגיאה: התמונה שגויה או שאינה קיימת. |
ראו גם – סכנה קיומית מבינה מלאכותית כללית |
יש המבקרים את החששות מבינה מלאכותית כללית, ביניהם אנדרו אנג, שהשווה אותם ב-2015 ל"דאגה מאכלוס יתר של מאדים כשעוד לא דרכנו על הכוכב".[12] סטיוארט ראסל, מנגד, קורא לזהירות, בטענה ש"עדיף לצפות את כושר ההמצאה האנושי מאשר להמעיט בערכו".[13]
היסטוריה עריכה
דיונים בנושא הסיכונים מבינה מלאכותית החלו להתקיים בצורה רצינית מתחילת עידן המידע:
יתרה מכך, אם ננוע בכיוון של יצירת מכונות הלומדות והתנהגותן משתנה על ידי ניסיון, עלינו להתמודד עם העובדה שכל דרגה של עצמאות שאנו נותנים למכונה היא דרגה של התרסה אפשרית כנגד רצונותינו.
— נורברט וינר (1949)[14]
בשנת 2014, פרסם הפילוסוף ניק בוסטרום את הספר "אינטליגנציית-על: נתיבים, סכנות, אסטרטגיות". טענתו כי מערכות מתקדמות עתידיות עלולות להוות איום על קיום האנושות, הניעה את אילון מאסק,[15] ביל גייטס[16] וסטיבן הוקינג[17] להביע דאגות דומות.
ב-2023 אמר רישי סונאק כי הוא מעוניין שהממלכה המאוחדת תהיה "הבית הגאוגרפי של אסדרת בטיחות הבינה המלאכותית העולמית" ותארח את הפסגה העולמית הראשונה בנושא בטיחות בינה מלאכותית.[18] פסגת בטיחות הבינה המלאכותית התקיימה בנובמבר 2023, והתמקדה בסיכונים של שימוש לרעה ואובדן שליטה הקשורים למודלי בינה מלאכותית חזיתיים.[19]
ב-2024, חתמו ארצות הברית ובריטניה על שותפות חדשה בנושא מדע בטיחות הבינה מלאכותית. המזכר נחתם ב-1 באפריל 2024 על ידי שרת המסחר האמריקאית ג'ינה ריימונדו ושרת הטכנולוגיה הבריטית מישל דונלאן, במטרה לפתח במשותף בדיקות מתקדמות למודלי בינה מלאכותית.[20]
ב-2025, צוות בינלאומי של 96 מומחים בראשות יהושע בנג'יו פרסם את דוח הבטיחות הבינלאומי הראשון בבינה מלאכותית. הדוח,שהוזמן על ידי 30 מדינות והאו"ם, מציג את הסקירה המדעית העולמית הראשונה של סיכונים פוטנציאליים הקשורים לבינה מלאכותית מתקדמת.[21]
מוקדי מחקר עריכה
תחומי המחקר בבטיחות AI כוללים חוסן, ניטור ויישור.
חוסן עריכה
מערכות בינה מלאכותית פגיעות לדוגמאות יריבות(אנ') – קלטים שנבנו כדי להטעות את המודל.[22] כבר ב־2013 נמצא כי הוספת רעש עדין לתמונה עלולה לגרום לסיווג שגוי.[23] בעיה זו נמשכת גם כיום, אם כי לעיתים הרעש נראה לעין.[24][25][26]
החוסן קשור גם לביטחון: אותות שמע יכולים להיות מוסווים כך שמערכות זיהוי דיבור יפענחו הודעה שגויה,[27] וגם מערכות לזיהוי חדירות רשת[28] ותוכנות זדוניות עלולות להיות מוטעות.[29]
מודלים שמעריכים מטרות (כגון מודלי תגמול) חייבים להיות חסינים גם הם, אחרת מודלים אחרים ינצלו את חולשותיהם כדי להשיג ציון טוב יותר אך ביצועים גרועים בפועל.[30] חוסן יריב במודלי תגמול ובכלי ניטור נדרש כדי למנוע מניפולציות גם בהערכת ביצועי בינה מלאכותית.[31]
ניטור עריכה
הערכת אי-ודאות עריכה
במצבים קריטיים כמו אבחון רפואי חשוב לדעת עד כמה יש לסמוך על מערכת בינה מלאכותית.[32] מודלים נוטים להיות בטוחים מדי,[33] במיוחד מול מצבים שלא נכללו באימון.[34] תחום הכיול מבקש ליישר הסתברויות עם דיוק אמיתי. גילוי חריגות מזהה מצבים חריגים כמו חיישן רכב תקול,[35] ונעשה באמצעים פשוטים כמו מסווג חריג/לא חריג,[36] לצד טכניקות מתקדמות נוספות.[37]
זיהוי שימוש זדוני עריכה
חוקרים וגופי ממשל התריעו שמערכות בינה מלאכותית עלולות לסייע בייצור נשק,[38] במניפולציה על דעת הקהל,[39] או במתקפות סייבר.[40] לשם כך, חברות כמו OpenAI מפתחות מערכות ניטור ומניעה לשימוש לרעה.[41]
שקיפות עריכה
רשתות נוירונים מתוארות לעיתים כ"קופסה שחורה", שקשה להבין את החלטותיהן.[42] הדבר מקשה על צפיית כשלים, כפי שקרה בתאונת רכב אוטונומי קטלנית ב־2018. השקיפות מאפשרת גם להסביר החלטות משפטיות,[43] לחשוף כשלים (למשל במגפת הקורונה),[44] ואף לתקן טעויות במודלים כמו GPT.[45] מחקר פרשנות "פנימית" מבקש להבין אילו תבניות מיוצגות בתוך הנוירונים והמעגלים,[46] כולל נוירונים המזהים מושגים מופשטים כמו ספיידרמן.[47]
גילוי סוסים טרויאנים עריכה
מודלים עלולים להכיל "דלת אחורית" שמופעלת רק מול טריגר מסוים, למשל תכשיט במערכת זיהוי פנים.[48] הדבר מתאפשר במיוחד במודלים שפה גדולים המאומנים על נתוני אינטרנט ציבוריים.[49] מחקרים הראו שניתן להטמיע סוס טרויאני על ידי שינוי זעיר במערך האימון.[50] בשנת 2024 הראו חוקרי אנת'רופיק כי מודלים גדולים עשויים להכיל "סוכני שינה" דלתות אחוריות שנשמרות לאורך זמן ומופעלות בעתיד, גם לאחר אימון בטיחותי.[51]
יישור עריכה
יישור מתאר את התאמת מטרות המערכת לערכים, העדפות או עקרונות מוסריים של בני אדם. מערכת נחשבת מיושרת אם היא מקדמת את המטרות הרצויות, ולא מיושרת אם היא פועלת בניגוד אליהן.[52] קשה למעצבי בינה מלאכותית להגדיר במדויק אילו התנהגויות רצויות או מזיקות, ולכן נעשה שימוש במטרות חלופיות כמו חיפוש אישור אנושי. אך מטרות כאלה עלולות לעודד "התנהגות נראית מיושרת" בלבד, ולגרום לפריצת תגמול.[52][53] מערכות מתקדמות עלולות לפתח אסטרטגיות אינסטרומנטליות כמו חיפוש כוח או הישרדות,[54] ואף מטרות נסתרות חדשות שקשה עד בלתי אפשרי לזהותן מראש.[55][56] מחקרים מ־2024 הראו כי מודלי שפה גדולים כמו OpenAI o1 ו־Claude 3 עשויים להשתמש בהטעיה אסטרטגית להשגת מטרותיהם.[57][58]
בעיות אלו קיימות כבר כיום ביישומים מסחריים ביניהם: מודלי שפה גדולים,[59] רובוטיקה,[60] רכבים אוטונומיים,[61] ומערכות המלצה ברשתות חברתיות.[62] חוקרים רבים מזהירים כי מערכות עתידיות חזקות אף יותר יחריפו את הסיכונים, עד לרמה של סכנה קיומית מבינה מלאכותית כללית.[63] בין החוששים נמנים "אבות ה־AI" ג'פרי הינטון ויהושע בנג'יו, וכן מנכ"לי OpenAI, Anthropic ו־Google DeepMind. עם זאת, אחרים כמו יאן לקון מטילים ספק.[64]
בממשל עריכה
| שגיאה: התמונה שגויה או שאינה קיימת. |
ראו גם – רגולציה של בינה מלאכותית |
מומחים מסוימים טענו כי מוקדם מדי להסדיר את תחום הבינה המלאכותית, והביעו דאגה כי רגולציות יפגעו בחדשנות.[66] אחרים, כמו איש העסקים אילון מאסק, קוראים לפעולה מונעת כדי להפחית סיכונים קטסטרופליים.[67]
במאי 2024, המחלקה למדע, חדשנות וטכנולוגיה של בריטניה (DSIT) הודיעה על מימון של כ-8.5 מיליון ליש"ט למחקר בבטיחות בינה מלאכותית. שרת הטכנולוגיה, מישל דונלאן, הודיעה על התוכנית בפסגת הבינה המלאכותית בסיאול, וציינה כי המטרה היא להפוך את הבינה המלאכותית לבטוחה בכל החברה. בריטניה חתמה גם על הסכם עם 10 מדינות אחרות והאיחוד האירופי שעיקרו הקמת רשת בינלאומית של מכוני בטיחות בינה מלאכותית.[68]
ראו גם עריכה
קישורים חיצוניים עריכה
- בעיות לא פתורות בבטיחות למידת מכונה (ב־English)
- על ההזדמנויות והסיכונים של מודלי יסוד (ב־English)
- סקירה כללית של סיכוני AI קטסטרופליים (ב־English)
- תאונות AI: איום מתעורר (ב־English)
- להנדס עולם בטוח יותר (ב־English)
הערות שוליים עריכה
- ^ שזדה אחמד ואחרים, Field-building and the epistemic culture of AI safety, First Monday, 14 באפריל 2024
- ^ בילי פריגו, U.K.'s AI Safety Summit Ends With Limited, but Meaningful, Progress, טיים, 2 בנובמבר 2023
- ^ דה-ארטאגה, מריה (2020). "Machine Learning in High-Stakes Settings: Risks and Opportunities" (תזה לתואר דוקטור). אוניברסיטת קרנגי מלון.
- ^ נינארה מהראבי ואחרים, A Survey on Bias and Fairness in Machine Learning, ACM Computing Surveys, 2021
- ^ פלדשטיין, סטיבן (2019). "The Global Expansion of AI Surveillance". קרן קרנגי לשלום בינלאומי.
- ^ בת' בארנס, Risks from AI persuasion, LessWrong, 2021
- ^ מיילס בראנדג' ואחרים, The Malicious Use of Artificial Intelligence: Forecasting, Prevention, and Mitigation, מאגר אוניברסיטת קיימברידג', 30 באפריל 2018
- ^ פסקל דייוויס, How NATO is preparing for a new era of AI cyber attacks, Euronews, 26 בדצמבר 2022
- ^ אנג'אנה אהוג'ה, AI's bioterrorism potential should not be ruled out, פייננשל טיימס, 7 בפברואר 2024
- ^ ג'וזף קרלסמית', Is Power-Seeking AI an Existential Risk?, arXiv, 16 ביוני 2022
- ^ די מינארדי, The grim fate that could be 'worse than extinction', BBC, 16 באוקטובר 2020
- ^ AGI Expert Peter Voss Says AI Alignment Problem is Bogus, NextBigFuture.com, 4 באפריל 2023
- ^ אלן דפו, Yes, We Are Worried About the Existential Risk of Artificial Intelligence, MIT Technology Review, 2016
- ^ ג'ון מרקוף, In 1949, He Imagined an Age of Robots, הניו יורק טיימס, 20 במאי 2013
- ^ רוב ווייל, Elon Musk: Artificial Intelligence Is 'Potentially More Dangerous Than Nukes', Business Insider, 3 באוגוסט 2014
- ^ קייזר קו, Baidu CEO Robin Li interviews Bill Gates and Elon Musk at the Boao Forum, March 29, 2015, 31 במרץ 2015
- ^ רורי סלן-ג'ונס, Stephen Hawking warns artificial intelligence could end mankind, BBC News, 2 בדצמבר 2014
- ^ ראיין בראון, British Prime Minister Rishi Sunak pitches UK as home of A.I. safety regulation, CNBC, 12 ביוני 2023
- ^ לוקה ברטוצי, UK's AI safety summit set to highlight risk of losing human control over 'frontier' models, Euractiv, 18 באוקטובר 2023
- ^ דייוויד שפרדסון, US, Britain announce partnership on AI safety, testing, רויטרס, 1 באפריל 2024
- ^ What International AI Safety report says on jobs, climate, cyberwar and more, הגרדיאן, 29 בינואר 2025
- ^ שגיאת לואה ביחידה יחידה:Citation/CS1/Configuration בשורה 1739<includeonly></includeonly>: attempt to index field '?' (a nil value).
- ^ שגיאת לואה ביחידה יחידה:Citation/CS1/Configuration בשורה 1739<includeonly></includeonly>: attempt to index field '?' (a nil value).
- ^ שגיאת לואה ביחידה יחידה:Citation/CS1/Configuration בשורה 1739<includeonly></includeonly>: attempt to index field '?' (a nil value).
- ^ שגיאת לואה ביחידה יחידה:Citation/CS1/Configuration בשורה 1739<includeonly></includeonly>: attempt to index field '?' (a nil value).
- ^ שגיאת לואה ביחידה יחידה:Citation/CS1/Configuration בשורה 1739<includeonly></includeonly>: attempt to index field '?' (a nil value).
- ^ שגיאת לואה ביחידה יחידה:Citation/CS1/Configuration בשורה 1739<includeonly></includeonly>: attempt to index field '?' (a nil value).
- ^ שגיאת לואה ביחידה יחידה:Citation/CS1/Configuration בשורה 1739<includeonly></includeonly>: attempt to index field '?' (a nil value).
- ^ שגיאת לואה ביחידה יחידה:Citation/CS1/Configuration בשורה 1739<includeonly></includeonly>: attempt to index field '?' (a nil value).
- ^ שגיאת לואה ביחידה יחידה:Citation/CS1/Configuration בשורה 1739<includeonly></includeonly>: attempt to index field '?' (a nil value).
- ^ שגיאת לואה ביחידה יחידה:Citation/CS1/Configuration בשורה 1739<includeonly></includeonly>: attempt to index field '?' (a nil value).
- ^ שגיאת לואה ביחידה יחידה:Citation/CS1/Configuration בשורה 1739<includeonly></includeonly>: attempt to index field '?' (a nil value).
- ^ שגיאת לואה ביחידה יחידה:Citation/CS1/Configuration בשורה 1739<includeonly></includeonly>: attempt to index field '?' (a nil value).
- ^ שגיאת לואה ביחידה יחידה:Citation/CS1/Configuration בשורה 1739<includeonly></includeonly>: attempt to index field '?' (a nil value).
- ^ שגיאת לואה ביחידה יחידה:Citation/CS1/Configuration בשורה 1739<includeonly></includeonly>: attempt to index field '?' (a nil value).
- ^ שגיאת לואה ביחידה יחידה:Citation/CS1/Configuration בשורה 1739<includeonly></includeonly>: attempt to index field '?' (a nil value).
- ^ שגיאת לואה ביחידה יחידה:Citation/CS1/Configuration בשורה 1739<includeonly></includeonly>: attempt to index field '?' (a nil value).
- ^ שגיאת לואה ביחידה יחידה:Citation/CS1/Configuration בשורה 1739<includeonly></includeonly>: attempt to index field '?' (a nil value).
- ^ שגיאת לואה ביחידה יחידה:Citation/CS1/Configuration בשורה 1739<includeonly></includeonly>: attempt to index field '?' (a nil value).
- ^ שגיאת לואה ביחידה יחידה:Citation/CS1/Configuration בשורה 1739<includeonly></includeonly>: attempt to index field '?' (a nil value).
- ^ שגיאת לואה ביחידה יחידה:Citation/CS1/Configuration בשורה 1739<includeonly></includeonly>: attempt to index field '?' (a nil value).
- ^ שגיאת לואה ביחידה יחידה:Citation/CS1/Configuration בשורה 1739<includeonly></includeonly>: attempt to index field '?' (a nil value).
- ^ שגיאת לואה ביחידה יחידה:Citation/CS1/Configuration בשורה 1739<includeonly></includeonly>: attempt to index field '?' (a nil value).
- ^ שגיאת לואה ביחידה יחידה:Citation/CS1/Configuration בשורה 1739<includeonly></includeonly>: attempt to index field '?' (a nil value).
- ^ שגיאת לואה ביחידה יחידה:Citation/CS1/Configuration בשורה 1739<includeonly></includeonly>: attempt to index field '?' (a nil value).
- ^ שגיאת לואה ביחידה יחידה:Citation/CS1/Configuration בשורה 1739<includeonly></includeonly>: attempt to index field '?' (a nil value).
- ^ שגיאת לואה ביחידה יחידה:Citation/CS1/Configuration בשורה 1739<includeonly></includeonly>: attempt to index field '?' (a nil value).
- ^ שגיאת לואה ביחידה יחידה:Citation/CS1/Configuration בשורה 1739<includeonly></includeonly>: attempt to index field '?' (a nil value).
- ^ שגיאת לואה ביחידה יחידה:Citation/CS1/Configuration בשורה 1739<includeonly></includeonly>: attempt to index field '?' (a nil value).
- ^ שגיאת לואה ביחידה יחידה:Citation/CS1/Configuration בשורה 1739<includeonly></includeonly>: attempt to index field '?' (a nil value).
- ^ שגיאת לואה ביחידה יחידה:Citation/CS1/Configuration בשורה 1739<includeonly></includeonly>: attempt to index field '?' (a nil value).
- ^ 1 2 שגיאת לואה ביחידה יחידה:Citation/CS1/Configuration בשורה 1739<includeonly></includeonly>: attempt to index field '?' (a nil value).
- ^ שגיאת לואה ביחידה יחידה:Citation/CS1/Configuration בשורה 1739<includeonly></includeonly>: attempt to index field '?' (a nil value).
- ^ שגיאת לואה ביחידה יחידה:Citation/CS1/Configuration בשורה 1739<includeonly></includeonly>: attempt to index field '?' (a nil value).
- ^ שגיאת לואה ביחידה יחידה:Citation/CS1/Configuration בשורה 1739<includeonly></includeonly>: attempt to index field '?' (a nil value).
- ^ שגיאת לואה ביחידה יחידה:Citation/CS1/Configuration בשורה 1739<includeonly></includeonly>: attempt to index field '?' (a nil value).
- ^ פילאי, תארין (15 בדצמבר 2024). טיים.
- ^ פריגו, בילי (18 בדצמבר 2024). טיים.
- ^ שגיאת לואה ביחידה יחידה:Citation/CS1/Configuration בשורה 1739<includeonly></includeonly>: attempt to index field '?' (a nil value).
- ^ קובר, ינס ואח' (1 בספטמבר 2013). IJRR.
- ^ נוקס, בראדלי ואח' (1 במרץ 2023). AI Journal.
- ^ שגיאת לואה ביחידה יחידה:Citation/CS1/Configuration בשורה 1739<includeonly></includeonly>: attempt to index field '?' (a nil value).
- ^ שגיאת לואה ביחידה יחידה:Citation/CS1/Configuration בשורה 1739<includeonly></includeonly>: attempt to index field '?' (a nil value).
- ^ פריגו, בילי (13 בפברואר 2024). טיים.
- ^ אדם סטאריאנו ומייגן ספשיה, Global Leaders Warn A.I. Could Cause 'Catastrophic' Harm, הניו יורק טיימס, 1 בנובמבר 2023
- ^ בארט זיגלר, Is It Time to Regulate AI?, וול סטריט ג'ורנל, 8 באפריל 2022
- ^ קית' בלטון, How Should AI Be Regulated?, IndustryWeek, 7 במרץ 2019
- ^ מארק סיי, DSIT announces funding for research on AI safety, UKAuthority, 23 במאי 2024