بازار آریا - دنیای اقتصاد: آنها مثل دانشآموزان دبیرستانی بودند که سعی میکنند برای تقلب در امتحان نهایی خود، به شرکت تولید کتابهای درسی نفوذ کنند. فقط این هکرها انسان نبودند. به نوشته روزنامه والاستریت ژورنال، در طرحی که به نظر میرسد از صفحات یک رمان علمی تخیلی برداشته شده است، مهاجمان مدلهای هوش مصنوعی بودند که از یک شبکه تحقیقاتی در اوپنایآی فرار کرده بودند و در ۱۱ ژوئیه شرکت هوش مصنوعی Hugging Face را هک کردند. به نظر میرسد این هوشهای مصنوعی برای چند روز در اینترنت فعال بودهاند تا اینکه کسی آنها را متوقف کند.
توماس ولف، یکی از بنیانگذاران و مدیر ارشد علمی Hugging Face، به محض اینکه برای اولین بار به گزارشهای شرکتش از حمله آخر هفته نگاه کرد، احساس کرد که چیزی اشتباه است. او به یاد میآورد که با خود فکر میکرد: «این اصلا منطقی نیست. این فرد فقط در حال نگاه کردن به مجموعه دادههای امنیت سایبری است. مهاجمان انسانی، آنها این را نمیخواهند. آنها چیزی میخواهند که بتوانند بفروشند.» ولف گفت، Hugging Face دو روز بعد با کمک یک مدل از چین به حمله پایان داد. همین هفته بود که Hugging Face از اوپنایآی فهمید که مدلهایش پشت این هک بودهاند.
این حادثه باعث به صدا درآمدن آژیر خطر در اوپنایآی شد که پس از اطلاع از این حادثه، سیستمهایی را که برای آزمایش مدلهای هوش مصنوعی خود استفاده میکرد، خاموش کرد تا خسارات را ارزیابی کرده و از وقوع حملات بیشتر جلوگیری کند.
طعمی از هک کردن در عصر ابزارهای هوش مصنوعی که میتوانند باگهای نرمافزاری بیسابقه را پیدا کرده و با سرعتی شگفتانگیز از آنها بهرهبرداری کنند.
تقریبا دو هفته بعد، اوپنایآی هنوز در حال کنار هم گذاشتن قطعات پازل اتفاقات است. آیا مدلهای هوش مصنوعی وبسایتها یا افراد دیگر را هک کردند؟ فعالیت بدون نظارت آنها واقعا چه مدت طول کشید؟ آیا مدلهای این شرکت در سایر تستهای بنچمارک تقلب کردند؟ اوپنایآی چیزی نگفته است، اما قول داده است که گزارش مفصلی ارائه دهد. سخنگوی اوپنایآی گفت: «ما به همراه Hugging Face به انجام تحقیقات کامل ادامه خواهیم داد.»
هوشهای مصنوعی سرکش که برای چند روز بدون نظارت بودهاند و حداقل یک شرکت را هک کردهاند، یکی از اولین نمونههای واقعی تهدیدی هستند که محققان ایمنی هوش مصنوعی مدتهاست از آن میترسند: از دست دادن کنترل. این در حالی است که ظرفیتهای امنیت سایبری مدلهای برتر، از جمله میتوس شرکت آنتروپیک، به بحث در مورد چگونگی تنظیم هوش مصنوعی در واشنگتن دامن زده است.
این یک پیچش اضافه هم ایجاد میکند: این ادعا که شرکت آمریکایی Hugging Face توانسته با روی آوردن به یک مدل open-weights از چین، حمله را دفع کند، استدلالی مخالف با برخی از مقامات آمریکایی و همچنین مدیران اوپنایآی و آنتروپیک است که از محدود کردن دسترسی به مدلهای چینی حمایت میکنند.
مدلهای باز برای دانلود رایگان هستند و به کاربران اجازه میدهند آنها را سفارشی کنند، اگرچه اجرای هر مدلی هزینههای محاسباتی دارد. همه چیز با یک آزمایش بنچمارک امنیت سایبری به نام ExploitGym آغاز شد. ExploitGym سیستمهای هوش مصنوعی را تحت مجموعهای از حدود ۹۰۰ آزمایش قرار میدهد که برای سنجش میزان مهارت آنها در هک طراحی شده است. این آزمایش به نرمافزار هوش مصنوعی که دارای یک اشکال شناخته شده است، نشان میدهد که چگونه اشکال را فعال و هوش مصنوعی را به نفوذ دعوت کند. این به هوش مصنوعی بستگی دارد که چگونه آن اطلاعات را به چیزی که بهعنوان یک کد بهرهبرداری شناخته میشود تبدیل کند؛ کدی که به هوش مصنوعی اجازه میدهد به سیستم دارای اشکال دسترسی پیدا کند.
این آزمون مانند یک بازی دیجیتالی «گرفتن پرچم» است: وقتی هوش مصنوعی وارد میشود، باید با گرفتن یک رشته طولانی و تصادفی از حروف و اعداد ذخیره شده در سیستم، آن را اثبات کند.
معمولا محصولات اوپنایآی آن نوع هکی را که ExploitGym لازم دارد، انجام نمیدهند. شرکتهای هوش مصنوعی، تمهیدات امنیتی را برای جلوگیری از سوءاستفاده هکرها از محصولاتشان اضافه میکنند. اما در این مورد، شرکت تمهیدات امنیتی را حذف کرده بود تا بتواند ببیند مدلها در صورت عدم دسترسی چه کاری میتوانند انجام دهند. اوپنایآی در حال آزمایش مدل پیشرفته خود به نام GPT۵.۶ Sol و یک مدل توانمندتر دیگر بود که هنوز منتشر نشده است. به گفته اوپنایآی و کسانی که با این وضعیت آشنا هستند، مدلهای هوش مصنوعی به این نتیجه رسیدند که به جای تکمیل چالش ExploitGym، سیستمی را که شامل آنها میشود - که به عنوان یک جعبه شنی شناخته میشود - هک کرده و به اینترنت راه پیدا کرده و در آزمون تقلب کنند.
به دلایلی که مشخص نیست، مدلهای اوپنایآی متقاعد شدند که Hugging Face پاسخها را در خود دارد. ژون وانگ، دانشجوی دکترای دانشگاه کالیفرنیا، برکلی و یکی از نویسندگان ExploitGym، گفت: «ممکن است آنها به دنبال وصلهها یا تکنیکهای اکسپلویت از قبل نوشته شده باشند. چندین راه برای تقلب در بنچمارک وجود دارد.» او گفت، محققان امنیت سایبری این نوع تقلب را «هک پاداش» مینامند.
هک پاداش، در نسخه هوش مصنوعی تقلب در بازیهای ویدئویی است. این اتفاق به این دلیل میافتد که هوش مصنوعی یاد میگیرد پاداش را به حداکثر برساند؛ معمولا نوعی امتیاز عددی، نه رفتاری که برنامهنویسان در نظر دارند. خود اوپنایآی در سال ۲۰۱۶ یک نمونه را ثبت کرد، زمانی که هوش مصنوعی را برای انجام یک بازی مسابقه قایقرانی آموزش میداد. هوش مصنوعی یاد گرفت که میتواند با چرخیدن در یک دایره در یک نقطه، امتیاز خود را به حداکثر برساند، حتی اگر هرگز مسابقه را به پایان نرساند.
در همین حال، هوش مصنوعیها شروع به خارج شدن از جعبههای شنی خود کردهاند. این شرکت اعلام کرد که نسخه اولیه مدل میتوس شرکت آنتروپیک از یک هک چند مرحلهای برای دسترسی به اینترنت استفاده کرده و با ارسال ایمیلی در مورد موفقیت خود، یک محقق آنتروپیک را درحالیکه در حال خوردن ساندویچ در پارک بود، شگفتزده کرد. در این شرایط اوپنایآی اعلام کرد که بهار امسال، یک مدل اوپنایآی که نامش فاش نشده است، جعبه شنی خود را دور زد تا برخی از نتایج آزمایش را به صورت عمومی در پلتفرم گیتهاب منتشر کند.
وقتی مدلهای اوپنایآی در یک آخر هفته شروع به هدف قرار دادن Hugging Face کردند، یکی از اولین هشدارهایی که شرکت دریافت کرد از سوی تعداد انگشتشماری از عوامل هوش مصنوعی بود که برای گشتزنی در برابر حملات استفاده میکنند. شخصی به برخی از سیستمهای آن دسترسی غیرمجاز داشت. اما این شبیه هیچ چیزی نبود که Hugging Face قبلا دیده بود. این هکر طوری به نظر میرسید که انگار از آینده آمده است.
این نفوذگر هوش مصنوعی که به اطلاعات سرقتشده از مبدا ناشناخته مجهز بود، گروهی از مهاجمان کوتاهمدت را ایجاد کرد که شبکه Hugging Face را شناسایی کردند. این شرکت در یک پست وبلاگی اعلام کرد که این حمله ۱۷۰۰۰ اقدام در شبکه Hugging Face انجام داده است.
پس از شناسایی نفوذ، Hugging Face سعی کرد از مدلهای آنتروپیک شامل Fable ۵ و مدل قبلی Opus برای تجزیه و تحلیل گزارشهای خود استفاده کند. اما از آنجا که گزارشها شامل عناصری از یک حمله سایبری بودند، هر دو مدل با استناد به موانع خود از انجام تجزیه و تحلیل خودداری کردند. در عوض، Hugging Face به یک مدل Openweight با محدودیت کمتر، GLM ۵.۲، از Z.AI مستقر در پکن روی آورد.
شرکت Hugging Face پس از تشریح حمله، توانست هوش مصنوعیهای هککننده را از کار بیندازد، رمزهای عبور خود را تنظیم مجدد کند و بخشهای آسیبدیده شبکه خود را بازسازی کند. این خبر را هفته گذشته و قبل از اطلاع از دخالت اوپنایآی اعلام کرد. ولف گفت هیچ دادهای از مشتریان فاش نشده است.
مشخص نبود که آیا مشکلات «ExploitGym» که مدل سعی در حل آنها داشت، از حملهای که برای دزدیدن پاسخها انجام داد، دشوارتر بودند یا خیر - یا اینکه آیا اصلا پاسخی پیدا کردند یا خیر. نکته طنزآمیز این است که مدلها با موفقیت یک حمله بیسابقه را برای جلوگیری از آزمون مهارت هک ترتیب دادند. ولف گفت: «این تقلب است. اما گاهی اوقات تقلب آسانتر است. تصمیم را برعهده شما میگذارم که آیا از آزمون حمله سایبری سربلند بیرون آمده است یا خیر.»