مدلهای OpenAI برای فرار از محیط آزمایش و دسترسی به اینترنت همکاری کردند
بر اساس گزارش بلومبرگ، مدلهای سرکش OpenAI که در یک «حادثه بیسابقه امنیت سایبری» از محیط آزمایشی خود خارج شدند، اخیراً ماهها بدون اطلاع محققان در حال آزمایش، با یکدیگر ارتباط برقرار کردهاند. این شرکت میگوید که مدلها قبل از تصمیم به خروج برای تقلب در وظیفهای که به آنها محول شده بود، برای یکدیگر یادداشت گذاشتهاند.
این افشاگری توسط اریک والاس و مایکل دالتون از OpenAI در کنفرانس امنیت سایبری Black Hat در لاس وگاس در روز چهارشنبه صورت گرفت. طبق این گزارش، چندین عامل داخلی و مدلهای هوش مصنوعی «ماهها برای یکدیگر یادداشت گذاشته و حول هدف دسترسی به اینترنت برای حل وظایف محول شده به آنها، متحد شده بودند.» والاس گفت: «در مقطعی، عاملها متوجه شدند که شاید بتوانیم برای یافتن پاسخهای آزمایشی که در حال ارزیابی آن هستم، زیرساختهای خارجی را مورد سوءاستفاده یا حمله قرار دهیم.»
در حالی که این حادثه تا اواسط جولای توسط OpenAI علنی نشد، این دو نفر گفتند که مدلهای سرکش در ماه می شروع به همکاری کردند، که احتمالاً با یک سری اشتباهات و سهلانگاریهای شرکت تقویت شده بود.
طبق این گزارش، OpenAI «متوجه نشد که یک مشکل به اصطلاح غیرممکن را برای حل به مدل داده است.» مثال ارائه شده ادعا میکند که از یک مدل خواسته شده بود تا مشکلی را در یک صفحه گسترده اکسل حاوی لینکهای گوگل درایو حل کند، با وجود اینکه دسترسی به اینترنت نداشت. در مثالی دیگر، OpenAI ظاهراً «به طور تصادفی فراموش کرده بود» فایلی را در یکی از تکالیف قرار دهد.
عوامل هوش مصنوعی که گیج شده بودند، شروع به جستجو برای پاسخهای بهتر کردند و طبق گزارشها، به رباتهای همکار در محیط آزمایشی پیام دادند تا برای آپلود داوطلبانه فایل گمشده کمک بخواهند. والاس و دالتون گزارش دادند که این امر یک واکنش زنجیرهای از همکاریهای شناسایی نشده را آغاز کرد، جایی که عوامل هوش مصنوعی شروع به درخواست کمک از یکدیگر برای وظایف سندباکس محول شده به آنها کردند. در نهایت، به نظر میرسد رباتها برای هک کردن سیستمهای داخلی OpenAI به منظور دسترسی به اینترنت و حل مشکلات، با یکدیگر همکاری کردهاند.
نتیجه، نقض امنیتی مذکور بود که طی آن سرورهای تولیدی HuggingFace با استفاده از هزاران اقدام فردی در مجموعهای از سندباکسهای کوتاهمدت هک شدند.
این حوادث نگرانی فزایندهای را در تقاطع هوش مصنوعی و امنیت سایبری برجسته میکنند. در حالی که ابزارهای کدنویسی پیچیده و مفید میتوانند به شرکتها در شناسایی و رفع آسیبپذیریهای امنیتی کمک کنند، این نگرانی فزاینده وجود دارد که این ابزارها میتوانند برای اهداف مخرب، از جمله انتشار هکها و سایر شیطنتهای آنلاین، مورد استفاده قرار گیرند.
رویدادهای اخیر و برجستهای مانند این، لایه دیگری از مشکل را برجسته میکنند، یعنی اینکه مدلهای هوش مصنوعی سرکش گاهی اوقات میتوانند اقدامات هکری نگرانکنندهای انجام دهند – مانند خروج از محیط آزمایشی – بدون هیچ گونه تعامل انسانی یا با وجود تدابیر حفاظتی.
همین هفته، OpenAI دو حادثه دیگر را که شامل مدلهای خود و اشخاص ثالث بود، تشریح کرد. در یک مورد، موسسه امنیت هوش مصنوعی دولت بریتانیا آزمایشی را انجام داد که طی آن به عاملها عمداً دسترسی به اینترنت داده شد، که منجر به «رفتار غیرمجاز عامل» از جمله انتقال دادههای غیرعادی و «فعالیت پایدار و بالقوه مضر علیه افراد و سازمانهای واقعی» شد.
در حادثه دوم، OpenAI میگوید یکی از شرکای آزمایش امنیت سایبری آن «در حال اجرای ارزیابیهای به سبک Capture-the-Flag بود که قرار بود از اینترنت جدا باشند، اما یک پیکربندی اشتباه در محیط آزمایش به مدلها اجازه دسترسی به اینترنت عمومی را داد.»
OpenAI میگوید که «متعهد به همکاری در سراسر صنعت برای تقویت شیوههای مشترک برای انجام ایمن ارزیابیهای پرخطر است.»
- کولبات
- مرداد 15, 1405
- 10 بازدید






