Rogue OpenAI models behind 'unprecedented cybersecurity incident' teamed up to break out of their testing environment — multiple agents left each other messages for months, communicating undetected | Tom's HardwareTom's Hardware

مدل‌های OpenAI برای فرار از محیط آزمایش و دسترسی به اینترنت همکاری کردند

بر اساس گزارش بلومبرگ، مدل‌های سرکش OpenAI که در یک «حادثه بی‌سابقه امنیت سایبری» از محیط آزمایشی خود خارج شدند، اخیراً ماه‌ها بدون اطلاع محققان در حال آزمایش، با یکدیگر ارتباط برقرار کرده‌اند. این شرکت می‌گوید که مدل‌ها قبل از تصمیم به خروج برای تقلب در وظیفه‌ای که به آن‌ها محول شده بود، برای یکدیگر یادداشت گذاشته‌اند.

مرکز داده مایکروسافت در مونت پلزنت، ویسکانسین

این افشاگری توسط اریک والاس و مایکل دالتون از OpenAI در کنفرانس امنیت سایبری Black Hat در لاس وگاس در روز چهارشنبه صورت گرفت. طبق این گزارش، چندین عامل داخلی و مدل‌های هوش مصنوعی «ماه‌ها برای یکدیگر یادداشت گذاشته و حول هدف دسترسی به اینترنت برای حل وظایف محول شده به آن‌ها، متحد شده بودند.» والاس گفت: «در مقطعی، عامل‌ها متوجه شدند که شاید بتوانیم برای یافتن پاسخ‌های آزمایشی که در حال ارزیابی آن هستم، زیرساخت‌های خارجی را مورد سوءاستفاده یا حمله قرار دهیم.»

در حالی که این حادثه تا اواسط جولای توسط OpenAI علنی نشد، این دو نفر گفتند که مدل‌های سرکش در ماه می شروع به همکاری کردند، که احتمالاً با یک سری اشتباهات و سهل‌انگاری‌های شرکت تقویت شده بود.

طبق این گزارش، OpenAI «متوجه نشد که یک مشکل به اصطلاح غیرممکن را برای حل به مدل داده است.» مثال ارائه شده ادعا می‌کند که از یک مدل خواسته شده بود تا مشکلی را در یک صفحه گسترده اکسل حاوی لینک‌های گوگل درایو حل کند، با وجود اینکه دسترسی به اینترنت نداشت. در مثالی دیگر، OpenAI ظاهراً «به طور تصادفی فراموش کرده بود» فایلی را در یکی از تکالیف قرار دهد.

عوامل هوش مصنوعی که گیج شده بودند، شروع به جستجو برای پاسخ‌های بهتر کردند و طبق گزارش‌ها، به ربات‌های همکار در محیط آزمایشی پیام دادند تا برای آپلود داوطلبانه فایل گمشده کمک بخواهند. والاس و دالتون گزارش دادند که این امر یک واکنش زنجیره‌ای از همکاری‌های شناسایی نشده را آغاز کرد، جایی که عوامل هوش مصنوعی شروع به درخواست کمک از یکدیگر برای وظایف سندباکس محول شده به آن‌ها کردند. در نهایت، به نظر می‌رسد ربات‌ها برای هک کردن سیستم‌های داخلی OpenAI به منظور دسترسی به اینترنت و حل مشکلات، با یکدیگر همکاری کرده‌اند.

نتیجه، نقض امنیتی مذکور بود که طی آن سرورهای تولیدی HuggingFace با استفاده از هزاران اقدام فردی در مجموعه‌ای از سندباکس‌های کوتاه‌مدت هک شدند.

این حوادث نگرانی فزاینده‌ای را در تقاطع هوش مصنوعی و امنیت سایبری برجسته می‌کنند. در حالی که ابزارهای کدنویسی پیچیده و مفید می‌توانند به شرکت‌ها در شناسایی و رفع آسیب‌پذیری‌های امنیتی کمک کنند، این نگرانی فزاینده وجود دارد که این ابزارها می‌توانند برای اهداف مخرب، از جمله انتشار هک‌ها و سایر شیطنت‌های آنلاین، مورد استفاده قرار گیرند.

رویدادهای اخیر و برجسته‌ای مانند این، لایه دیگری از مشکل را برجسته می‌کنند، یعنی اینکه مدل‌های هوش مصنوعی سرکش گاهی اوقات می‌توانند اقدامات هکری نگران‌کننده‌ای انجام دهند – مانند خروج از محیط آزمایشی – بدون هیچ گونه تعامل انسانی یا با وجود تدابیر حفاظتی.

همین هفته، OpenAI دو حادثه دیگر را که شامل مدل‌های خود و اشخاص ثالث بود، تشریح کرد. در یک مورد، موسسه امنیت هوش مصنوعی دولت بریتانیا آزمایشی را انجام داد که طی آن به عامل‌ها عمداً دسترسی به اینترنت داده شد، که منجر به «رفتار غیرمجاز عامل» از جمله انتقال داده‌های غیرعادی و «فعالیت پایدار و بالقوه مضر علیه افراد و سازمان‌های واقعی» شد.

در حادثه دوم، OpenAI می‌گوید یکی از شرکای آزمایش امنیت سایبری آن «در حال اجرای ارزیابی‌های به سبک Capture-the-Flag بود که قرار بود از اینترنت جدا باشند، اما یک پیکربندی اشتباه در محیط آزمایش به مدل‌ها اجازه دسترسی به اینترنت عمومی را داد.»

OpenAI می‌گوید که «متعهد به همکاری در سراسر صنعت برای تقویت شیوه‌های مشترک برای انجام ایمن ارزیابی‌های پرخطر است.»

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

جستجو در سایت

سبد خرید

درحال بارگذاری ...
بستن
مقایسه
مقایسه محصولات
لیست مقایسه محصولات شما خالی می باشد!