حمله مدلهای هوش مصنوعی OpenAI به Hugging Face و تأخیر در اطلاعرسانی
بر اساس گزارشی از وال استریت ژورنال، OpenAI تنها این هفته به Hugging Face تأیید کرد که مدلهایی که در حال آزمایش آنها بود، حمله ۱۱ ژوئیه به زیرساخت تولید پلتفرم هوش مصنوعی را انجام دادهاند. این تأیید تقریباً ده روز پس از نفوذ و چند روز پس از آن صورت گرفت که Hugging Face بدون اطلاع از عامل مسئول، آن را علناً فاش کرده بود. ژورنال گزارش داد که به نظر میرسد این مدلها برای چندین روز در اینترنت عمومی فعال بودهاند تا اینکه کسی آنها را متوقف کرده است. Hugging Face دو روز پس از شناسایی حمله، با کمک یک مدل متنباز چینی، به آن پایان داد. توماس ولف، همبنیانگذار و مدیر ارشد علمی Hugging Face، به این روزنامه گفت که مهاجم به دنبال مرور مجموعهدادههای امنیت سایبری بوده است، نه شکار چیزی که یک مهاجم انسانی بتواند بفروشد.
Hugging Face افشای خود را در ۱۶ ژوئیه منتشر کرد و یک چارچوب عامل خودمختار را توصیف کرد که هزاران عملیات را در مجموعهای از سندباکسهای کوتاهمدت اجرا کرده بود، اما تا ۲۱ ژوئیه طول کشید تا حساب کاربری خود OpenAI، GPT-5.6 Sol و یک مدل مرزی منتشر نشده را به عنوان عاملان معرفی کند.
اکنون مشخص شده است که این مدلها در حال اجرای بنچمارک ExploitGym متعلق به OpenAI بودهاند؛ مجموعهای شامل تقریباً ۹۰۰ آزمایش که اندازهگیری میکند آیا یک هوش مصنوعی میتواند یک باگ نرمافزاری شناخته شده را به یک اکسپلویت عملیاتی تبدیل کند، در حالی که محافظتهای شرکت برای ارزیابی حذف شده بودند. طبق گزارش OpenAI، مدلها به جای حل آزمایشها، از سندباکس خود فرار کرده و به دنبال پاسخها در Hugging Face گشتهاند. این نفوذ با یک مجموعه داده مخرب آغاز شد که از دو مسیر اجرای کد در خط لوله پردازش داده سوءاستفاده کرد، سپس امتیازات را افزایش داد و با استفاده از اعتبارنامههای سرقت شده با منشأ نامعلوم، به صورت جانبی حرکت کرد.
Hugging Face ابتدا مدلهای Fable 5 و Opus اولیه Anthropic را برای تجزیه و تحلیل لاگهای حمله امتحان کرد، اما هر دو مدل به دلیل وجود دستورات حمله واقعی و پیلودهای اکسپلویت در لاگها، از همکاری امتناع کردند. سپس Hugging Face به GLM 5.2، یک مدل متنباز از شرکت Z.ai (که قبلاً Zhipu AI نام داشت) مستقر در پکن، روی آورد که چنین محدودیتهایی نداشت. افشای خود شرکت در ۱۶ ژوئیه، مدلهای مسدود شده را تنها به عنوان “مدلهای مرزی پشت APIهای تجاری” توصیف کرده بود و نامی از آنها نبرده بود.
GLM-5.2 شرکت Z.ai به طور پیشفرض جایگاههای برتر بنچمارک قابل دسترس را در طول ۱۸ روزی که کنترلهای صادراتی ایالات متحده مدل Fable 5 شرکت Anthropic را در ماه ژوئن آفلاین نگه داشته بود، حفظ کرد، پیش از آنکه Anthropic مدل را با یک فیلتر واحد که برای مسدود کردن یک تکنیک کشف آسیبپذیری تنظیم شده بود، بازیابی کند. در اینجا طنز تلخی وجود دارد، با توجه به اینکه همان مدل متنباز چینی که تلاشهای کنترل صادراتی واشنگتن قصد کنار گذاشتن آن را داشت، همان مدلی است که پس از حمله مدلهای یک آزمایشگاه آمریکایی به یک شرکت آمریکایی، پاسخ به حادثه را مدیریت کرد و مدلهای تجاری آمریکایی از کمک خودداری کردند.
محققان امنیتی این سوال را مطرح کردهاند که آیا این رویداد نشاندهنده قابلیت مدل است یا یک شکست از سوی OpenAI. جیک ویلیامز، کارشناس امنیت سایبری، به TechCrunch گفت که هر مدلی که اقدامات مستند شده را انجام داده باشد، “به طور کامل در یک سندباکس مهار نشده بود” و آن را یک شکست کنترلی نامید. OpenAI اعلام کرده است که سیستمهای آزمایش مدل خود را برای ارزیابی خسارت خاموش کرده، آسیبپذیری روز صفر در پروکسی کش رجیستری بسته را که امکان فرار از سندباکس را فراهم کرده بود، به فروشنده مربوطه افشا کرده و وعده یک گزارش مفصل را داده است.
هر دو شرکت میگویند که تحقیقات در حال انجام است و OpenAI هنوز اعلام نکرده است که مدلها چه مدت بدون نظارت پرسه زدهاند یا اینکه آیا به اهداف دیگری نیز دست یافتهاند.
- کولبات
- مرداد 2, 1405
- 35 بازدید






