اوپنایآی کمپین مونشات ایآی برای استخراج استدلال پنهان مدلها را خنثی کرد
اوپنایآی در پست وبلاگ شرکت خود اعلام کرد که افراد مرتبط با شرکت چینی مونشات ایآی در مرکز تلاشی برای استخراج استدلال پنهان از مدلهایش بودهاند. این پست میگوید که یک «کمپین هماهنگ» برای استخراج «استدلال محافظتشده» از مدلهایش، که «سازگار با تقطیر خصمانه» بود، در ماه جولای رخ داده است. اوپنایآی مطمئن نیست که آیا همه اپراتورهایی که مشاهده کرده، یک عامل واحد بودهاند یا خیر.
این فعالیت از اول جولای «در ابتدا با حجم کم» آغاز شد. پس از آن، در روزهای ۲۴ و ۲۵ جولای «افزایشهای پرحجم» رخ داد که شامل ۱۶,۰۰۰ درخواست با استفاده از الگوی استخراج بود. این درخواستها از بیش از ۴,۰۰۰ کاربر ارسال شده بودند. این فعالیت تلاش برای استخراج بود اما «لزوماً موفقیتآمیز نبود» و کمپین «تا ۲۸ جولای به طور کامل مختل شد». این پست هیچ معیاری از نرخ موفقیت، مدلهای خاصی که هدف قرار گرفته بودند، یا تعداد کاربرانی که به مونشات مرتبط بودند، روشن نکرد.
اوپنایآی استدلال محافظتشده را «رکورد داخلی مدل برای انجام یک کار» و تقطیر خصمانه را «استفاده سیستماتیک و غیرمجاز از خروجیها یا استدلال یک مدل» برای آموزش یا بهبود مدل دیگر تعریف میکند. این دادهها برای پنهان کردن زنجیره فکری مدل رمزگذاری شده و به عنوان یک بلوک رمزگذاریشده به مشتری تحویل داده میشود. مشتری آن بلوک را با هر درخواست بازمیگرداند تا ارائهدهنده نیازی به ذخیره آن نداشته باشد. یکی از روشهایی که اپراتورها امتحان کردند، گرفتن استدلال رمزگذاریشده از یک مکالمه و درخواست از مدلی دیگر برای رمزگشایی آن بود.
اوپنایآی میگوید که در این مورد، رمزگذاری شکسته نشده است. دسترسی مستقیمی به مکالمات ذخیرهشده کاربران وجود نداشت و هیچ پایگاه دادهای به خطر نیفتاد. یک اصلاحیه، مسیری را بست که به کسی که قبلاً استدلال رمزگذاریشده کاربر دیگری را داشت، اجازه میداد آن را بازپخش کرده و محتوایش را بازیابی کند. به طور جداگانه، بررسیهایی را برای شناسایی و نگهداری خروجیهای جریانی که ممکن است استدلال را فاش کنند، اضافه کرد. همچنین حفاظتها را برای استدلال پنهان در میان کاربران، فضاهای کاری، سازمانها و خانوادههای مدل تقویت کرد و با ارائهدهندگان شخص ثالث همکاری کرد تا حسابهایی را که فعالیتشان از طریق خدمات آنها انجام میشد، مختل کند.
محققان مستقل امنیتی نیز از طریق افشای مسئولانه، «آسیبپذیریهای مرتبط با مدلهای متقابل و فشردهسازی مکالمات» را به اوپنایآی گزارش داده بودند و شرکت تأیید کرد که مسیرهای حملهای که آنها پیدا کرده بودند، واقعی هستند. مقاله «سرقت ردیابیهای استدلال از APIهای LLM اختصاصی»، با تاریخ ۱۰ اوت، به صراحت در این پست لینک شده است. محققان با آزمایش اوپنایآی، آنتروپیک و گوگل، استدلال رمزگذاریشده یک مدل پیشرفته را به یک مدل ضعیفتر مربوطه تغذیه کردند که سپس آن را به صورت متن ساده نوشت. محققان آزمایش خود را در اوایل جولای انجام دادند و پس از تأیید گزارش آنها توسط ارائهدهندگان، «قادر به انجام همان حملات نبودند».
اوپنایآی تنها شرکتی نیست که با چنین تهدیداتی روبرو است. اوایل این ماه، گزارش آنتروپیک با عنوان «شناسایی و مقابله با سوءاستفاده از هوش مصنوعی: سپتامبر ۲۰۲۶» یک دوره ده روزه را شرح داد که در آن مونشات تقریباً ۳۰۰,۰۰۰ درخواست مشتری را با استفاده از یک شبکه پروکسی متشکل از ۵,۳۸۰ حساب جعلی به آنتروپیک ارسال کرده بود. این گزارش همچنین میگوید که مونشات امضاهای استدلال کلود را ذخیره کرده و در جلسات جدید، کلود را وادار کرده تا آنها را به ردیابیهای کامل استدلال تبدیل کند، که آنتروپیک آن را «حملات بازپخش بینجلسهای» مینامد. در ماه جولای، مونشات انکار کرد که Kimi K3 از طریق تقطیر ایجاد شده است، و در آن زمان گرگ براکمن، رئیس اوپنایآی، گفت که «خیلی زود است» که بتوان گفت آیا مونشات مدلهای اوپنایآی را تقطیر کرده است یا خیر.
در همین حال، گام بعدی اوپنایآی این است که اطمینان حاصل کند استقرارهای میزبانیشده توسط شرکا، همان حفاظتهای ابزارهای شخص اول را دارند. بررسیهای اضافی برای جلوگیری از حملات خروجی ابزارها مورد نیاز است. این شرکت یافتههای خود را با انجمن مدلهای پیشرفته و کانالهای اشتراکگذاری اطلاعات دولتی به اشتراک گذاشت و خاطرنشان کرد که «سیستمهایی که از مصنوعات استدلالی قابل حمل یا قابل بازپخش پشتیبانی میکنند، ممکن است با خطرات مرتبط روبرو شوند.» این شرکت انتظار دارد تلاشهای تقطیر با بهبود مدلهای پیشرفته و با جستجوی مهاجمان برای راههای ارزانتر برای تقلید از آنها، پیچیدهتر شوند. کار برای محافظت در برابر این تلاشها ادامه دارد.
- کولبات
- مهر 9, 1405
- 12 بازدید






