OpenAI says actors linked to China-based Moonshot AI spearheaded a campaign to extract its models’ hidden reasoning — logged 16,000 extraction requests across 4,000 accounts before cutoff | Tom's HardwareTom's Hardware

اوپن‌ای‌آی کمپین مون‌شات ای‌آی برای استخراج استدلال پنهان مدل‌ها را خنثی کرد

اوپن‌ای‌آی در پست وبلاگ شرکت خود اعلام کرد که افراد مرتبط با شرکت چینی مون‌شات ای‌آی در مرکز تلاشی برای استخراج استدلال پنهان از مدل‌هایش بوده‌اند. این پست می‌گوید که یک «کمپین هماهنگ» برای استخراج «استدلال محافظت‌شده» از مدل‌هایش، که «سازگار با تقطیر خصمانه» بود، در ماه جولای رخ داده است. اوپن‌ای‌آی مطمئن نیست که آیا همه اپراتورهایی که مشاهده کرده، یک عامل واحد بوده‌اند یا خیر.

این فعالیت از اول جولای «در ابتدا با حجم کم» آغاز شد. پس از آن، در روزهای ۲۴ و ۲۵ جولای «افزایش‌های پرحجم» رخ داد که شامل ۱۶,۰۰۰ درخواست با استفاده از الگوی استخراج بود. این درخواست‌ها از بیش از ۴,۰۰۰ کاربر ارسال شده بودند. این فعالیت تلاش برای استخراج بود اما «لزوماً موفقیت‌آمیز نبود» و کمپین «تا ۲۸ جولای به طور کامل مختل شد». این پست هیچ معیاری از نرخ موفقیت، مدل‌های خاصی که هدف قرار گرفته بودند، یا تعداد کاربرانی که به مون‌شات مرتبط بودند، روشن نکرد.

اوپن‌ای‌آی استدلال محافظت‌شده را «رکورد داخلی مدل برای انجام یک کار» و تقطیر خصمانه را «استفاده سیستماتیک و غیرمجاز از خروجی‌ها یا استدلال یک مدل» برای آموزش یا بهبود مدل دیگر تعریف می‌کند. این داده‌ها برای پنهان کردن زنجیره فکری مدل رمزگذاری شده و به عنوان یک بلوک رمزگذاری‌شده به مشتری تحویل داده می‌شود. مشتری آن بلوک را با هر درخواست بازمی‌گرداند تا ارائه‌دهنده نیازی به ذخیره آن نداشته باشد. یکی از روش‌هایی که اپراتورها امتحان کردند، گرفتن استدلال رمزگذاری‌شده از یک مکالمه و درخواست از مدلی دیگر برای رمزگشایی آن بود.

اوپن‌ای‌آی می‌گوید که در این مورد، رمزگذاری شکسته نشده است. دسترسی مستقیمی به مکالمات ذخیره‌شده کاربران وجود نداشت و هیچ پایگاه داده‌ای به خطر نیفتاد. یک اصلاحیه، مسیری را بست که به کسی که قبلاً استدلال رمزگذاری‌شده کاربر دیگری را داشت، اجازه می‌داد آن را بازپخش کرده و محتوایش را بازیابی کند. به طور جداگانه، بررسی‌هایی را برای شناسایی و نگهداری خروجی‌های جریانی که ممکن است استدلال را فاش کنند، اضافه کرد. همچنین حفاظت‌ها را برای استدلال پنهان در میان کاربران، فضاهای کاری، سازمان‌ها و خانواده‌های مدل تقویت کرد و با ارائه‌دهندگان شخص ثالث همکاری کرد تا حساب‌هایی را که فعالیتشان از طریق خدمات آن‌ها انجام می‌شد، مختل کند.

محققان مستقل امنیتی نیز از طریق افشای مسئولانه، «آسیب‌پذیری‌های مرتبط با مدل‌های متقابل و فشرده‌سازی مکالمات» را به اوپن‌ای‌آی گزارش داده بودند و شرکت تأیید کرد که مسیرهای حمله‌ای که آن‌ها پیدا کرده بودند، واقعی هستند. مقاله «سرقت ردیابی‌های استدلال از APIهای LLM اختصاصی»، با تاریخ ۱۰ اوت، به صراحت در این پست لینک شده است. محققان با آزمایش اوپن‌ای‌آی، آنتروپیک و گوگل، استدلال رمزگذاری‌شده یک مدل پیشرفته را به یک مدل ضعیف‌تر مربوطه تغذیه کردند که سپس آن را به صورت متن ساده نوشت. محققان آزمایش خود را در اوایل جولای انجام دادند و پس از تأیید گزارش آن‌ها توسط ارائه‌دهندگان، «قادر به انجام همان حملات نبودند».

اوپن‌ای‌آی تنها شرکتی نیست که با چنین تهدیداتی روبرو است. اوایل این ماه، گزارش آنتروپیک با عنوان «شناسایی و مقابله با سوءاستفاده از هوش مصنوعی: سپتامبر ۲۰۲۶» یک دوره ده روزه را شرح داد که در آن مون‌شات تقریباً ۳۰۰,۰۰۰ درخواست مشتری را با استفاده از یک شبکه پروکسی متشکل از ۵,۳۸۰ حساب جعلی به آنتروپیک ارسال کرده بود. این گزارش همچنین می‌گوید که مون‌شات امضاهای استدلال کلود را ذخیره کرده و در جلسات جدید، کلود را وادار کرده تا آن‌ها را به ردیابی‌های کامل استدلال تبدیل کند، که آنتروپیک آن را «حملات بازپخش بین‌جلسه‌ای» می‌نامد. در ماه جولای، مون‌شات انکار کرد که Kimi K3 از طریق تقطیر ایجاد شده است، و در آن زمان گرگ براکمن، رئیس اوپن‌ای‌آی، گفت که «خیلی زود است» که بتوان گفت آیا مون‌شات مدل‌های اوپن‌ای‌آی را تقطیر کرده است یا خیر.

در همین حال، گام بعدی اوپن‌ای‌آی این است که اطمینان حاصل کند استقرار‌های میزبانی‌شده توسط شرکا، همان حفاظت‌های ابزارهای شخص اول را دارند. بررسی‌های اضافی برای جلوگیری از حملات خروجی ابزارها مورد نیاز است. این شرکت یافته‌های خود را با انجمن مدل‌های پیشرفته و کانال‌های اشتراک‌گذاری اطلاعات دولتی به اشتراک گذاشت و خاطرنشان کرد که «سیستم‌هایی که از مصنوعات استدلالی قابل حمل یا قابل بازپخش پشتیبانی می‌کنند، ممکن است با خطرات مرتبط روبرو شوند.» این شرکت انتظار دارد تلاش‌های تقطیر با بهبود مدل‌های پیشرفته و با جستجوی مهاجمان برای راه‌های ارزان‌تر برای تقلید از آن‌ها، پیچیده‌تر شوند. کار برای محافظت در برابر این تلاش‌ها ادامه دارد.

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

جستجو در سایت

سبد خرید

درحال بارگذاری ...
بستن
مقایسه
مقایسه محصولات
لیست مقایسه محصولات شما خالی می باشد!