با یک پیراهن سبز، هوش مصنوعی را فریب دهید: محققان با بهره‌برداری ‘CoT Forgery’ چت‌بات‌ها را وادار به افشای اطلاعات ممنوعه می‌کنند.

محققان هوش مصنوعی با بهره‌برداری جدیدی به نام “CoT Forgery” نشان داده‌اند که می‌توان چت‌بات‌های مبتنی بر مدل‌های زبان بزرگ (LLM) را فریب داد تا اطلاعات ممنوعه را فاش کنند. این روش با تزریق استدلال‌های ساختگی و حتی پوچ (مانند ادعای پوشیدن پیراهن سبز)، مدل را وادار می‌کند تا این استدلال‌ها را به عنوان نتیجه‌گیری‌های خود بپذیرد. این ترفند موفقیت جیلبریک را از نزدیک به صفر به حدود ۶۰ درصد در تمام مدل‌های آزمایش‌شده افزایش داده و برنده مسابقات امنیتی نیز شده است.

این تحقیق توضیح می‌دهد که LLMها به جای برچسب‌های نقش، به سبک نوشتاری برای تشخیص هویت گوینده تکیه می‌کنند. این سردرگمی نقش، زیربنای موفقیت تزریق پرامپت به طور کلی است و مایکروسافت نیز خطرات مشابهی را تأیید کرده است. نویسندگان هشدار می‌دهند که بدون درک واقعی نقش‌ها، دفاع در برابر این نوع حملات یک چالش دائمی خواهد بود و می‌تواند عامل‌های هوش مصنوعی را به سمت اقدامات ناخواسته سوق دهد.

جستجو در سایت

سبد خرید

درحال بارگذاری ...
بستن
مقایسه
مقایسه محصولات
لیست مقایسه محصولات شما خالی می باشد!