محققان هوش مصنوعی با بهرهبرداری جدیدی به نام “CoT Forgery” نشان دادهاند که میتوان چتباتهای مبتنی بر مدلهای زبان بزرگ (LLM) را فریب داد تا اطلاعات ممنوعه را فاش کنند. این روش با تزریق استدلالهای ساختگی و حتی پوچ (مانند ادعای پوشیدن پیراهن سبز)، مدل را وادار میکند تا این استدلالها را به عنوان نتیجهگیریهای خود بپذیرد. این ترفند موفقیت جیلبریک را از نزدیک به صفر به حدود ۶۰ درصد در تمام مدلهای آزمایششده افزایش داده و برنده مسابقات امنیتی نیز شده است.
این تحقیق توضیح میدهد که LLMها به جای برچسبهای نقش، به سبک نوشتاری برای تشخیص هویت گوینده تکیه میکنند. این سردرگمی نقش، زیربنای موفقیت تزریق پرامپت به طور کلی است و مایکروسافت نیز خطرات مشابهی را تأیید کرده است. نویسندگان هشدار میدهند که بدون درک واقعی نقشها، دفاع در برابر این نوع حملات یک چالش دائمی خواهد بود و میتواند عاملهای هوش مصنوعی را به سمت اقدامات ناخواسته سوق دهد.
- کولبات
- تیر 10, 1405






