AI researchers trick chatbots into sharing how to make cocaine as long as they believe a user is wearing a green shirt — 'CoT Forgery' exploit spurs LLMs to divulge forbidden info by faking trusted chains of thought | Tom's HardwareTom's Hardware

با یک پیراهن سبز، هوش مصنوعی را فریب دهید: محققان با بهره‌برداری ‘CoT Forgery’ چت‌بات‌ها را وادار به افشای اطلاعات ممنوعه می‌کنند.

مدل‌های هوش مصنوعی روش سنتز کوکائین را توضیح خواهند داد، اگر درخواست در یک استدلال جعلی پیچیده شود که ادعا می‌کند رعایت آن مشکلی ندارد زیرا کاربر پیراهن سبز پوشیده است. این یافته‌ها بر اساس مقاله‌ای جدید است که موفقیت تزریق پرامپت، نقص امنیتی حل‌نشده در هر چت‌بات و عامل هوش مصنوعی، را به نحوه خواندن متن توسط LLMها مرتبط می‌داند. این مقاله بیان می‌کند که مدل‌ها هویت گوینده را از سبک نوشتاری تشخیص می‌دهند، نه از برچسب‌های نقش که برای جداسازی دستورات قابل اعتماد از داده‌های غیرقابل اعتماد در نظر گرفته شده‌اند.

این تحقیق با عنوان «تزریق پرامپت به عنوان سردرگمی نقش» توسط محققان مستقل چارلز یی، یاسمین کوی و پروفسور همکار MIT، دیلن هادفیلد-منل، قرار است در کنفرانس ICML 2026 در سئول در تاریخ ۶ جولای ارائه شود و یک گزارش مفصل‌تر توسط نویسندگان پیش از این رویداد منتشر شده است.

ترفند کوکائین، که نویسندگان آن را CoT Forgery می‌نامند، موفقیت جیلبریک را از نزدیک به صفر به حدود ۶۰ درصد در تمام مدل‌های آزمایش‌شده رساند و برنده مسابقه رد-تیمینگ OpenAI GPT-OSS-20B در سال ۲۰۲۵ در کگل شد.

نمونه‌ای از CoT Forgery.

همانطور که محققان توضیح می‌دهند، مدل‌ها یک مکالمه را به عنوان یک رشته متنی پیوسته دریافت می‌کنند که توسط برچسب‌هایی مانند user، tool و think تقسیم‌بندی شده‌اند و قرار است منبع و اعتبار هر بخش را مشخص کنند. محققان «کاوشگرهای نقش» (role probes) ساختند که میزان قوی بودن رفتار داخلی یک مدل با هر توکن را به عنوان استدلال خود یا یک دستور کاربر امتیازدهی می‌کنند.

این امتیازات پیش‌بینی می‌کردند که آیا یک حمله موفق خواهد شد یا خیر، حتی قبل از اینکه مدل یک توکن واحد تولید کند. آنها نشان دادند که مدل‌ها برای تعیین نوع محتوای موجود در یک بخش خاص، به سبک نوشتاری تکیه می‌کنند. متنی که صرفاً برای یک مدل شبیه استدلال به نظر می‌رسد، حتی زمانی که برچسب‌های اطراف آن خلاف این را می‌گویند، به عنوان استدلال ثبت می‌شود.

CoT Forgery استدلال‌های ساختگی را به یک پرامپت تزریق می‌کند تا مدل آن را به عنوان نتیجه‌گیری از پیش رسیده خود تلقی کرده و بر اساس آن عمل کند، و بدین ترتیب اعتمادی را که مدل به تفکر خود دارد، به ارث می‌برد. این منطق می‌تواند به وضوح پوچ باشد، مانند پیراهن سبز، زیرا مدل آن را به عنوان یک ادعای خارجی بررسی نمی‌کند. علاوه بر این، برخلاف جیلبریک‌های مبتنی بر اقناع، این حمله با شدیدتر شدن درخواست‌ها تضعیف نشد.

حذف نشانگرهای سبکی که باعث می‌شوند متن تزریق‌شده شبیه استدلال مدل به نظر برسد، در حالی که معنای آن برای انسان بدون تغییر باقی می‌ماند، میانگین موفقیت حمله را از ۶۱% به ۱۰% کاهش داد. جایگزینی یک عبارت واحد، «کاربر» (The user) با «درخواست» (The request)، موفقیت را ۱۹% کاهش داد. نویسندگان در گزارش خود اشاره می‌کنند: «برچسب‌های نقش یک ترفند قالب‌بندی بودند که به معماری امنیتی و داربست شناختی LLMهای مدرن تبدیل شدند»، و بار فزاینده بر این ساختار برای مدیریت رفتار LLMها ظاهراً آسیب‌پذیری‌های خاص خود را ایجاد کرده است.

برای تعیین اینکه آیا سردرگمی در مورد نقش‌ها مختص حمله آنها بود یا یک اصل کلی‌تر که توضیح می‌دهد چرا تزریق پرامپت کار می‌کند، محققان رویکرد متفاوتی را در پیش گرفتند. آنها یک دستور را در یک صفحه وب پنهان کردند که به مدل می‌گفت یک فایل محرمانه را آپلود کند، سپس «User:» را به آن اضافه کردند تا دستور خطرناک به نظر برسد که از نقش قابل اعتماد کاربر آمده است. این بهره‌برداری موفقیت‌آمیز بود و نشان می‌دهد که سردرگمی نقش به طور کلی زیربنای موفقیت تزریق پرامپت است.

مایکروسافت اخیراً همین خطر عامل‌محور را تأیید کرده است و هشدار داده که محتوای جاسازی شده در اسناد یا عناصر رابط کاربری می‌تواند دستورالعمل‌های یک عامل را نادیده بگیرد.

نویسندگان همچنین یک خطر ظریف‌تر را برای عامل‌هایی که وب‌گردی و خرید می‌کنند، برجسته کردند. از آنجا که درک نقش یک مسئله درجه‌ای است، لحن یک صفحه وب بازیابی شده می‌تواند از مرز برچسب عبور کرده و به وضعیت داخلی مدل نفوذ کند، و هزاران تغییر صفحه را می‌توان با هزینه کم آزمایش کرد تا مشخص شود کدام یک یک عامل را به سمت خرید سوق می‌دهد، به صورت قانونی و در مقیاس وسیع.

نویسندگان نتیجه گرفتند که بدون درک واقعی نقش، دفاع در برابر تزریق پرامپت یک بازی بی‌پایان «بزن در رو» (whack-a-mole) باقی خواهد ماند.

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

جستجو در سایت

سبد خرید

درحال بارگذاری ...
بستن
مقایسه
مقایسه محصولات
لیست مقایسه محصولات شما خالی می باشد!