سلاح جدید انویدیا علیه ویدئوهای جعلی هوش مصنوعی: دقت ۹۲ درصدی در تشخیص محتوای ساختگی
ما در عصری زندگی میکنیم که هوش مصنوعی به طور فزایندهای بر اینترنت تسلط یافته و تشخیص محتوای واقعی از اخبار جعلی را دشوارتر کرده است. هر تصویر یا ویدیویی که امروز میبینید میتواند توسط هوش مصنوعی تولید شده باشد و نشانههای سنتی که میتوانستند آن را لو دهند، به سرعت در حال محو شدن هستند. ابزارهایی برای کمک به شناسایی محتوای تولید شده با هوش مصنوعی وجود دارد و انویدیا — که مسلماً ذینفع اصلی رقابت هوش مصنوعی است — به تازگی ابزار خود را با نام «ردیاب ویدیوی مصنوعی» (SVD) منتشر کرده است.
SVD یک میکروسرویس استنتاجی انویدیا (NIM) و بخشی از برنامه دسترسی خصوصی هوش مصنوعی برای رسانه این شرکت است، بنابراین به طور عمومی برای مصرفکنندگان در دسترس نیست، اما یک نسخه نمایشی از آن وجود دارد. به هر حال، وظیفه SVD ساده است: تشخیص اینکه آیا یک ویدیو واقعی است یا با استفاده از هوش مصنوعی تولید شده است. این ابزار میتواند ویدیوها را در مقیاس وسیع تجزیه و تحلیل کند و آنها را فریم به فریم برای شناسایی ناهنجاریها تفکیک کند. این سیستم بر اساس تحقیقات پیشرفتهای است که در کنفرانس بینایی کامپیوتر ICCV جوایزی را کسب کرده است.
به جای بررسی کل فایل ویدیویی، SVD آن را به فریمهای برشخورده تقسیم میکند که هر کدام دارای وضوح ۵۰۴x۵۰۴ هستند. این فریمها سپس از طریق دو ترانسفورمر بینایی قدرتمند ساخته شده توسط متا: DINOv2 و DINOv3 عبور داده میشوند. وظیفه یک ترانسفورمر بینایی این است که الگوها را بدون نیاز به دادههای برچسبگذاری شده توسط انسان یاد بگیرد. آنها معمولاً برای طبقهبندی تصویر، بازیابی تصویر، تشخیص شیء و تخمین عمق استفاده میشوند.
به این ترتیب، هنگامی که فریمها از این ترانسفورمرها عبور میکنند، ویژگیهای فضایی متمایز آنها به سرعت ارزیابی شده و به هر یک امتیازی بین ۰ و ۱ اختصاص داده میشود — ۰ نشاندهنده یک تصویر کاملاً واقعی و ۱ نشاندهنده یک تصویر کاملاً جعلی است. امتیازات در پایان جمعآوری میشوند تا یک میانگین تشکیل دهند که بر اساس یک امتیاز درصدی از ۱۰۰، به کاربر میگوید که آیا ویدیو واقعی است یا خیر.
به این ترتیب، خبرگزاریها، پخشکنندگان و رسانهها میتوانند فیلمهایی را که دریافت میکنند، بسیار سریعتر و با اطمینان بیشتری احراز هویت کنند. SVD حتی برای کار با واقعیت فشردهسازی رسانههای اجتماعی نیز طراحی شده است، زیرا ویدیوهای آپلود شده آنلاین نقصهایشان پنهن میشود. اما ترانسفورمرها همچنان میتوانند الگوهایی را که چشم انسان قادر به دیدن آنها نیست، تشخیص دهند و فراتر از ناهنجاریهای سطحی، بر روی مصنوعات ذاتی تمرکز کنند.
همانطور که در بنچمارک AI GVD بالا مشاهده میشود، ویدیوی فشردهنشده همچنان بهترین نتایج را با SVD ارائه میدهد که نرخ دقت فوقالعاده ۹۲ درصدی را نشان میدهد. با فشردهسازی ۱۵ درصدی، دقت مدل به ۸۷ درصد کاهش مییابد، در حالی که نرخ فشردهسازی ۵۰ درصدی همچنان به دقت بسیار چشمگیر ۸۲ درصدی در تشخیص محتوای تولید شده توسط هوش مصنوعی دست مییابد. از آنجایی که این یک میکروسرویس است، تأخیر استثنایی نیز دارد و ویدیوی 1080p را تنها در ۲۲ میلیثانیه روی پردازندههای گرافیکی Nvidia RTX و ۳۰ میلیثانیه روی مدلهای ورکاستیشن انویدیا پردازش میکند.
با این حال، SVD به رمزگذار NVENC نیاز دارد، بنابراین کارتهای دیتاسنتر مانند B100 نمیتوانند آن را به صورت بومی اجرا کنند. انویدیا اعلام کرده است که در حال همکاری با Wowza برای آوردن قابلیت تشخیص ویدیوی مصنوعی بلادرنگ به جریانهای کاری پخش زنده است. یک نسخه نمایشی برای امتحان در حال حاضر در build.nvidia.com در دسترس است، اما توجه داشته باشید که پردازش آن زمان زیادی میبرد زیرا در فضای ابری انجام میشود، حداکثر حجم فایل فقط ۱۰۰ مگابایت است و اغلب اوقات با خطای زمانبندی مواجه میشود.
- کولبات
- تیر 30, 1405
- 14 بازدید






