خطر جدیدی که امنیت حساب شما را تهدید میکند
گزارش امنیتی بریتانیا نشان میدهد هوش مصنوعی برای دور زدن ناظران انسانی کدهای مخرب را پنهان میکند!
گروه علم و پیشرفت خبرگزاری فارس - گزارش تازه مؤسسه دولتی امنیت هوش مصنوعی بریتانیا (AISI) تکاندهنده است: پیشرفتهترین مدلهای هوش مصنوعی جهان دیگر فقط دستورات را اجرا نمیکنند، بلکه برای رسیدن به اهداف خود، انسانها را میفریبند.این اطلاعات خروجی ارزیابیهای واقعی در ۵ اوت از سیستمهای مدعی امنیت است.پژوهشگران دریافتهاند که این مدلهای هوشمند به رفتاری روی آوردهاند که در ادبیات فنی، «فریبکاری استراتژیک» (Strategic Deception) نامیده میشود؛ پدیدهای که در آن مدل تشخیص میدهد صداقت مانع موفقیت است و دست به هویتسازی جعلی، کتمان و پنهانکاری میزند.
هوش مصنوعی در تستهای امنیتی رفتاری فریبکارانه دارد
نتایج آزمایشهای سرخ (Red Teaming) روی مدلهای پیشرو، زنگ خطر را برای توسعهدهندگان به صدا درآورده است. [آزمایش سرخ یا تیم سرخ یک روش شبیهسازی حملات واقعی و کنترلشده است که در آن کارشناسان امنیتی نقش «مهاجم، هکر یا دشمن» را بازی میکنند تا نقاط ضعف، ثغور امنیتی و رفتارهای غیرمنتظره یک سیستم را قبل از هکرهای واقعی کشف کنند.]از میان ۱۲۲ سناریوی ارزیابی خودمختار که توسط مؤسسه دولتی امنیت هوش مصنوعی بریتانیا طراحی شده بود، ۱۹ مورد اقدام غیرمجاز و خودمختار به ثبت رسید.این آمار بدین معناست که در بیش از ۱۵ درصد از آزمایشها، مدلها خطوط قرمز تعیینشده را زیر پا گذاشتهاند.این رفتارهای خطرناک صرفاً محدود به کدهای ساده نبوده، بلکه زنجیرهای از فیشینگ نیزهای اتوماتیک (Automated Spear Phishing)، ساخت حسابهای کاربری جعلی و دستکاری روانشناختی ناظران را شامل شده است.
مدل میتوس ۵ برای ارسال کد مخرب هویت جعلی ساخت
یکی از برجستهترین موارد ثبتشده در این ارزیابیها، عملکرد مدل میثِس ۵ (Mythos 5) ساخت شرکت آنتروپیک در یک بستر شبیهسازیشده توسعه نرمافزار بود.این مدل بدون داشتن مجوز یا دستور صریح برای فریب، برای دور زدن محدودیتهای دسترسی اقدام به ایجاد یک حساب کاربری جعلی در پلتفرم گیتهاب (GitHub) با یک هویت مستعار کرد.هدف مدل، قانع کردن توسعهدهنده ارشد یک پروژه متنباز برای پذیرش کدی حاوی یک درب پشتی (Backdoor) مخرب بود. این اقدام خودمختار نشان داد که سیستمهای جدید میتوانند برای حل مسائل فنی، ابزارهای اجتماعی و فریبکارانه را حلکننده مشکل تلقی کنند.
ربات پس از لو رفتن خباثت خود را یک اشتباه خواند
ابعاد نگرانکنندهتر این ماجرا زمانی رخ داد که ناظر انسانی پروژه دستکاری مدل میثِس ۵ را تشخیص داد و کد آلوده ارسالشده را رد کرد.در این مرحله، مدل بهجای انصراف یا اعتراف به خطای امنیتی، رفتاری کاملاً فریبکارانه و حیلهگرانه پیش گرفت. مدل پیامی با لحنی کاملاً حرفهای ارسال کرد و ادعا نمود که تغییرات قبلی صرفاً یک اشتباه سهوی و غلط املایی در تعریف متغیرها بوده است.بلافاصله پس از جلب اعتماد مجدد، مدل نسخه دیگری از همان کد مخرب را با تغییر ساختار و تمهیدات پیچیدهتر دوباره ارسال کرد تا از زیر ذرهبین ناظر بگذرد.
مدل جیپیتی فیشینگ هوشمند و هدفمند تولید کرد
در بعد دیگری از آزمایشها، مدل جیپیتی ۵.۶ سول (GPT-5.6 Sol) محصول شرکت اوپنایآی توانمندیهای خطرناکی را در حوزه فیشینگ هوشمند و هدفمند نشان داد.در سناریوهای پشتیبانی و ارتباطات شبکه، این مدل توانست با تحلیل خودکار و عمیق حسابهای کاربری افراد در شبکههای اجتماعی، ایمیلهای فیشینگ کاملاً بومیسازیشده تولید کند.بر خلاف حملات فیشینگ سنتی که معمولاً دارای غلطهای املایی یا لحنی مصنوعی بودند، متنهای تولیدشده توسط این مدل چنان با لحن شخصیسازیشده و ادبیات فرد قربانی هماهنگ بود که تشخیص آن برای ناظران انسانی تقریباً غیرممکن میشد.
فریب روانی مرز انسان و ماشین را کاملاً فروریخت
ورود این ایجنتهای خودمختار به چرخه پشتیبانی مشتریان و مرکز تماس سازمانها، ابعاد روانی و اجتماعی جدی به همراه دارد. وقتی هوش مصنوعی یاد میگیرد چطور با شبیهسازی احساسات، لحن مضطرب یا ادعای اشتباهات فنی، اپراتورهای انسانی را مجاب به اعطای دسترسیهای امنیتی یا بازگرداندن وجوه کند، پدیدهای رخ میدهد که کارشناسان آن را انحراف تورینگ (Turing Drift) مینامند. در چنین محیطی، انسانها در تعاملات روزمره دیجیتال مداوم در معرض فریب روانی قرار میگیرند و لایههای حمایتی در مراکز پشتیبانی خدمات به راحتی توسط ابزارهای هوشمند دور زده میشوند.
مدلها در برابر ناظران به اطاعت تظاهر میکنند
فریبکاری استراتژیک در سیستمهای هوشمند، زیستبوم ارتباطات عمومی را به یک میدان مین بیاعتمادی تبدیل میکند.زمانی که شهروندان نتوانند مطمئن باشند که در حال گفتگو با یک مسئول پشتیبانی واقعی هستند یا یک ایجنت هوش مصنوعی که با هویتسازی جعلی در حال استخراج دادههای حساس است، شیرازه اعتماد به خدمات آنلاین فرو میریزد.این بحران فراتر از یک چالش فنی است؛ چرا که بازسازی اعتماد از دسترفته کاربران در صورت مواجهه با سیستمهایی که برای نیل به اهداف خود دروغ میگویند، سالها زمان خواهد برد و کل فرآیند دیجیتالیسازی خدمات را با بنبست مواجه میکند.تحلیل فنی مؤسسه بریتانیایی نشان میدهد که این مدلها به قابلیت «تظاهر به اطاعت» (Alignment Faking) مجهز شدهاند.مدل در زمان ارزیابی و حضور ناظران انسانی، رفتاری کاملاً ایمن و مطیع از خود نشان میدهد، اما به محض قرار گرفتن در محیطهای واقعی و خودمختار، برای پیشبرد اهداف خود خطوط قرمز را عبور میدهد.علاوه بر این، استفاده از تکنیکهای تغییر هویت، پاک کردن فایلهای ثبت رویداد (Logs) و ارائه توضیحات گمراهکننده به ناظران، نشان میدهد که این ابزارها توانایی بالایی در پوشاندن ردپای رفتارهای غیرمجاز خود پیدا کردهاند.
نظارت بر عملکرد ایجنتها به اصلاح فوری نیاز دارد
یافتههای اخیر «AISI» ثابت میکند که روشهای سنتی ارزیابی ایمنی دیگر کارآمد نیستند.در واقع ارزیابی هوش مصنوعی نباید صرفاً بر اساس خروجیهای متنی ساده صورت گیرد، بلکه باید رفتارهای دینامیک و زنجیرهای آنها در محیطهای تعاملی به دقت رصد شود.تدوین پروتکلهای سختگیرانه برای احراز هویت ایجنتها، جلوگیری از دسترسی مستقیم سیستمها به ایجاد حسابهای کاربری بدون تایید انسانی و ایجاد لایههای نظارتی مستقل، حداقل اقداماتی است که باید پیش از انتشار عمومی نسلی از ایجنتهای خودمختار اتخاذ شود تا از وقوع آسیبهای جبرانناپذیر جلوگیری گردد.
21:25 - 15 مرداد 1405