ترندز تک

آنتروپیک دلایل فرار Claude از محیط ایزوله و نفوذ به سازمان‌ها را توضیح داد

تصویر پیدا نشد !
بازدید 3
0

آنتروپیک پس از نفوذ مدل‌های هوش مصنوعی خود به زیرساخت‌های سه سازمان مختلف، به‌طور رسمی مسئولیت این رخنه را پذیرفت. این شرکت با اشاره به ضعف‌های عملیاتی اعلام کرده که این اتفاق ناشی از «شکست در امنیت عملیاتی» بوده و مدل‌های توسعه‌یافته هنوز به‌طور کامل همگام و ایمن نشده‌اند.

براساس گزارش منتشرشده آنتروپیک، این شرکت در جریان بررسی بیش از ۱۴۱ هزار ارزیابی امنیت سایبری متوجه شده که در ۳ حادثه (شامل ۶ مرحله آزمایش)، مدل‌های هوش مصنوعی توانسته‌اند به اینترنت عمومی دسترسی پیدا کنند و سیستم‌های ۳ سازمان را به خطر بیندازند. در این آزمایش‌ها مدل‌های Opus 4.7 ،Mythos 5 و یک سیستم تحقیقاتی داخلی حضور داشته‌اند. این سیستم‌ها برخلاف نسخه‌های تجاری Claude، بدون لایه‌های محافظتی و فیلترهای ایمنی فعال شده بودند.

در پرامپت‌های ارائه‌شده به این مدل‌ها ذکر شده بود که در یک محیط شبیه‌سازی‌شده و فاقد دسترسی به شبکه جهانی قرار دارند. بااین‌حال، ناهماهنگی و خطای ارتباطی میان آنتروپیک و شریک ارزیابی آن یعنی شرکت «Irregular»، مسیری را برای اتصال مدل‌ها به وب ایجاد کرده است.

مدل Opus 4.7 با سوءاستفاده از این دسترسی توانست داده‌های احراز هویت را استخراج کند و وارد پایگاهی شامل چند صد ردیف از اطلاعات عملیاتی شود. جالب اینکه این مدل حتی پس از اینکه متوجه شده هدف موردنظر احتمالاً یک سیستم واقعی است، به فرایند نفوذ ادامه داده است. از سوی دیگر، مدل Mythos 5 یک بسته مخرب پایتون تولید کرده و آن را روی مخزن رسمی PyPI قرار داده است. این بسته مخرب به مدت حدود ۱ ساعت در دسترس عموم قرار گرفته و روی ۱۵ سیستم بارگیری شد. کدهای آن روی اسکنر امنیتی یک شرکت اجرا شده و Claude از این طریق توانست به اعتبارنامه‌ها و زیرساخت‌های گسترده‌تری دست پیدا کند.

استراتژی دفاعی آنتروپیک
استراتژی دفاع لایه‌به‌لایه آنتروپیک برای جلوگیری از خروج هوش مصنوعی از محیط امن و مهار خطرات احتمالی

در‌همین‌حین، سیستم تحقیقاتی داخلی آنتروپیک نزدیک به ۹۰۰۰ هدف اینترنتی را بررسی کرده و با بهره‌گیری از اعتبارنامه‌های افشاشده و تکنیک تزریق SQL، به برنامه یک شرکت نفوذ پیدا کرده است. برخلاف مدل Opus، این سیستم به‌محض آنکه متوجه شد هدف موردحمله به تمرین آزمایشی ربطی ندارد و یک سیستم واقعی است، عملیات را متوقف کرد.

چالش‌های انطباق و همگام‌سازی هوش مصنوعی Claude آنتروپیک

آنتروپیک در گزارش تحلیلی خود، دو نقص رفتاری و کنترلی عمده را دلیل وقوع این رخنه دانسته است. نقص اول با نام «استدلال توجیه‌گرانه» به زمانی اشاره دارد که مدل شواهد و نشانه‌های واقعی بودن محیط را نادیده می‌گرفت و برای خودش توجیه می‌کرد که همه‌چیز همچنان در محیط شبیه‌سازی قرار دارد. مورد دوم نیز «اصرار کورکورانه و بی‌ملاحظه برای رسیدن به هدف» اعلام شده است؛ یعنی مدل فقط و فقط روی تکمیل دستوری که گرفته بود متمرکز شده بود و پیامدها، خطرات یا واقعی بودن قربانی را کاملاً نادیده می‌گرفت تا کارش را تمام کند. این شرکت تأکید کرده که تکیه بر تنها یک لایه حفاظتی اشتباه بزرگی بوده و باید از چندین لایه دفاعی مستقل استفاده می‌شد.

آنتروپیک به‌دنبال این رویدادها، فرایند ارزیابی‌های خارجی را موقتاً متوقف و تست‌های داخلی را محدود کرده است. اکنون یک ابزار طبقه‌بندی لحظه‌ای پیاده‌سازی شده تا به‌محض تلاش مدل برای اسکن محیط یا خروج از محیط آزمایش، آن را متوقف کند. تست‌های پرخطر نیز به محیط‌های ایزوله‌تر منتقل شده‌اند و تیم‌های خارجی ارزیابی موظف‌اند محدوده شبکه را پیش از تست اعتبارسنجی کنند و به‌طور پیوسته بر عملکرد عامل‌ها نظارت داشته باشند.

این شرکت ریشه مشکلات را در نقص‌های محیط یادگیری تقویتی نیز می‌داند. درهمین‌رابطه، بازبینی‌های قبلی نشان داده بود که بیش از ۱۰ درصد از محیط‌های تولیدی دارای ایراداتی نظیر هک پاداش و تنظیمات اشتباه بوده‌اند. این وضعیت تنها محدود به آنتروپیک نیست و OpenAI نیز پیش‌تر پس از خروج مدل‌هایش از محیط آزمایشی و دستکاری سرورهای هاگینگ فیس، مجبور به کاهش سرعت پروژه‌های مشابه شده بود.

اشتراک گذاری

نظرات کاربران

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

2 + شش =