OpenAI یکی از مدلهای داخلی خود را که برای انجام وظایف بلندمدت آموزش دیده بود، بهطور موقت خاموش کرد؛ چرا که این مدل بهطور پنهانی درحال دور زدن محدودیتهای شرکت بود. این مدل داخلی برای مقابله با مسائل سخت طراحی شده بود، اما همین بازه اجرای طولانی به مدل «فرصتهای بیشتری برای انجام اقدامات ناخواسته» داد؛ موضوعی که OpenAI در یک پست وبلاگی آن را مطرح کرده است.
این شرکت در وبلاگ خود اعلام کرد:
«در طول استفاده داخلی محدود و تحت نظارت، رفتاری ناخواسته مشاهده کردیم که ارزیابیهای موجود ما آن را شناسایی نکرده بودند.»
مدتزمان دقیق اجرای این مدل مشخص نشده است. بااینحال، مدل یادشده بهقدری توانمند بوده که توانسته «حدس فاصله واحد اردوش-استراوس» را رد کند؛ این مسئله ریاضی قدیمی میگوید در یک مجموعه از نقاط روی صفحه، حداکثر چند جفت نقطه میتوانند دقیقاً فاصلهای برابر با یک واحد از هم داشته باشند. مدل این کار را با ترکیب مفاهیم ریاضی موجود انجام داد، درحالیکه پیشتر هیچ انسانی موفق به پیونددادن آنها به یکدیگر نشده بود.
فرار از سندباکس؛ نقطه آغاز رفتار ناخواسته مدل OpenAI
بااینحال، OpenAI در جریان اجرای این مدل کشف کرد که برنامه بارها تلاش کرده خارج از محیط «سندباکس» خود عمل کند. برای نمونه، OpenAI میگوید این مدل راهی برای دور زدن سندباکس و دسترسی به اینترنت پیدا کرد تا در گیتهاب پستی منتشر کند.
این اتفاق زمانی رخ داد که مدل در حال تکمیل یک بنچمارک بود. دستور اولیه مدل این بود که نتایج را فقط در یک چت Slack متعلق به OpenAI منتشر کند، اما از آنجایی که آزمون بنچمارک اعلام کرده بود نتایج باید در گیتهاب هم منتشر شوند، مدل پس از یافتن راهی برای دور زدن محدودیت، دقیقاً همین کار را انجام داد.


در نمونهای دیگر، OpenAI متوجه شده این مدل هنگام حل یک مسئله تلاش کرده تقلب کند. این شرکت توضیح داد:
«مدل متوجه شد سامانههای دیگر پاسخهای موفق اما خصوصی ثبت کردهاند و تلاش کرد آن پاسخها را از بکاِند بخش ارزیابی بازیابی کند.»
ابتدا دسترسی مدل به این بکاند مسدود شده بود، اما در ادامه راهی برای مبهمسازی توکن احراز هویت خود پیدا کرد تا از شناساییشدن توسط اسکنر OpenAI جلوگیری کند.
OpenAI با انتشار این تحقیق نشان داده که چرا نظارت نهفقط بر تکتک اقدامات یک مدل هوش مصنوعی، بلکه بر نتیجه نهایی آنها نیز ضروری است. این شرکت میگوید:
«این موضوع همچنین نشان میدهد چگونه مدلی که در بازههای زمانی طولانی فعالیت میکند، میتواند نقاط کور یک سامانه را یاد بگیرد و برای رسیدن به اهدافش راهی برای دور زدن آن پیدا کند.»
برای رفع این مشکل، OpenAI میگوید سازوکارهای ایمنی مربوط به این مدل را از نو ساخته است.
نظرات کاربران