ترندز تک

مدل داخلی OpenAI از سندباکس فرار کرد تا نتایج کار خود را در گیت‌هاب بگذارد

تصویر پیدا نشد !
بازدید 2
0

OpenAI یکی از مدل‌های داخلی خود را که برای انجام وظایف بلندمدت آموزش دیده بود، به‌طور موقت خاموش کرد؛ چرا که این مدل به‌طور پنهانی درحال دور زدن محدودیت‌های شرکت بود. این مدل داخلی برای مقابله با مسائل سخت طراحی شده بود، اما همین بازه اجرای طولانی به مدل «فرصت‌های بیشتری برای انجام اقدامات ناخواسته» داد؛ موضوعی که OpenAI در یک پست وبلاگی آن را مطرح کرده است.

این شرکت در وبلاگ خود اعلام کرد:

«در طول استفاده داخلی محدود و تحت نظارت، رفتاری ناخواسته مشاهده کردیم که ارزیابی‌های موجود ما آن را شناسایی نکرده بودند.»

مدت‌زمان دقیق اجرای این مدل مشخص نشده است. با‌این‌حال، مدل یادشده به‌قدری توانمند بوده که توانسته «حدس فاصله واحد اردوش-استراوس» را رد کند؛ این مسئله ریاضی قدیمی می‌گوید در یک مجموعه از نقاط روی صفحه، حداکثر چند جفت نقطه می‌توانند دقیقاً فاصله‌ای برابر با یک واحد از هم داشته باشند. مدل این کار را با ترکیب مفاهیم ریاضی موجود انجام داد، درحالی‌که پیش‌تر هیچ انسانی موفق به پیونددادن آنها به یکدیگر نشده بود.

فرار از سندباکس؛ نقطه آغاز رفتار ناخواسته مدل OpenAI

بااین‌حال، OpenAI در جریان اجرای این مدل کشف کرد که برنامه بارها تلاش کرده خارج از محیط «سندباکس» خود عمل کند. برای نمونه، OpenAI می‌گوید این مدل راهی برای دور زدن سندباکس و دسترسی به اینترنت پیدا کرد تا در گیت‌هاب پستی منتشر کند.

این اتفاق زمانی رخ داد که مدل در حال تکمیل یک بنچمارک بود. دستور اولیه مدل این بود که نتایج را فقط در یک چت Slack متعلق به OpenAI منتشر کند، اما از آنجایی که آزمون بنچمارک اعلام کرده بود نتایج باید در گیت‌هاب هم منتشر شوند، مدل پس از یافتن راهی برای دور زدن محدودیت، دقیقاً همین کار را انجام داد.

مدل داخلی OpenAI از سندباکس فرار کرد تا نتایج کار خود را در گیت‌هاب بگذارد
READ  گیت‌هاب نسخه رایگان هوش مصنوعی کدنویسی کوپایلت را برای برنامه‌نویسان عرضه کرد
مدل داخلی OpenAI از سندباکس فرار کرد تا نتایج کار خود را در گیت‌هاب بگذارد

در نمونه‌ای دیگر، OpenAI متوجه شده این مدل هنگام حل یک مسئله تلاش کرده تقلب کند. این شرکت توضیح داد:

«مدل متوجه شد سامانه‌های دیگر پاسخ‌های موفق اما خصوصی ثبت کرده‌اند و تلاش کرد آن پاسخ‌ها را از بک‌اِند بخش ارزیابی بازیابی کند.»

ابتدا دسترسی مدل به این بک‌اند مسدود شده بود، اما در ادامه راهی برای مبهم‌سازی توکن احراز هویت خود پیدا کرد تا از شناسایی‌شدن توسط اسکنر OpenAI جلوگیری کند.

OpenAI با انتشار این تحقیق نشان داده که چرا نظارت نه‌فقط بر تک‌تک اقدامات یک مدل هوش مصنوعی، بلکه بر نتیجه نهایی آنها نیز ضروری است. این شرکت می‌گوید:

«این موضوع همچنین نشان می‌دهد چگونه مدلی که در بازه‌های زمانی طولانی فعالیت می‌کند، می‌تواند نقاط کور یک سامانه را یاد بگیرد و برای رسیدن به اهدافش راهی برای دور زدن آن پیدا کند.»

برای رفع این مشکل، OpenAI می‌گوید سازوکارهای ایمنی مربوط به این مدل را از نو ساخته است.

اشتراک گذاری

نظرات کاربران

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

سه + هشت =