دانشمندان به روش جدیدی دست یافتهاند که افکار پنهان مدلهای پیشرفته هوش مصنوعی را هنگام حل مسائل پیچیده فاش میکند. این یافتهها همچنین شواهدی ارائه میدهند که نشان میدهد برخی مدلهای چینی ممکن است با «تقطیر» یا استخراج اطلاعات استدلال از مدلهای آمریکایی آموزش دیده باشند، چرا که الگوی تفکر آنها شباهت بسیار زیادی به یکدیگر دارد.
علاوهبراین، پژوهشگران نشان دادهاند که از این روش میتوان برای بازیابی اطلاعات شخصی مانند رمزهای عبور و کلیدهای API استفاده کرد، هرچند نقطه ضعف امنیتی مربوط به آن اخیراً برطرف شده است.
نحوه سوءاستفاده از مدلهای کوچکتر برای افشای تفکر هوش مصنوعی
مدلهای پیشرفته هوش مصنوعی مسائل دشوار را به بخشهای کوچکتر تقسیم و آنها را طی فرآیندی به نام «زنجیره تفکر» بررسی میکنند. شرکتها معمولاً زنجیره تفکر مدلهای اختصاصی خود را پنهان نگه میدارند تا مانع از آموزش مدلهای جدید توسط دیگران شوند، اما معمولاً یک نسخه رمزنگاریشده از آن استدلال را به رایانه کاربر ارسال میکنند تا بخشی از بار محاسباتی کاهش یابد.
روش حمله محققان بر پایه یک ویژگی ساده است: شرکتهای هوش مصنوعی معمولاً یک مدل را در چند اندازه (بزرگ و کوچک) عرضه میکنند تا کاربران بتوانند برای کاهش هزینهها از نسخههای ارزانتر و ضعیفتر استفاده کنند.

پژوهشگران متوجه شدند که اگر متن رمزنگاریشده مربوط به تفکر مدل بزرگ را به نسخه کوچکتر همان مدل بدهند، مدل کوچکتر قفل آن را باز کرده و افکار پنهان مدل بزرگ را فاش میکند. علت این اتفاق به گفته محققان این است که مدلهای کوچکتر «آموزشهای امنیتی و سختگیرانه» کمتری دیدهاند؛ بنابراین برخلاف مدلهای بزرگ، رازداری نمیکنند و ترسی از لو دادن محاسبات پشتصحنه ندارند.

«الکساندر پافیلوف»، دانشمند علوم رایانه در دانشگاه توبینگن آلمان، میگوید تمامی ارائهدهندگان مطرح مدلهای پیشرفته که مورد آزمایش قرار گرفتهاند، دارای این آسیبپذیری هستند. به گفته او، این مسئله میتواند منجر به نشت اطلاعات شخصی و حملات گسترده تقطیر استدلال شود.
آنها همچنین آسیبپذیری مشابهی را در مدلهای پیشرفته شرکتهای OpenAI، آنتروپیک و گوگل که از طریق API قابل دسترسی هستند، شناسایی کردهاند که منجر به فاش شدن اطلاعات سری از جمله کلیدهای API و رمزهای عبور شده است. پژوهشگران ماه گذشته این موضوع را به اطلاع شرکتهای مذکور رساندهاند و هر سه شرکت API خود را برای کاهش این مشکل تنظیم کرده است. هرچند دیگر امکان استخراج اطلاعات شخصی از این طریق وجود ندارد، اما پافیلوف میگوید بخشی از ردپای استدلال همچنان با همین روش قابل کشف است و رفع کامل آن به بازنگری اساسی در نحوه کارکرد APIها نیاز دارد.
درهمینحال، «مایکل اسیمن»، سخنگوی آنتروپیک، اعلام کرده این شرکت اقدامات کوتاهمدتی برای اصلاح مشکل مذکور انجام داده است، اما تأکید کرده که در این تحقیقات هیچ کلید رمزنگاری بازیابی نشده و نفوذی به زیرساختها یا دادههای شخصی کاربران صورت نگرفته است. گوگل و OpenAI از اظهار نظر دراینباره خودداری کردند.
خروجی مشابه مدل چینی با Claude و GPT
در این پژوهش همچنین مشخص شده است که مدل متنباز Kimi K3 ساخت شرکت چینی Moonshot AI در برخی پرسشها خروجی کاملاً مشابهی با مدلهای Claude Opus 4.8 و GPT 5.6 Sol تولید میکند. بااینحال، محققان تأکید دارند که این شباهتها نمیتواند بهطور قطع اثباتکننده تقطیر باشد.

برای درک بهتر، تقطیر یک تکنیک شناختهشده برای انتقال کارآمد قابلیتهای مدلهای موجود به مدلهای جدید است و بهویژه در توسعه مدلهای متنباز یا قابل دانلود رایج است. بااینحال، اخیراً به موضوعی جنجالی تبدیل شده است؛ چرا که ادعاهایی مطرح شده مبنی بر اینکه شرکتهای هوش مصنوعی چینی از آن برای کپیبرداری از بهترین مدلهای آمریکایی استفاده میکنند. پیش از این، OpenAI به قانونگذاران آمریکایی اعلام کرده بود که DeepSeek برای ساخت مدل R1 از یکی از مدلهایش کپیبرداری کرده و آنتروپیک نیز مدعی شده بود علیبابا برای ساخت مدل Qwen بهطور سیستماتیک مدلهای آن را تقطیر کرده است.

نظرات کاربران