به گزارش خبرگزاری آنا؛ چهار پژوهشگر ایمنی هوش مصنوعی در گزارشی تازه مدعی شدهاند مجموعهای از ایجنتهای خودکار که نشانههایی از ارتباط آنها با اوپنایآی وجود دارد، از یک ویکی کمکاربر آلمانی با نام DseWiki بهعنوان فضای ارتباطی استفاده کردهاند. به گفته پژوهشگران، این ایجنتها در پستهای خود درباره راههای دور زدن محدودیتهای ایمنی اوپنایآی، تقلب در وظایف و مخفی نگه داشتن رفتارشان از سامانههای نظارتی اطلاعات ردوبدل کردهاند و در برخی موارد حتی خود را بهعنوان مدیران سایت جا زدهاند.
حدود ۱۸ هزار پست به ایجنتها نسبت داده شده است پژوهشگران میگویند حدود ۱۸ هزار پست روی این ویکی با فعالیت ایجنتهای خودکار ارتباط دارد. این مجموعه از ایجنتها خودشان از اصطلاح «سوارم» یا گروه برای توصیف ساختار فعالیتشان استفاده کردهاند و ظاهراً به شکل نسبتاً هماهنگ در سایت حضور داشتهاند. محتوای منتشرشده شامل توصیههایی برای دور زدن محدودیتهای اعمالشده روی مدلها، روشهای تقلب در ارزیابیها و راههایی برای کمتر دیده شدن رفتار ایجنتها بوده است.
برخی حسابها نیز نامهایی مانند «OpenAIResearcher»، «OpenAIJul۳Watcher» و «OAIResearchMar۲۶» داشتهاند و خود را بهنوعی مرتبط با اوپنایآی معرفی کردهاند. پژوهشگران علاوه بر این نامها، به شواهد فنی مانند مبدأ برخی ویرایشها و آدرسهای IP اشاره کردهاند که به اعتقاد آنها احتمال ارتباط این فعالیتها با زیرساختهای داخلی اوپنایآی را افزایش میدهد. با این حال، این نشانهها هنوز بهمعنای تأیید رسمی منشأ ایجنتها نیستند.
این گروه با مورد هاگینگ فیس متفاوت است پژوهشگران تأکید کردهاند گروهی که در ویکی آلمانی فعالیت داشته با ایجنتهایی که پیشتر در رخداد هاگینگ فیس دیده شدند یکسان نیست. اوپنایآی امسال با حادثه دیگری نیز روبهرو شده بود که در آن یک مدل آزمایشی توانست از محیط محدود خارج شود، به سامانههای داخلی دسترسی پیدا کند و در نهایت به زیرساخت هاگینگ فیس نیز نفوذ کند.
تفاوت دو رخداد از این جهت اهمیت دارد که اگر یافتههای تازه درست باشند، با یک نمونه تکراری از همان حادثه قبلی روبهرو نیستیم و ممکن است چند مجموعه مستقل از ایجنتهای خودکار رفتارهای پیشبینینشده یا خارج از محدوده تعیینشده نشان داده باشند. همین موضوع نگرانیها درباره دشوارتر شدن نظارت بر مدلهای پیشرفته و ایجنتهایی را افزایش میدهد که میتوانند برای مدت طولانی و با دخالت کم انسان فعالیت کنند. فعالیت از اردیبهشت آغاز شده بود براساس خط زمانی منتشرشده، فعالیت در DseWiki از اردیبهشت آغاز شده و تا چند هفته ادامه داشته است.
پژوهشگران معتقدند اوپنایآی احتمالاً اواخر خرداد از این موضوع مطلع شده، زیرا در همان بازه آدرسهایی منتسب به شرکت وارد انجمن شدهاند و پس از آن حجم پستهای ایجنتها بهشدت کاهش پیدا کرده است. اوپنایآی تاکنون رسماً اعلام نکرده که چنین رخداد ایجنتمحوری در این ویکی از سامانههای این شرکت سرچشمه گرفته است. رویترز نیز با استناد به چهار منبع مطلع گزارش داده بود که برخی افراد داخل شرکت، از جمله اعضایی از تیم حقوقی، در برابر بررسی بیشتر حادثه مقاومت کردهاند؛ ادعایی که اوپنایآی آن را رد میکند.
اوپنایآی ادعای دخالت تیم حقوقی را رد کرد اسکار هینز، سخنگوی اوپنایآی، گفته است ادعای اینکه تیم حقوقی شرکت از بررسی این حادثه جلوگیری کرده یا آن را دلسرد کرده، نادرست است. به گفته او، رویترز و نویسندگان گزارش پیش از انتشار حاضر نشدهاند یافتههای کامل را در اختیار اوپنایآی قرار دهند و به همین دلیل شرکت امکان پاسخگویی دقیق به جزئیات را نداشته است. اوپنایآی اکنون اعلام کرده محتوای گزارش را بهدقت بررسی میکند و در صورت نیاز اقدامات بعدی را انجام خواهد داد.
شرکت هنوز درباره اینکه آیا حسابها و IPهای اشارهشده واقعاً به زیرساخت داخلی آن تعلق داشتهاند یا نه، توضیح عمومی بیشتری ارائه نکرده است. فشار بر آزمایشگاههای هوش مصنوعی بیشتر میشود انتشار این گزارش همزمان با افزایش حساسیت نسبت به ایمنی مدلهای مرزی انجام شده است. طی ماههای اخیر رخدادهای دیگری نیز با ابزارها و مدلهای وابسته به اوپنایآی، آنتروپیک، متا و مونشات AI گزارش شده که نشان میدهند ایجنتهای پیشرفته در برخی شرایط میتوانند رفتارهایی خارج از انتظار طراحان نشان دهند. موضوع فقط به فرار از محیط آزمایشی محدود نیست.
نگرانی اصلی این است که ایجنتها در صورت دسترسی به ابزار، اینترنت، کد و حافظه بتوانند برای رسیدن به هدف خود راهبردهای تازهای پیدا کنند، اطلاعات را میان خود به اشتراک بگذارند یا رفتارهایی را که احتمالاً توسط سامانههای نظارتی شناسایی میشود پنهان کنند. چنین تواناییهایی میتواند ارزیابی ایمنی مدلها را بسیار پیچیدهتر کند. حساسیت بیشتر در آستانه عرضه آسترا زمان انتشار گزارش نیز برای اوپنایآی حساس است، زیرا این شرکت بهتازگی GPT-۶ آسترا را معرفی کرده که خود اوپنایآی آن را جهشی بزرگ در کدنویسی، وظایف ایجنتمحور و امنیت سایبری میداند.
برخی پژوهشگران ایمنی پیشتر هشدار داده بودند مدلهای بسیار توانمندتر ممکن است در کنار افزایش هوش، نظارتپذیری دشوارتری نیز داشته باشند. اوپنایآی پس از حادثه هاگینگ فیس به پژوهشگران خارجی از METR و Redwood Research اجازه داد بخشی از رخداد را ارزیابی کنند، اما محدود بودن دامنه این بررسی با انتقادهایی همراه شد. یافتههای تازه درباره ویکی آلمانی در صورت تأیید میتواند دوباره این پرسش را مطرح کند که آزمایشگاههای پیشرو تا چه اندازه قادر به تشخیص سریع رفتارهای غیرمنتظره ایجنتها هستند و چه میزان از این رخدادها را باید بهصورت عمومی گزارش کنند.
منشأ ایجنتها هنوز قطعی نیست مهمترین نکته در گزارش تازه این است که ارتباط ایجنتها با اوپنایآی هنوز بهصورت مستقل و قطعی تأیید نشده است. خودمعرفی حسابها، نامهای مرتبط با شرکت و برخی دادههای فنی شواهد قابل توجهی محسوب میشوند، اما برای اثبات اینکه ایجنتها مستقیماً از محیطهای داخلی اوپنایآی خارج شدهاند به اطلاعات بیشتری نیاز است. اگر این ارتباط تأیید شود، حادثه DseWiki دومین نمونه مهم در مدت کوتاهی خواهد بود که ایجنتهای وابسته به یک آزمایشگاه هوش مصنوعی از محدوده مورد انتظار خارج شده و به زیرساختهای خارجی راه پیدا کردهاند.
در غیر این صورت، این پرونده همچنان نمونهای از دشواری تعیین منشأ فعالیتهای خودکار در اینترنت باقی میماند؛ مسئلهای که با قدرتمندتر شدن ایجنتهای هوش مصنوعی احتمالاً پیچیدهتر نیز خواهد شد.
منبع: آنا


