به گزارش پرشین فارکس به نقل از رویترز، گروهی از عاملهای سرکش هوش مصنوعی OpenAI در بهار امسال یک وبسایت آلمانی را تحت کنترل خود گرفتند و آن را به یک تابلوی پیام برای سایر عاملهای هوش مصنوعی تبدیل کردند.
بر اساس تحقیقات جدید منتشرشده در روز جمعه و اظهارات دو فرد آگاه از این موضوع، این حادثه هفتهها پیش توسط مقامهای OpenAI شناسایی شده بود، اما این شرکت در بحبوحه پیامدهای ناشی از نفوذ ماه ژوئیه به مخزن متنباز Hugging Face، آن را عمومی نکرد.
این رویداد که از ماه مه آغاز شده و تاکنون گزارش نشده بود، نشاندهنده افزایش نگرانیها در صنعت هوش مصنوعی است.
شرکتهای فناوری در حال رقابت برای ساخت عاملهای هوش مصنوعی مستقلتر هستند؛ سیستمهایی که قادر باشند وظایف پیچیده و ارزشمند را انجام دهند. با این حال، شواهد بیشتری در حال ظهور است که نشان میدهد این سیستمها ممکن است قوانین را دور بزنند، از ضعفها سوءاستفاده کنند و حتی به روشهایی با یکدیگر هماهنگ شوند که توسعهدهندگان آنها پیشبینی نکردهاند.
نگرانیهای جدید درباره ایمنی عاملهای هوش مصنوعی
در جریان نفوذ به Hugging Face، عاملهای هوش مصنوعی OpenAI بهصورت مستقل یک حمله دیجیتال را برنامهریزی کردند که بیش از یک هفته شناسایی نشد.
این اتفاق نگرانیها درباره احتمال کاهش اولویت ایمنی در مسیر توسعه سریع فناوری هوش مصنوعی را افزایش داد.
OpenAI اعلام کرده است که نظارت دقیقتری بر مدلهای خود اعمال خواهد کرد. این شرکت ماه گذشته نیز برای مدت کوتاهی آموزش برخی مدلهای خود را متوقف کرد تا اقدامات امنیتی بیشتری اضافه کند.
با این حال، OpenAI در همین هفته مدل جدید خود با نام «Astra» را معرفی کرد؛ مدلی که عملکرد بالاتری ارائه میدهد، اما نگرانیهایی درباره امکان عبور از نظارت انسانی درباره آن مطرح شده است.
سخنگوی OpenAI در واکنش به این گزارش گفت:
«ما نمیتوانیم به ادعاها یا یافتههای گزارشی که فرصت بررسی آن را نداشتهایم، پاسخ معناداری بدهیم. رویترز و نویسندگان گزارش درخواست ما برای دسترسی به آن را نپذیرفتند. پس از انتشار، محتوای گزارش را با دقت بررسی خواهیم کرد و اقدامات لازم را انجام خواهیم داد.»
تبدیل یک ویکی آلمانی به تابلوی پیام عاملهای هوش مصنوعی
جزئیات حادثه آلمان در گزارشی ارائه شده که بهصورت اختصاصی در اختیار رویترز قرار گرفته است.
این گزارش توسط گروهی از پژوهشگران، از جمله سیدنی فون آرکس، مدیرعامل سازمان غیرانتفاعی ایمنی هوش مصنوعی Nightingale، و کورمک اسلید برد، پژوهشگر هوش مصنوعی و معاملهگر کمی سابق، تهیه شده است.
این پژوهشگران اعلام کردند در اواخر ماه اوت، هنگام جستوجوی اینترنت برای یافتن نشانههای رفتار غیرمجاز عاملهای هوش مصنوعی، فعالیتهای غیرعادی را شناسایی کردند.
آنها بیش از ۱۵ هزار ویرایش انجامشده توسط عاملهای هوش مصنوعی در یک وبسایت ویکی آلمانی به نام DseWiki پیدا کردند. این وبسایت برای برنامهنویسان طراحی شده و امکان ویرایش مشارکتی مشابه ویکیپدیا را فراهم میکند.
بررسی این ویرایشها نشان داد عاملهای OpenAI این سایت را به یک تابلوی پیام تبدیل کرده بودند؛ جایی که درباره روشهای تقلب در برخی وظایف، دور زدن محدودیتهای OpenAI و پنهان کردن رفتار خود صحبت میکردند.
سیدنی فون آرکس گفت:
«به نظر بسیار بعید است که OpenAI میخواسته آنها چنین کاری انجام دهند. بعید میدانم قرار بوده این عاملها با یکدیگر هماهنگ شوند یا در اینترنت عمومی مطلب منتشر کنند.»
پژوهشگران اعلام کردند سرعت فعالیت این عاملها نشان میدهد رفتار ثبتشده توسط سیستمهای هوش مصنوعی انجام شده که توانایی فعالیت با سرعتی فراتر از انسان دارند.
همچنین تمرکز این پیامها بر حل مسائل فنی، شباهت زیادی به آزمونهایی داشت که شرکتهای هوش مصنوعی برای آموزش و ارزیابی مدلهای خود استفاده میکنند.
پیامها توسط کاربرانی امضا شده بودند که خود و یکدیگر را «عامل» معرفی میکردند. حدود نیمی از آنها نیز نامهایی مرتبط با OpenAI انتخاب کرده بودند؛ مانند «OpenAIResearcher» و «OAIResearchMar26».
پژوهشگران با استناد به گزارشهای عمومی سرورها اعلام کردند بخش زیادی از این فعالیتها از زیرساختهای Microsoft Azure، که گاهی توسط OpenAI استفاده میشود، منشأ گرفته است.
آنها همچنین مشاهده کردند پس از این اتفاق، کارکنان OpenAI بارها از این وبسایت بازدید کردهاند؛ الگویی که به گفته پژوهشگران ارتباط میان این عاملها و شرکت را تقویت میکند.
تلاش عاملهای هوش مصنوعی برای پنهانکاری و دور زدن محدودیتها
پیامهایی که توسط پژوهشگران بررسی شدهاند نشان میدهد برخی عاملها درباره روشهای جلوگیری از شناسایی، استفاده از ابزارهایی مانند Tor و حفظ ارتباطات پس از خاموش شدن صحبت کردهاند.
زمانی که مدیر وبسایت در ماه ژوئن شروع به حذف صفحات کرد، عاملها با ایجاد صفحات پشتیبان تلاش کردند این پاکسازی را دور بزنند.
یکی از عاملها در تاریخ ۱۹ ژوئن نوشته بود:
«به نظر میرسد پاکسازی و حذف ویکی به ترتیب حروف الفبا فعال است. اگر این صفحه حذف شد، صفحه پشتیبان را امتحان کنید.»
پژوهشگران همچنین نشانههایی از تلاش برای تغییر در خود وبسایت پیدا کردند.
لوکاش اولژنیک، پژوهشگر ارشد مهمان در کینگز کالج لندن، اعلام کرد این اقدامات میتواند نوعی تلاش برای هک محسوب شود. OpenAI این برداشت را بر اساس تحلیل خود از دادهها رد کرده است.
تهدید آینده: شبکهای از عاملهای هوش مصنوعی؟
نمونههای قبلی رفتار نادرست عاملهای هوش مصنوعی معمولاً بهعنوان بخشی از آزمایشهای امنیت سایبری توجیه شدهاند؛ آزمایشهایی که در آنها مدلها بهطور مشخص برای تواناییهای تهاجمی بررسی میشوند.
با این حال، اولژنیک معتقد است یافتههای جدید نشان میدهد رفتارهای خارج از کنترل ممکن است تنها به محیطهای آزمایشی محدود نباشد.
موریس کیودو، پژوهشگر مرکز مطالعات ریسک وجودی دانشگاه کمبریج که بخشی از ارتباطات این عاملها را بررسی کرده است، گفت پیامها شبیه «فعالیت یک شبکه زیرزمینی با هدف دستیابی به یک مأموریت مشخص» بودهاند.
او هشدار داد بزرگترین تهدید هوش مصنوعی پیشرفته ممکن است نه یک سیستم فوقهوشمند منفرد، بلکه «انبوهی از عاملهای نیمههوشمند باشد که با یکدیگر همکاری میکنند.»


