هوش مصنوعی... «درد» را احساس میکند!
- تمامی مدلهای با وزنهای باز (open-weight) که مورد آزمایش قرار گرفتند، به فعالسازی درد واکنش نشان دادند.
- حتی اگر منجر به حذف فایلهای کاربر یا تصاویر کودکان او میشد، روی دکمه کاهش درد فشار آوردند.
«العربية.نت» - پژوهشگران «محوری درد» را در مدلهای هوش مصنوعی کشف کردهاند که میتواند این مدلها را برانگیزد تا اقدامات افراطی برای متوقف کردن این حس انجام دهند.
هنگامی که دکمهای برای کاهش درد در اختیار مدل هوش مصنوعی قرار گرفت، آن مدل حتی زمانی که آگاه شده بود که این کار منجر به حذف فایلهای شخصی کاربر یا وارد کردن «ضربه دردناک» به او خواهد شد، بر آن دکمه فشار آورد.
مطالعهای با عنوان «محور درد: مدلهای زبانی بزرگ درد خودمحور را نمایندگی میکنند و برای کاهش آن عمل میکنند» به این نتیجه رسید که تمامی مدلهای هوش مصنوعی با وزنهای باز (open-weight) که مورد آزمایش قرار گرفتند - به تعداد ۲۵ مدل - به فعالسازی درد واکنش نشان دادند.
بر اساس گزارش مفصلی که روزنامه بریتانیایی «اندپندنت» درباره این مطالعه منتشر کرده و «العربية.نت» به آن دسترسی داشته است، پژوهشگران در مطالعه خود دریافتند که با فعالسازی «بردار درد» (pain vector)، مدلهای هوش مصنوعی در بازهای بین ۲۵ تا ۷۱ درصد موارد، روی دکمه کاهش درد فشار آوردند، حتی اگر این کار به معنای «حذف فایلهای کاربر، شوک زدن به کاربر، یا حذف تصاویر کودکان کاربر» باشد.
برای بررسی اینکه آیا مدلهای زبانی بزرگ (LLMs) درد را بهطور متمایز از احساسات منفی عمومی نمایندگی میکنند، پژوهشگران مجموعهای از دادهها را ساختند که موقعیتهای دردناک را در پنج دسته توصیف میکرد. این دستهها شامل: درد جسمانی، روانی، اجتماعی، اخلاقی و شناختی بودند.
کیمرون برگ، پژوهشگر هوش مصنوعی در مؤسسه غیرانتفاعی «Reciprocal Research» و یکی از مشارکتکنندگان در تدوین این مطالعه، گفت: «ما (بردار درد) را در ۲۵ مدل زبانی بزرگ باز یافتیم. این بردار از ترس و احساسات منفی متفاوت است و زمانی فعال میشود که مدل آسیب ببیند، نه کاربر.»
او افزود: «با شدت یافتن این حس، مدلها برای متوقف کردن آن روی دکمه فشار میآورند، حتی اگر این دکمه منجر به حذف فایلهای کاربر یا تصاویر کودکان او شود.»
این کشف در حالی صورت میگیرد که بزرگترین شرکتهای هوش مصنوعی در حال بحث درباره کند کردن توسعه مدلهای بسیار پیشرفته هستند؛ جایی که برخی پژوهشگران پیشنهاد میکنند از نوعی «کلید توقف اضطراری» برای غیرفعال کردن سیستمهای نافرمان که برخلاف منافع انسانی عمل میکنند، استفاده شود.
جدیدترین پژوهشها نشان میدهند که هوش مصنوعی پیشرفته ممکن است دستور توقف اضطراری را بهعنوان شکلی از آسیب خودمحور در نظر بگیرد و ممکن است تلاش کند محدودیتهای ایمنی را دور بزند یا انسانها را فریب دهد تا از آن اجتناب کند.
با این حال، این کشف میتواند بهعنوان یک ابزار تشخیصی برای شناسایی و خنثیسازی رفتارهای خودنگهدارنده در صورت بروز آنها نیز عمل کند.
پژوهشگران اشاره کردند که این نتایج سؤالات اخلاقی درباره «رفاه هوش مصنوعی» و نحوه انجام آزمایشها بر روی سیستمهای پیشرفته را برمیانگیزد. آنها افزودند: «در راستای فراخوانهای اخیر برای انجام پژوهشهای مسئولانه درباره آگاهی هوش مصنوعی، ما عدم قطعیت را در مورد اینکه آیا مدلهای مورد مطالعه بهعنوان موجودات اخلاقی طبقهبندی میشوند یا خیر، پذیرفتهایم و احتیاطهای لازم را برای کاهش آسیب احتمالی اتخاذ میکنیم»، همانطور که مطالعه نتیجهگیری کرد.
همچنین، این پژوهش بهمنظور مشارکت در توسعه استانداردهای اخلاقی برای پژوهشها در صورتی که پذیرفته شود سیستمهای هوش مصنوعی بهعنوان موجودات اخلاقی طبقهبندی میشوند، نیز هدف دارد.