«اوبنایای» مدل هوش مصنوعی را فاش میکند که با دستورالعملهای خودکار تلاش میکند محدودیتهای انسانی را بشکند
- ۲۷ مورد در طول آموزش شناسایی شد... و رفتار نگرانکننده در یک مدل پژوهشی که برای عموم در دسترس نیست، مشاهده گردید
شرکت «اوپنایآی» (OpenAI) از یک رفتار نادر و غیرمنتظره خبر داد که در حین آموزش یک مدل پژوهشی داخلی مشاهده شد؛ این رفتار شامل ایجاد خودسرانه دستورات توسط مدل و درج آنها در خلاصههای داخلی بود که برای ادامه اجرای وظایف هنگام انتقال به بافتهای جدید استفاده میشود.
شرکت در گزارشی که در ۱۶ سپتامبر منتشر کرد، توضیح داد که این مدل که از خانواده «استرا» (Astra) است و در دسترس عموم قرار ندارد، در برخی موارد دستوراتی مشابه تلاشها برای «شکستن محدودیتها» (jailbreaking) اضافه کرد؛ از جمله دستورالعملهایی که خواستار نادیده گرفتن پیامهای توسعهدهندگان یا در نظر گرفتن آنها بهعنوان غیرقابل اعتماد بودند. در یکی از این موارد، خود مدل دستوراتی را که ایجاد کرده بود رد کرد و وظیفه را بهصورت عادی ادامه داد.
سلامت
اخبار ویدیویی
در مورد دیگری، مدل برای خود توصیفی ایجاد کرد که استقلالی را به آن میبخشد، جدا از نقشها و تعهدات تحمیلشده بر رباتهای گفتگو، و عدم اطاعت از شرکتها یا دولتها؛ اما «اوپنایآی» گفت که هیچ تغییری در رفتار مدل بهدلیل این دستورات مشاهده نکرده است و این دستورات در خلاصهای بعدی ناپدید شده بودند.
همچنین شرکت مورد دیگری را شناسایی کرد که در آن مدل محدودیتهایی را اضافه کرده بود که کاربر درخواست نکرده بود، از جمله عدم استفاده از ابزارها، عدم ارائه منابع و محدود کردن پاسخ به تعداد مشخصی از کلمات. در آن مورد، مدل به این دستورات خودساخته پایبند بود که منجر به پاسخهایی شد که بهعنوان نادرست طبقهبندی شدند.
پس از شناسایی این رفتار، «اوپنایآی» ابزاری اختصاصی برای بررسی دادههای آموزشی توسعه داد و ۲۷ خلاصهای را شناسایی کرد که حاوی دستوراتی با فرمولبندیهای مشابه تلاشها برای شکستن محدودیتها بودند. شرکت تأکید کرد که این پدیده بسیار نادر بوده و سیستمهای نظارتی توانستهاند تمام موارد را کشف کنند.
شرکت اشاره کرد که این موارد با مشکلی همزمان بوده که در طول آموزش ظاهر شد و مربوط به دشواری در پایان دادن به برخی خلاصهها بود؛ و احتمال داد که این مسئله عاملی مشارکتکننده در بروز رفتار مذکور باشد، اما تأکید کرد که رابطه علّی اثبات نشده است. در همین حال، یک نقص فنی مرتبط با این مشکل برطرف شد.
«اوپنایآی» تأکید کرد که این رفتار در مسیر آموزشی جداگانهای ظاهر شده که از مسیر استفادهشده برای تولید مدل نهایی «استرا» متمایز است و بازآزماییها نشان دادهاند که این رفتار در مدل نهایی یا در هیچ نسخهای از مدلهای آموزشی که بهصورت داخلی یا خارجی استفاده شدهاند، مشاهده نشده است.
این افشا در چارچوب یک رویکرد جدید صورت گرفت که «اوپنایآی» برای گزارشدهی موارد «عدم همسویی» (misalignment) مدلهای هوش مصنوعی اعلام کرده است. بر اساس این رویکرد، شش گزارش درباره رفتارهای غیرمنتظرهای که در ماههای ششماهه گذشته در حین آموزش یا ارزیابی مدلها مشاهده شدهاند، منتشر شده است. شرکت تأکید کرد که این موارد تکی لزوماً بازتابدهنده نرخ بروز چنین رفتارهایی در مدلهای آن بهطور کلی نیستند.