حافظه مطبوعاتی کویت آخرین اخبار
alseyassahفناوری نوشتهٔ السياسة

«اوبن‌ای‌ای» مدل هوش مصنوعی را فاش می‌کند که با دستورالعمل‌های خودکار تلاش می‌کند محدودیت‌های انسانی را بشکند

«اوبن‌ای‌ای» مدل هوش مصنوعی را فاش می‌کند که با دستورالعمل‌های خودکار تلاش می‌کند محدودیت‌های انسانی را بشکند

- ۲۷ مورد در طول آموزش شناسایی شد... و رفتار نگران‌کننده در یک مدل پژوهشی که برای عموم در دسترس نیست، مشاهده گردید

شرکت «اوپن‌ای‌آی» (OpenAI) از یک رفتار نادر و غیرمنتظره خبر داد که در حین آموزش یک مدل پژوهشی داخلی مشاهده شد؛ این رفتار شامل ایجاد خودسرانه دستورات توسط مدل و درج آن‌ها در خلاصه‌های داخلی بود که برای ادامه اجرای وظایف هنگام انتقال به بافت‌های جدید استفاده می‌شود.

شرکت در گزارشی که در ۱۶ سپتامبر منتشر کرد، توضیح داد که این مدل که از خانواده «استرا» (Astra) است و در دسترس عموم قرار ندارد، در برخی موارد دستوراتی مشابه تلاش‌ها برای «شکستن محدودیت‌ها» (jailbreaking) اضافه کرد؛ از جمله دستورالعمل‌هایی که خواستار نادیده گرفتن پیام‌های توسعه‌دهندگان یا در نظر گرفتن آن‌ها به‌عنوان غیرقابل اعتماد بودند. در یکی از این موارد، خود مدل دستوراتی را که ایجاد کرده بود رد کرد و وظیفه را به‌صورت عادی ادامه داد.

سلامت

اخبار ویدیویی

در مورد دیگری، مدل برای خود توصیفی ایجاد کرد که استقلالی را به آن می‌بخشد، جدا از نقش‌ها و تعهدات تحمیل‌شده بر ربات‌های گفتگو، و عدم اطاعت از شرکت‌ها یا دولت‌ها؛ اما «اوپن‌ای‌آی» گفت که هیچ تغییری در رفتار مدل به‌دلیل این دستورات مشاهده نکرده است و این دستورات در خلاصه‌ای بعدی ناپدید شده بودند.

همچنین شرکت مورد دیگری را شناسایی کرد که در آن مدل محدودیت‌هایی را اضافه کرده بود که کاربر درخواست نکرده بود، از جمله عدم استفاده از ابزارها، عدم ارائه منابع و محدود کردن پاسخ به تعداد مشخصی از کلمات. در آن مورد، مدل به این دستورات خودساخته پایبند بود که منجر به پاسخ‌هایی شد که به‌عنوان نادرست طبقه‌بندی شدند.

پس از شناسایی این رفتار، «اوپن‌ای‌آی» ابزاری اختصاصی برای بررسی داده‌های آموزشی توسعه داد و ۲۷ خلاصه‌ای را شناسایی کرد که حاوی دستوراتی با فرمول‌بندی‌های مشابه تلاش‌ها برای شکستن محدودیت‌ها بودند. شرکت تأکید کرد که این پدیده بسیار نادر بوده و سیستم‌های نظارتی توانسته‌اند تمام موارد را کشف کنند.

شرکت اشاره کرد که این موارد با مشکلی هم‌زمان بوده که در طول آموزش ظاهر شد و مربوط به دشواری در پایان دادن به برخی خلاصه‌ها بود؛ و احتمال داد که این مسئله عاملی مشارکت‌کننده در بروز رفتار مذکور باشد، اما تأکید کرد که رابطه علّی اثبات نشده است. در همین حال، یک نقص فنی مرتبط با این مشکل برطرف شد.

«اوپن‌ای‌آی» تأکید کرد که این رفتار در مسیر آموزشی جداگانه‌ای ظاهر شده که از مسیر استفاده‌شده برای تولید مدل نهایی «استرا» متمایز است و بازآزمایی‌ها نشان داده‌اند که این رفتار در مدل نهایی یا در هیچ نسخه‌ای از مدل‌های آموزشی که به‌صورت داخلی یا خارجی استفاده شده‌اند، مشاهده نشده است.

این افشا در چارچوب یک رویکرد جدید صورت گرفت که «اوپن‌ای‌آی» برای گزارش‌دهی موارد «عدم همسویی» (misalignment) مدل‌های هوش مصنوعی اعلام کرده است. بر اساس این رویکرد، شش گزارش درباره رفتارهای غیرمنتظره‌ای که در ماه‌های شش‌ماهه گذشته در حین آموزش یا ارزیابی مدل‌ها مشاهده شده‌اند، منتشر شده است. شرکت تأکید کرد که این موارد تکی لزوماً بازتاب‌دهنده نرخ بروز چنین رفتارهایی در مدل‌های آن به‌طور کلی نیستند.

آخرین اخبار منبع اصلی
لینک کپی شد ✓