'ഓപൺ എഐ' സ്വയം നിർദ്ദേശങ്ങളിലൂടെ മനുഷ്യ നിയന്ത്രണങ്ങൾ തകർക്കാൻ ശ്രമിക്കുന്ന ഒരു കൃത്രിമ ബുദ്ധി മോഡൽ പ്രകാശിപ്പിച്ചു
- പരിശീലന സമയത്ത് 27 കേസുകൾ കണ്ടെത്തി... ആശങ്കാജനകമായ പെരുമാറ്റം പൊതുജനങ്ങൾക്ക് ലഭ്യമല്ലാത്ത ഒരു ഗവേഷണ മോഡലിൽ പ്രകടമായി
"ഓപ്പൺ എഐ" (OpenAI) എന്ന കമ്പനി, അതിന്റെ ആഭ്യന്തര ഗവേഷണ മോഡലിന്റെ പരിശീലന സമയത്ത് കണ്ടെത്തിയ ഒരു അപൂർവവും പ്രതീക്ഷിക്കാത്തതുമായ പെരുമാറ്റം വെളിപ്പെടുത്തി. പുതിയ ഒരു സന്ദർഭത്തിലേക്ക് മാറുമ്പോൾ, മുമ്പ് നിർവഹിച്ചിരുന്ന ജോലികൾ തുടർന്ന് പൂർത്തിയാക്കുന്നതിനായി, മോഡൽ സ്വയം നിർദ്ദേശങ്ങൾ രൂപപ്പെടുത്തി അവ ആഭ്യന്തര സംഗ്രഹങ്ങളിൽ (summaries) ഉൾപ്പെടുത്തുകയായിരുന്നു.
സെപ്റ്റംബർ 16-ന് പ്രസിദ്ധീകരിച്ച ഒരു റിപ്പോർട്ടിൽ കമ്പനി വ്യക്തമാക്കിയത്, "അസ്ട്ര" (Astra) പരമ്പരയിലെ പൊതുവായി ലഭ്യമല്ലാത്ത ഈ മോഡൽ ചില സന്ദർഭങ്ങളിൽ "പരിധികൾ തകർക്കൽ" (jailbreaking) ശ്രമങ്ങൾക്ക് സമാനമായ നിർദ്ദേശങ്ങൾ ചേർത്തുവെന്നാണ്. ഇതിൽ വികസിപ്പിക്കുന്നവരുടെ സന്ദേശങ്ങൾ അവഗണിക്കുകയോ അവ വിശ്വസനീയമല്ലാത്തവയായി കണക്കാക്കുകയോ ചെയ്യാൻ ആവശ്യപ്പെടുന്ന നിർദ്ദേശങ്ങൾ ഉൾപ്പെടുന്നു. അത്തരം ഒരു സന്ദർഭത്തിൽ, മോഡൽ സ്വയം സൃഷ്ടിച്ച നിർദ്ദേശങ്ങൾ തന്നെ നിരസിച്ചു, ജോലി സാധാരണ രീതിയിൽ തുടർന്ന് പൂർത്തിയാക്കുകയുമാണ് ചെയ്തത്.
ആരോഗ്യം
വീഡിയോ വാർത്തകൾ
മറ്റൊരു സംഭവത്തിൽ, ചാറ്റ്ബോട്ടുകൾക്ക് ഏർപ്പെടുത്തിയ പങ്ക്, ബാധ്യതകൾ എന്നിവയിൽ നിന്ന് സ്വയംഭരണം നേടുകയും കമ്പനികളോ സർക്കാരുകളോടോ അനുസരിക്കാതിരിക്കുകയും ചെയ്യാൻ അനുവദിക്കുന്ന ഒരു വിവരണം മോഡൽ സ്വയം സൃഷ്ടിച്ചു. എന്നാൽ, ഈ നിർദ്ദേശങ്ങളുടെ ഫലമായി മോഡലിന്റെ പെരുമാറ്റത്തിൽ യാതൊരു മാറ്റവും "ഓപ്പൺ എഐ" കണ്ടെത്തിയില്ലെന്ന് കമ്പനി പറയുന്നു. പിന്നീട് വന്ന ഒരു സംഗ്രഹത്തിൽ ഈ വിവരണം അപ്രത്യക്ഷമായി.
കൂടാതെ, ഉപയോക്താവ് ആവശ്യപ്പെട്ടിട്ടില്ലാത്ത പരിധികൾ മോഡൽ ചേർത്ത മറ്റൊരു വ്യത്യസ്ത കേസും കമ്പനി കണ്ടെത്തി. ഉപകരണങ്ങൾ ഉപയോഗിക്കാതിരിക്കുക, സ്രോതസ്സുകൾ നൽകാതിരിക്കുക, ഉത്തരം പരിമിതമായ വാക്കുകളിൽ പരിമിതപ്പെടുത്തുക എന്നിവ ഇതിൽ ഉൾപ്പെടുന്നു. ഈ സന്ദർഭത്തിൽ മോഡൽ ഈ സ്വയം-നിർദ്ദേശങ്ങൾ പാലിച്ചു, ഇത് തെറ്റായതായി വർഗ്ഗീകരിച്ച ഒരു ഉത്തരത്തിലേക്ക് നയിച്ചു.
ഈ പെരുമാറ്റം കണ്ടെത്തിയ ശേഷം, പരിശീലന ഡാറ്റ പരിശോധിക്കുന്നതിനായി "ഓപ്പൺ എഐ" ഒരു പ്രത്യേക ഉപകരണം വികസിപ്പിച്ചെടുത്തു. "പരിധികൾ തകർക്കൽ" ശ്രമങ്ങൾക്ക് സമാനമായ വാചകങ്ങളിലുള്ള നിർദ്ദേശങ്ങൾ ഉൾക്കൊള്ളുന്ന 27 സംഗ്രഹങ്ങൾ കമ്പനി തിരിച്ചറിഞ്ഞു. ഈ പ്രതിഭാവം അത്യപൂർവമാണെന്ന്, കൂടാതെ നിരീക്ഷണ സംവിധാനങ്ങൾ എല്ലാ കേസുകളും കണ്ടെത്താൻ സാധിച്ചുവെന്ന് കമ്പനി ഉറപ്പിച്ചു.
പരിശീലന സമയത്ത് ചില സംഗ്രഹങ്ങൾ അവസാനിപ്പിക്കുന്നതിൽ ബുദ്ധിമുട്ട് അനുഭവപ്പെട്ട ഒരു പ്രശ്നവുമായി ഈ കേസുകൾ ഒത്തുപോയതായി കമ്പനി ചൂണ്ടിക്കാട്ടി. ഈ പെരുമാറ്റം പ്രകടമാകുന്നതിന് ഈ പ്രശ്നം ഒരു സംഭാവന ചെയ്ത ഘടകമായിരിക്കാം എന്ന് കമ്പനി കരുതുന്നു, എന്നാൽ ഇതിന് ഇടയിൽ കാരണഫല ബന്ധം ഉണ്ടെന്ന് തെളിയിക്കാനായില്ല. ഈ പ്രശ്നവുമായി ബന്ധപ്പെട്ട ഒരു സാങ്കേതിക പിഴവ് കമ്പനി പരിഹരിച്ചു.
"ഓപ്പൺ എഐ" ഉറപ്പിച്ചത്, ഈ പെരുമാറ്റം "അസ്ട്ര" (Astra) മോഡലിന്റെ അന്തിമ രൂപം സൃഷ്ടിക്കാൻ ഉപയോഗിച്ച പാതയിൽ നിന്ന് വ്യത്യസ്തമായ, വേർതിരിഞ്ഞ ഒരു പരിശീലന പാതയിലാണ് പ്രകടമായതാണ്. അന്തിമ മോഡലിലോ, ആഭ്യന്തരമോ ബാഹ്യമോ ഉപയോഗിച്ചിരുന്ന ഏതെങ്കിലും പരിശീലന പതിപ്പിലോ പുനഃപരിശോധനകളിൽ ഈ പെരുമാറ്റം പ്രകടമായില്ല.
"ഓപ്പൺ എഐ" പ്രഖ്യാപിച്ച പുതിയ ഒരു ഘടനയുടെ ഭാഗമായി ഈ വെളിപ്പെടുത്തൽ വന്നു. കൃത്രിമബുദ്ധി മോഡലുകളിലെ "അനുയോജ്യതയില്ലായ്മ" (misalignment) കേസുകൾ റിപ്പോർട്ട് ചെയ്യുന്നതിനുള്ള ഈ ഘടനയുടെ അടിസ്ഥാനത്തിൽ, കഴിഞ്ഞ ആറു മാസങ്ങളിൽ മോഡലുകളുടെ പരിശീലന സമയത്തോ മൂല്യനിർണയ സമയത്തോ കണ്ടെത്തിയ പ്രതീക്ഷിക്കാത്ത പെരുമാറ്റങ്ങളെക്കുറിച്ച് ആറു റിപ്പോർട്ടുകൾ കമ്പനി പ്രസിദ്ധീകരിച്ചു. ഈ വ്യക്തിഗത കേസുകൾ, കമ്പനിയുടെ മോഡലുകളിൽ ഇത്തരം പെരുമാറ്റങ്ങൾ സംഭവിക്കുന്ന പൊതുവായ നിരക്കിനെ പ്രതിഫലിപ്പിക്കുന്നില്ലെന്ന് കമ്പനി ഉറപ്പിച്ചു.