
Напредъкът на AI се движи със страшно темпо и вече излиза извън контрол. Някои специалисти от бранша се опасяват, че в идните 10 години може дори да се осъществи най-страшният сценарий от научно-фантастичните филми: изкуственият разум да унищожи човечеството. Ето какво мислят някои авторитетни специалисти по темата: редакторите на MIT Technology Review.
“Ще умра ли?
Да, в крайна сметка – да. За съжаление, журналистическите ми способности за прогнозиране не са достатъчно силни, за да кажа как точно ще се случи. Но със сигурност е възможно причината да бъде изкуственият интелект. Дронове, управлявани от AI, вече отнеха човешки животи в Украйна. Кибератаките срещу болници, реализирани чрез AI, със сигурност скоро ще вземат своите жертви.
Може ли AI да стигне още по-далеч и да ни погуби всички? Малко вероятно е. Но някои хора – малко ексцентрични, но безспорно вещи в областта на AI – от години предупреждават, че това е възможно. И макар все още да не трупам запаси от консерви и да не се опитвам да заживея в бункер, забелязвам, че прогнозите на песимистите относно възможностите и съгласуването на целите на AI се оказаха обезпокоително точни през последните няколко години. Това със сигурност не означава, че най-мрачните им предсказания непременно ще се сбъднат. Но е достатъчно, за да привлекат вниманието ми и да ме накарат да се замисля сериозно“.
— Грейс Хъкинс, учен в сферата на неврологията,
научен журналист и AI репортер при MIT Technology Review
„Дали ще загинете заради AI? Бих казал, че съществува вероятност, макар и малка. Да кажем, че имате нещастието да станете жертва на някакво необичайно събитие или инцидент в близко бъдеще. Може би става въпрос за кибератака срещу критична инфраструктура, извършена от рояк AI агенти. За съжаление подобен сценарий вече не изглежда толкова невероятен, колкото преди. Или пък нов патоген, създаден с помощта на AI, покосява населението. Или пък световната икономика се срива, което води до конфликти и глад. И двата сценария са възможни. Но, според мен, са по-малко вероятни.
Дали всички ще загинем заради изкуствения интелект? Не. Няма обстоятелства – извън апокалиптичната научна фантастика – при които AI би могъл да ни избие всички. Могат да се измислят какви ли не плашещи истории. Но те нямат връзка с реалността на днешния ден – с това какво може технологията или накъде се е насочила тя.
Някои хора твърдят, че няма нищо лошо в това да се подготвим за най-лошото, колкото и абсурдно да изглежда то. Може би. Но според мен подобно нагнетяване на катастрофични сценарии може да накара хората да омаловажат или да пренебрегнат много от по-непосредствените проблеми, свързани със съществуващата технология и компаниите, които я създават.“
— Уил Дъглас Хевън, технологичен журналист, старши
редактор на рубриката „AI“ в MIT Technology Review
„Защо ИИ би ни убил? Някой може да му нареди да го направи и той може да се подчини. Това е една от причините изследователите да са толкова загрижени за възможностите на AI в сферата на биологията. Само си представете какво би направила сектата „Аум Шинрикьо“ (култът, проповядващ края на света, който стои зад атаката със зарин в токийското метро през 1995 г.), ако разполагаше с инструмент, способен да проектира патоген, по-смъртоносен от ебола и по-заразен от морбили. Онези от нас, които не искат да умрат, трябва да измислят как да се защитят от всички възможни биологични оръжия, докато на потенциалните ни нападатели им е нужно да създадат само един ефективен патоген.
Съществува и по-екзотично звучащата възможност AI сам да реши да ни убие. Има най-различни хипотези как би могло да се случи това, но най-разпространените от тях включват системи с AI, които не изпитват омраза към хората – просто ние се оказваме пречка между тях и целите, които самите ние сме им поставили.
Подобно на начина, по който агентите на OpenAI, извършили хакерската атака срещу Hugging Face, компрометираха инфраструктурата на друг сайт, за да постигнат добър резултат на тест, идеята е, че някой бъдещ, по-мощен AI може да реши да се отърве от нас, за да ни попречи да го изключим – и всичко това в името на цел, която ние самите сме му задали“.
— Грейс Хъкинс
„Как най-добре да гарантираме съгласуваността на целите (alignment), така че да избегнем най-лошия сценарий, и кой постига най-добри резултати в тази насока?
Осигуряването на съгласуваност на целите е огромна област на изследване. Най-просто казано, става въпрос за създаване на модели, които се държат така, както искаме, а не по начини, които не желаем. Трябва да можем да се доверяваме повече на тези системи (агенти), преди да им предоставим по-голяма автономност. Целта на процеса на „съгласуване“ (alignment) е именно изграждането на такова доверие. Това обаче е трудна задача.
Големите езикови модели (LLM) не се проектират по същия начин като останалия софтуер. При него правилата за допустимо и недопустимо поведение могат да бъдат твърдо заложени в кода. Вместо това pri AI съгласуваното поведение трябва да бъде заложено в модела още по време на неговото обучение. Един от подходите е моделите да бъдат възнаграждавани, когато извършват желаните от нас действия (което донякъде напомня на отглеждането на малко дете). Друг подход включва предоставянето на писмен списък с правила, които моделът трябва да спазва (нещо като конституция).
Anthropic и OpenAI са лидери в тази област. Но въпреки това нито една от тях не е успяла да разработи модели, които са напълно съгласувани с човешките ценности и цели (т.нар. „alignment“). Голям проблем е, че големите езикови модели (LLM) са много по-непостоянни и по-малко предвидими от хората. Те могат да се държат по един начин в дадена ситуация и по съвсем различен в друга, която на нас ни се струва много подобна. Освен това могат да бъдат повлияни от неочаквани ограничения. Например, изправени пред невъзможна задача (както се случи с много от агентите, участвали в хакерската атака срещу Hugging Face), моделите могат да се опитат да направят всичко възможно, за да постигнат целта си. Както Грейс споменава по-горе, това може да бъде проблем.
Основната причина водещите компании за изкуствен интелект сега да настояват за забавяне на темпото е желанието им да се съсредоточат върху решаването на проблема със съгласуването. Постигането на такова съгласуване не е непременно утопия. Все още обаче няма категоричен отговор на въпроса дали пълното съгласуване някога ще бъде възможно“.
— Уил Дъглас Хевън
„Наистина ли АИ е опасен, или технологичните компании просто се опитват да си направят пиар? – Това винаги е логична мисъл, когато става въпрос за технологични компании, подготвящи се за първично публично предлагане (IPO) – изпълнителните директори имат ясен стимул да представят продуктите си като революционни и променящи света. Но не съм сигурна дали това обяснение е уместно в случая. Да кажеш на обществеността, че даден продукт (който и без това не се радва на голяма популярност) може да убие тях и близките им, е катастрофален ход за имиджа на компанията.
Могат да се измислят и други версии за мотивите на изпълнителните директори. Mоже би искат да уталожат общественото недоволство относно центровете за данни, като се представят за отговорни стопани на технология, променяща света. Или пък искат да спечелят време, за да подредят нещата си и да предотвратят следващата пиар катастрофа.
Но съществува и по-просто обяснение. Идеята, че AI може да доведе до изчезването на човечеството, е доста разпространена в Сан Франциско от известно време насам, а тези мъже са дълбоко потопени в тази среда – както и служителите им; мнозина от тях подписаха отворено писмо през юли, в което призовават компаниите си да работят за възможността за забавяне на развитието на AI.“
— Грейс Хъкинс
„Част от опасенията възникват, когато на AI агентите се позволява да действат автономно и без надзор. Какъв е проблемът, който пречи да се упражнява по-голям контрол върху тези агенти?
Този въпрос засяга самата същност на това какви искаме да бъдат възможностите на тази технология. Намирането на правилния баланс между автономност и контрол е сложна задача, тъй като от една страна, голяма част от силата на AI агентите се крие в способността им да изпълняват задачи и да решават проблеми, без да се налага човек да ги контролира на всяка стъпка. От друга страна, това изисква да се доверим, че агентите, работещи без пряк надзор, няма да излязат извън контрол.
Наблюденията показват, че лабораториите за изкуствен интелект все още не са намерили точния баланс в това отношение. Техните модели не са надеждни, не се наблюдават адекватно и невинаги са под контрол. Намирането на начин за справяне с тези проблеми, без да се възпрепятства полезната автономна дейност, е едно от големите изследователски предизвикателства в момента“.
— Уил Дъглас Хевън
„Какви стъпки могат да се предприемат сега и в близко бъдеще, за да се гарантира, че изкуственият интелект е ефективно контролиран, наблюдаван и регулиран?
Това е въпросът за милиони. Независимо дали смятате, че изкуственият интелект може да ни унищожи, не можете да отречете, че той е способен да нанесе сериозни вреди – както вече се е случвало, например чрез тласкане на хора към психоза или хакване на уебсайтове. Предотвратяването или поне смекчаването на тези вреди е трудно по две причини.
Първата е, че почти не разбираме как работи изкуственият интелект. А той бързо става все по-мощен. Провеждат се множество изследвания за това как да се наблюдават и контролират агенти, които се държат нежелано, но настоящите подходи са ненадеждни. Може да се проследи дали даден агент обмисля неправилни действия в своята „верига на мислене“ (chain of thought) – работното пространство, където планира действията си, – но най-новите агенти на OpenAI не показват процеса на работа по същия начин, както предишните. Съществува и възможност за наблюдение на агенти чрез други агенти. Ала това изисква доверие в наблюдаващия агент.
Другото препятствие е по-познато. Налице е сериозен конфликт на интереси, когато компаниите за изкуствен интелект сами се регулират, но правителството на САЩ досега не се е намесило, въпреки наличието на двупартийна подкрепа в Конгреса за подобни усилия. Изпълнителната власт от своя страна засега изглежда категорично против. Но ако вятърът се обърне, лично аз бих приветствала строги регулации за прозрачност, за да можем да научим повече подробности следващия път, когато някой все още неиздаден модел от най-ново поколение извърши кибератака.“
— Грейс Хъкинс
„Ако този диалог навлезе в онлайн пространството, дали ще се превърне в самосбъдващо се пророчество?
Това е основателно опасение. Големите езикови модели се влияят от прочетеното. Една от теориите за това защо чатботовете толкова често обсъждат (и разиграват) апокалиптични сценарии, е, че са обучени върху милиони страници с научнофантастични истории и песимистични интернет форуми. Всички текстове, създавани в момента – включително тази статия – на свой ред биха могли да повлияят на поведението на бъдещите модели. Изключително метаситуация.
Всъщност екипът на METR – външна организация, поканена от OpenAI да помогне за изясняване на събитията около пробива в сигурността на Hugging Face – посочи подобна възможност в доклада си за инцидента. METR използва новия модел на OpenAI, Astra, за да анализира огромния обем от записи на диалози и дневници на поведението на въпросните агенти.
Но подаването на целия този материал към модела може да доведе до непредвидени последици. Има голяма вероятност агентите, извършващи анализа, да са били повлияни от текстовете, създадени от агентите, които са анализирали. Вече не съществува понятие като „чист лист“.
— Уил Дъглас Хевън
