Առանց գրաքննության AI՝ որպես ծառայություն. ցածրացած շեմ հարձակվողների համար
ԱՄՆ մի ստարտափ այժմ վաճառում է API-հասանելիություն բաց մոդելների, որոնցից հեռացված են մերժման մեխանիզմները։ Ահա թե ինչ է սա նշանակում փոքր բիզնեսների համար, և կարճ ստուգացանկ՝ այս ամսվա համար։
Բաց AI մոդելից անվտանգության զտիչներ հեռացնելը ժամանակին սիրողական նախագիծ էր։ Այժմ դա ապրանք է, որը կարելի է գնել քարտով։ Ինչպես հայտնում է The Decoder-ը, ԱՄՆ Abliteration.ai ստարտափը վերցնում է բաց մոդելներ, խմբագրում է դրանց սովորեցված մերժումները և վաճառում է հասանելիությունը կոմերցիոն API-ի միջոցով։ Փոքր բիզնեսի համար հետաքրքիրը տեխնոլոգիան չէ, այլ այն, որ համոզիչ խարդախության նյութ ստեղծելու համար անհրաժեշտ ծախսն ու հմտությունը կրկին իջել են։
Ինչն է իրականում փոխվել
Տեխնիկան կոչվում է abliteration։ Փոխանակ խորամանկ հրահանգով խաբել մոդելին, գործընթացը գտնում է ներքին օրինաչափությունները, որոնք ստիպում են մոդելին «ոչ» ասել, և կարգավորում է կշիռները՝ դրանք ճնշելու համար։ Արդյունքում ստացվում է մոդել, որը շատ ավելի հազվադեպ է մերժում զգայուն հարցումները, մինչդեռ ծրագրավորման և գործակալային կարողությունները հիմնականում մնում են անձեռնմխելի, ըստ ընկերության սեփական գնահատականների։
Փոփոխված մոդելները հրապարակային մոդել-հանգույցներում շրջանառվում են արդեն տարիներ։ Նորը փաթեթավորումն է։ Abliteration.ai-ը կշիռները ներբեռնման համար չի հրապարակում։ Այն ինքն է հյուրընկալում մոդելը և վաճառում է հասանելիությունը՝ հինգ դոլար մեկ միլիոն մուտքային կամ ելքային տոկենի դիմաց, այնպես որ հաճախորդին ոչ GPU է պետք, ոչ էլ մեքենայական ուսուցման հմտություններ։ Հայտարարված շուկան հարձակողական անվտանգության աշխատանքն է՝ red teaming, չարամիտ ծրագրերի վերլուծություն, հայտնի խոցելիությունների վերարտադրում, ֆիշինգի սիմուլյացիա։ Ընկերությունն ասում է, որ վաղ պահանջարկը եկել է ընկերություններից, որոնք թեստավորում են խոշոր կազմակերպությունների և բանկերի կողմից տեղակայված AI գործակալները։
Մնացած պաշտպանական սահմանափակումները բարակ են։ TechCrunch-ը հայտնել է, որ ստացել է Chrome-ում պահված գաղտնաբառեր հանելու կոդ և վտանգավոր հարուցիչ մշակելու մանրամասն ուղեցույց՝ առանց մեծ դժվարության։ Որոշ սահմանափակումներ մնում են ուժի մեջ, այդ թվում՝ ինքնավնասման հարցումները և երեխաների հետ կապված սեռական բովանդակությունը։ Հրահանգներն ու պատասխանները չեն պահվում, ինչը պաշտպանում է իրավաչափ անվտանգության թիմերին, բայց նաև նշանակում է, որ չկան մատյաններ, որոնք կարելի է ստուգել, եթե ծառայությունը չարաշահվում է։ Մատակարարը չի պահանջում սովորական ինքնության կամ փաստաթղթի ստուգում՝ պնդելով, որ նման ստուգումները հուսալիորեն չեն տարանջատի «լավ» և «վատ» օգտատերերին և կվնասեն ավելի փոքր անվտանգության ընկերություններին։
Արժե նշել՝ անվտանգության մասնագետների միջև կոնսենսուս չկա, թե արդյոք այս ամենն անհրաժեշտ է։ Մի քանի red-team մատակարարներ TechCrunch-ին ասել են, որ abliterated մոդելները իրենց սովորական աշխատանքի մաս չեն, և մի վերլուծություն ցույց է տվել, որ չփոփոխված նախորդ մոդելն արդեն ոչինչ չէր մերժում հարձակողական անվտանգության թեստերում։ Abliteration.ai-ը նաև միակը չէ. այլ մատակարարներ էլ են հյուրընկալում նմանապես անսահմանափակ մոդելներ։ Պատմությունը միտումն է, ոչ թե մեկ ընկերությունը։
Ինչու է սա կարևոր փոքր բիզնեսի համար
Ոչ ոք առանց գրաքննության մոդել չի գնում հատուկ տասը հոգանոց ընկերության դեմ ուղղորդված հարձակման համար։ Ռիսկը անուղղակի է և էժան՝ ավելի լավ գրված ֆիշինգ նամակներ, ավելի հավանական հաշիվ-ապրանքագրեր, ավելի մաքուր տեղայնացված տեքստ ձեր հաճախորդների բոլոր օգտագործած լեզուներով, և ավելի արագ գրված սցենարային հարձակումներ՝ սահմանափակ հմտություններ ունեցող մարդկանց կողմից։ Հին պաշտպանությունները, որոնք հենվում էին կոտրված քերականությունը կամ վատ ֆորմատավորված փաստաթուղթը նկատելու վրա, այլևս չեն աշխատում։
Երկրորդ հետևանքն այն է, որ ձեր սեփական AI-ի հետ շփվող համակարգերն իրենք են դառնում հարձակման մակերես։ Եթե դուք ունեք չաթբոտ, որը կարող է փնտրել պատվերներ, փոխել հասցեներ կամ վերադարձնել գումարներ, ինչ-որ մեկը վաղ թե ուշ կփորձի ստուգել՝ արդյոք հնարավոր է համոզել այն անել այն, ինչ չպետք է անի։ Բանկերում գործակալները թեստավորողները հենց դա են անում, միտումնավոր։
Ինչ անել այս մասին
- Գրավոր ձևակերպեք վճարման հաստատման կանոն։ Բանկային տվյալների ցանկացած փոփոխություն, ցանկացած նոր մատակարարի հաշիվ, ցանկացած անսովոր փոխանցում ստուգվում է երկրորդ անձի կողմից՝ մի ալիքով, որով հարցումը չի ուղարկվել։ Հեռախոսահամար, որն արդեն ունեիք, ոչ թե նամակից վերցված։
- Դադարեք ձայնն ու տեսքը ինքնության ապացույց համարել։ Ձայնը հեռախոսազանգում, ծանոթ դեմքը տեսազանգում, ստորագրությունը նամակի ստորին մասում — ոչ մեկը չի հաստատում, թե ում հետ եք իրականում խոսում։ Համաձայնեցրեք հետզանգի ընթացակարգ կամ ընդհանուր ծածկագիր բարձր արժեքով հարցումների համար, և թող աշխատակիցները դա օգտագործեն՝ առանց տակտից դուրս զգալու։
- Թույլ տվեք ձեր թիմին դանդաղեցնել։ Ուսուցանեք ընթացիկ իրականությանը՝ խարդախության հաղորդագրություններն այժմ լավ գրված են, ձեր լեզվով ճիշտ, ու հաճախ վկայակոչում են իրական մանրամասներ։ Ուշադրության արժանի ազդանշանն է հրատապության զգացումն ու գումարի, մուտքի կամ մուտքային տվյալների հարցումը միասին։
- Ստուգեք, ինչ իրավունքներ ունեն ձեր բոտերն ու AI գործակալները։ Հնարավորության դեպքում՝ միայն կարդալու։ Վերադարձները, զեղչերը, հասցեների փոփոխությունը և տվյալների արտահանումը թողեք մարդկային հաստատման տակ, մատյանով՝ ով ինչ է հաստատել։
- Միացրեք մատյանավարումն ու բազմագործոն նույնականացումը, եթե դեռ չեք արել։ Եթե ինչ-որ բան սխալ գնա, վատ օրվա և վատ եռամսյակի տարբերությունը հենց նրանում է, թե կարո՞ղ եք տեսնել՝ ինչ է եղել։
Ուղղությունը հաստատուն է, ոչ թե դրամատիկ։ Կարողությունները, որոնք ձեռք բերելը ժամանակին ծանր էր, դառնում են ծառայություններ, և ծառայություններն էժանանում են։ Դուք չեք կարող վերահսկել այս հավասարման այդ կողմը, ուստի օգտակար աշխատանքը ձեր սեփական կողմում է. ավելի քիչ մեկ անձի հաստատումներ, ավելի քիչ գործողություններ, որ ավտոմատացված համակարգը կարող է կատարել առանց հսկողության, և թիմ, որին հստակ ասված է, որ լավ գրված հաղորդագրությունը վստահելի հաղորդագրություն չէ։
ԱղբյուրԳրված է The Decoder-ի նյութի հիման վրա։ Բնօրինակը՝ Stripping safety guardrails from open-weight AI models is now a turnkey commercial service ↗