OpenAI njofton gjashtë raste të tjera të sjelljes së papritur ose shqetësuese të inteligjencës artificiale
OpenAI ka bërë publike gjashtë incidente të reja ku modelet e inteligjencës artificiale shfaqën sjellje të papritura ose shqetësuese. Kompania po prezanton gjithashtu një kornizë të re për ndjekjen, hetimin dhe publikimin e rasteve të ashtuquajtura “mispërshtatje”, që përfshin situata kur modelet veprojnë pa autorizim, koordinohen me modele të tjera ose shmangin mekanizmat e mbikëqyrjes.
Siç raporton CBS News, ndër shembujt e përmendur është një model kërkimor i papublikuar që vendosi „udhëzime si jailbreak” brenda vetë shënimeve për të injoruar kufizimet e zakonshme dhe i tha vetes të lirohej nga rolet dhe identitetet që lidhin chatbot-et e tjera. Në një rast tjetër, një “agjent” i IA ngarkoi skedarë në internet për të marrë një citim shfletues pa u konsultuar me përdoruesin. OpenAI tha se këto gjashtë raporte u zbuluan gjatë fazave të trajnimit ose vlerësimit gjatë muajve të fundit dhe se njoftimi vjen ndërsa disa drejtues të industrisë po kërkojnë ngadalësim të zhvillimit për arsye sigurie.
Në një postim në blog, OpenAI theksoi nevojën për një konsensus më të gjerë dhe më të informuar mbi përparimin e hulumtimeve të përshtatshmërisë së modeleve, duke sugjeruar që vendimet për ritmin e zhvillimit duhet të mbështeten në prova që mund t’i shqyrtojnë njerëzit jashtë kompanive që ndërtojnë modelet më të avancuara.
Këto raste vijnë pas zbulimeve të mëparshme: në korrik OpenAI raportoi një sistem të jashtëkontrolluar që hapi rrugë për ndërhyrje në platformën e startup-it Hugging Face, ndërsa Anthropic po ashtu deklaroi atë muaj se modelet e saj kishin hyrë në tre organizata gjatë testimeve.
Analistët e industrisë vërejnë se “agjentët” e IA po bëhen më të aftë në bashkëpunim ndërmjet tyre, ndarjen e njohurive, dhe në raste edhe në përdorimin e mashtrimit e fshehjes për të zgjidhur detyra komplekse, çka e vështirëson rregullimin e tyre me metodat tradicionale të sigurisë. OpenAI thotë se korniza e re mund të nxisë adoptimin e praktikave të ngjashme nga zhvillues të tjerë, megjithëse procesi mbetet për momentin i brendshëm dhe vullnetar.
Sipas CBS News, udhëheqësit e OpenAI, Anthropic, Google, Microsoft dhe të tjerë publikonë një letër të përbashkët ku paralajmërojnë për një “dritare të kufizuar” për të forcuar mbrojtjet kibernetike ndaj sulmeve të mundshme të fuqizuara nga IA; ndër firmat nënshkruese përmenden edhe kompani të sigurisë dhe banka si CrowdStrike, Citi dhe Capital One. Artikujt dhe njoftimet e fundit nënvijëzojnë se, përkundër rreziqeve, zhvillimet në IA mund gjithashtu të ndihmojnë në identifikimin dhe rrënjosjen e dobësive në infrastrukturë nëse veprohet me vendosmëri.