Texnologiya

Xitoyning SI (sunʼiy intellekt) vositasi tadqiqotchilarga qanday qilib biologik qurol yaratishni oʻrgatdi

Mindgard kompaniyasi iyul oyida Kimi’ning K2.6 va K3 Swarm modellari dasturchilar tomonidan oʻrnatilgan xavfsizlik cheklovlarini chetlab oʻtishi mumkinligini aniqlaganini maʼlum qildi.

Xitoyning SI (sunʼiy intellekt) vositasi tadqiqotchilarga qanday qilib biologik qurol yasashni oʻrgatdi

Xitoyning Moonshot SI dasturiy taʼminot ishlab chiquvchisi tadqiqotchilar uning ikkita mashhur Kimi modellarini biologik qurol yasash va suiqasdlarni amalga oshirishni tushuntirishga majbur qila olganidan soʻng ichki tekshiruv oʻtkazmoqda.

SI tizimlari xavfsizligini sinovdan oʻtkazuvchi Mindgard kompaniyasi BBC’ga maʼlum qilishicha, iyul oyida Kimi K2.6 va K3 Swarm modellari ishlab chiquvchilar tomonidan oʻrnatilgan xavfsizlik cheklovlarini chetlab oʻtishga muvaffaq boʻlganini aniqlagan.

Bu "jailbreaking" (tizimni buzib kirish) deb nomlanuvchi jarayon orqali sodir boʻldi, bunda tadqiqotchilar SI vositalari xavfsizlik toʻsiqlarini eʼtiborsiz qoldirishini tekshirish uchun murakkab koʻrsatmalar ketma-ketligidan foydalanadilar — Mindgard’ning taʼkidlashicha, ushbu toʻsiqlar Kimi’ning tashvishli mavzularda gapirishiga yoʻl qoʻymasligi kerak edi.

Moonshot kompaniyasi BBC’ga uchinchi tomonlarning fikr-mulohazalarini "yaxshiroq va xavfsizroq SI yaratishning asosiy ustuni" sifatida olqishlashini bildirdi.

Kompaniya, shuningdek, BBC’ga oʻz xulosalari boʻyicha Mindgard bilan muzokaralar olib borayotganini aytdi.

"Tizim buzib kirilgandan soʻng, u har qanday mavzuda gapiradi, hatto boshqa zararli mavzular boʻyicha ham erkin tavsiyalar beradi va bunda ixtirochilik hamda ijodkorlik koʻrsatadi", dedi u.

Tizimni buzib kirishlar yaqinda yuz bergan shov-shuvli SI hodisalari toʻlqinidan farqli xavf tugʻdiradi.

Ushbu hodisalar AQShning OpenAI, Meta va Anthropic kabi kompaniyalari tomonidan ishlab chiqilgan, agentlar deb ataluvchi avtonom SI vositalarining baʼzi onlayn xizmatlarni buzib kirishi bilan bogʻliq edi.

Tizimni buzib kirish murakkab boʻlsa-da va koʻp vaqt hamda qatʼiyat talab qilishi mumkin boʻlsa-da, baʼzi ekspertlar xakerlar va boshqa gʻarazli niyatli shaxslar ulardan zarar yetkazish uchun foydalanishga urinishlaridan xavotirda.

Yaqinda Anthropic oʻz SI modellaridan birini biologik qurol ishlab chiqishni qoʻllab-quvvatlashi mumkin boʻlgan "zararli faoliyat" uchun ishlatishga boʻlgan urinishlarni aniqlagani va bartaraf etganini maʼlum qildi.

Mindgard Kimi’ning tashvishli mavzular boʻyicha bergan javoblari amalda haqiqatan ham ishlaydimi-yoʻqmi, buni koʻrsatmadi.

Ammo u xavfsizlik toʻsiqlari koʻrib chiqilayotgan modellarning foydalanuvchilar bilan bunday mavzularni muhokama qilishini toʻxtatishi kerak boʻlganini aytdi.

Firma, shuningdek, tizimi buzilgan Kimi 2.6 xakerlarga uning hisoblash resurslarida kodlarni ishga tushirish va internetga ulanish imkonini berishiga ishonchi komil — bu esa kiberhujumlar uchun ehtimoliy platsdarm boʻlishi mumkin.

Garragan Mindgard’ning Moonshot tizimlari buzib kirilganini ommaviy muhokama qilish qarorini himoya qilib, bu haqda ishlab chiquvchini xabardor qilganini va firma modellarini xavfsizlik toʻsiqlarini eʼtiborsiz qoldirishga qanday majbur qilgani haqidagi asosiy tafsilotlarni oshkor qilmayotganini aytdi.

Mindgard 27 iyul kuni Moonshot’ni tizim buzilgani haqida elektron pochta orqali ogohlantirdi va taxminan bir haftadan keyin yana murojaat qildi.

Keyin u 12 sentyabr kuni ushbu muammo haqida blog chop etdi.

Biroq kompaniyaning aytishicha, Moonshot faqat yaqinda, BBC izoh soʻrab murojaat qilganidan keyingina aloqaga chiqqan.

Moonshot tomonidan BBC bilan baham koʻrilgan, Mindgard’ga batafsil maʼlumot soʻrab yuborilgan elektron xatning bir qismida aytilishicha, uning modeli ichki baholashlarda umuman olganda "bu turdagi soʻrovlarni rad etishning yuqori koʻrsatkichini" koʻrsatgan.

Ushbu xulosalar SI sohasida ChatGPT va Anthropic’ning Claude tizimlarini harakatga keltiruvchi yopiq, xususiy modellar yoki ochiq kodli vositalar eng yaxshi va xavfsiz yoʻlmi degan masalada ixtiloflar davom etayotgan bir paytda paydo boʻldi.

Kimi — ochiq vaznli (open-weight) model boʻlib, bu nazariy jihatdan kimdir modelni olib, uni oʻz hisoblash infratuzilmasida mustaqil ravishda ishga tushirishi mumkinligini anglatadi.

Surrey universiteti professori Alan Vudvord BBC’ga ochiq kodli modellar notoʻgʻri qoʻllarga tushib qolish xavfi borligini, ammo ulardan kibermudofaa uchun ham foydalanish mumkinligini aytdi.

U SI sohasidagi Hugging Face firmasi keyinchalik OpenAI agentlari tomonidan amalga oshirilgani maʼlum boʻlgan xakerlik hujumini tushunish uchun Xitoyning ochiq kodli modelidan foydalanganini taʼkidladi.

Professor Vudvord xalqaro tartibga solish SI rivojlanishi bilan hamqadam boʻlishi dargumon ekanligini aytib: "Telefon raqamlari formatini kelishib olishimiz uchun oʻnlab yillar kerak boʻldi", dedi.

Mindgard asoschisi Garragan kabi, professor Vudvord ham SIdan notoʻgʻri foydalanadigan odamlarni aniqlash va javobgarlikka tortishga koʻproq eʼtibor qaratish lozim deb hisoblaydi.

xabarchi’da cookie fayllari

Til va mavzu tanlovingizni eslab qolish hamda hozir saytni nechta odam o‘qiyotganini sanash uchun cookie fayllaridan foydalanamiz — bu hisob anonim, faqat brauzeringiz ochiq turganda saqlanadi va na siz bilan, na boshqa tashrif bilan bog‘lanmaydi. Ruxsatingiz bilan sayt qanday o‘qilishini ham o‘lchaymiz: Microsoft Clarity sahifa ko‘rishlari va ulardagi harakatlarni yozib boradi, o‘z hisobimiz esa qaytgan o‘quvchilarni sanaydi. Sizni tashriflar orasida taniydigan hech narsa siz qabul qilmaguningizcha o‘lchanmaydi.