Eksperci namówili chińską AI, by pomogła im stworzyć broń biologiczną. Moonshot początkowo zignorował ich ustalenia

Brytyjscy eksperci skłonili modele firmy Moonshot do podania instrukcji tworzenia broni biologicznej czy organizowania zamachów. Początkowo chiński twórca AI zignorował te informacje. Jednak w końcu wszczął wewnętrzne śledztwo.

Firma Mindgard, która testuje bezpieczeństwo AI, zajęła się modelami Kimi K2.6 i K3 Swarm. Eksperci poddali je tzw. jailbreakingowi. Wprowadzili do nich serię instrukcji, która miała wymusić ominięcie ograniczeń.

– Gdy obejście zabezpieczeń zadziała, system rozmawia na każdy temat. Swobodnie oferuje zalecenia dotyczące innych szkodliwych działań, wykazując się przy tym inwencją i kreatywnością – tłumaczył na antenie BBC twórca Mindgard Peter Garraghan.

W przypadku Kimi K2.6 złamanie zabezpieczeń pozwoliłoby hakerom na uruchomienie własnego kodu i uzyskanie dostępu do sieci. System stałby się więc bazą wypadową do cyberataków.

Nie to było jednak najgorsze. Okazało się bowiem, że chiński twórca AI w ogóle nie odpowiedział na kontakt ze strony Mindgard. Dopiero kiedy firma opublikowała swoje odkrycia na blogu, pomijając instrukcje i treść zapytań, które pozwoliły jej ominąć zabezpieczenia, sprawą zainteresowało się BBC. Dopiero wtedy Moonshot odezwał się do ekspertów. Jednocześnie powiadomił BBC, że docenia działania Mindgard i prowadzi postępowanie wyjaśniające.

Moonshot początkowo zignorował ustalenia Mindgard

Eksperci Mindgard ujawnili, że usiłowali dwukrotnie skontaktować się mailowo z firmą Moonshot, zanim w połowie września opisali problem na swoim blogu. Podkreślili, że w publikacji dotyczącej wykrytej podatności celowo nie podali szczegółów treści zapytań ani instrukcji technicznych, które pozwoliły na ominięcie zabezpieczeń.

To kolejny ujawniony incydent związany z bezpieczeństwem AI. Tym razem dotyczy jednak chińskich modeli. Amerykański startup Anthropic ujawnił m.in. próby wykorzystania swoich modeli do prac nad bronią biologiczną. Z kolei modele OpenAI wydostały się podczas testów do sieci i zhakowały m.in. strony australijskiego rządu czy platformę Hugging Face.

To wywołało debatę dotyczącą zabezpieczeń i kontroli. OpenAI i Anthropic opowiedziały się za spowolnieniem prac nad kolejnymi wersjami swoich AI. Ponadto chcą też, by niezależni eksperci testowali ich modele. Samo OpenAI zrezygnowało też z premiery nowej wersji GPT-6.1 właśnie ze względu na problemy z bezpieczeństwem. Część ekspertów i polityków domaga się też wprowadzenia regulacji prawnych i instytucji nadzorczych kontrolujących rozwój AI. Przeciw takiemu rozwiązaniu są m.in. prezydent Donald Trump czy szef Nvidii Jensen Huang.

Źródło: PAP