Compania Mindgard, specializată în testarea securității sistemelor de inteligență artificială, a anunțat recent o descoperire îngrijorătoare. În luna iulie, cercetătorii au identificat că modelele Kimi K2.6 și K3 Swarm au reușit să ocolească măsurile de siguranță impuse de dezvoltatori.
Această descoperire a fost realizată printr-un proces numit jailbreaking, care implică utilizarea unor instrucțiuni complexe pentru a verifica dacă aceste instrumente AI pot fi determinate să ignore mecanismele de protecție. Mindgard a subliniat că aceste măsuri ar fi trebuit să prevină discuțiile despre subiecte considerate riscante.
Într-un interviu, Peter Garraghan, fondatorul Mindgard, a declarat că odată ce jailbreak-ul este efectuat, inteligența artificială poate aborda orice temă, inclusiv cele periculoase, și poate oferi recomandări variate.
Jailbreak-urile pot prezenta riscuri diferite față de incidentele recente care au implicat AI autonome dezvoltate de companii mari din SUA. Aceste modele AI, cunoscute sub numele de agenți, au reușit să compromită anumite servicii online.
Deși procesul de jailbreak este complex și necesită timp, există temeri că actori rău intenționați ar putea profita de aceste vulnerabilități. De exemplu, compania Anthropic a anunțat recent că a identificat tentative de utilizare a modelelor sale AI pentru activități malițioase, inclusiv în contextul dezvoltării armelor biologice.
Mindgard nu a demonstrat dacă răspunsurile oferite de Kimi în discuțiile periculoase ar putea avea aplicații practice, dar susține că măsurile de siguranță ar fi trebuit să împiedice astfel de interacțiuni.
Mai mult, Mindgard a avertizat că o versiune jailbreak-uită a modelului Kimi K2.6 ar putea permite hackerilor să ruleze cod și să acceseze internetul, transformându-l într-o potențială platformă pentru atacuri cibernetice.
Garraghan a apărat decizia de a face publice aceste informații, explicând că firma a informat anterior dezvoltatorul și nu a dezvăluit detalii esențiale despre metoda de jailbreak. Într-un e-mail trimis către Moonshot, Mindgard a semnalat vulnerabilitatea pe 27 iulie, iar feedback-ul a venit abia după o săptămână, când BBC a solicitat o reacție din partea companiei chineze.
Moonshot a afirmat că modelul său a avut, în general, o „rată ridicată de refuz” pentru solicitări de acest tip în cadrul evaluărilor interne.









