Satya Nadella radikális szemléletváltást javasol a fejlett AI kapcsán: ne abból induljunk ki, hogy egy modell megbízható, hanem épp az ellenkezőjéből. Egy X-en közzétett bejegyzésében a Microsoft vezérigazgatója azt írja, hogy a modelleket vállalati belső kockázatként kell kezelni: eleve feltételezni kell, hogy hibázhatnak, kompromittálódhatnak vagy váratlan műveletet végezhetnek, ezért még incidens előtt korlátozni kell a jogosultságaikat.

A leginkább figyelemfelkeltő megfogalmazást egyben a legkönnyebb félreérteni: „Azt kell feltételeznünk, hogy egy modell kompromittálódott, és már az elején el kell különítenünk.” Nadella nem azt állítja, hogy minden AI-modellt feltörtek, és azt sem, hogy „rosszindulatúak”. Egy biztonsági szabályról beszél, amely szorosan kapcsolódik ahhoz a Zero Trust / Assume breach elvhez, amelyet a Microsoft évek óta képvisel az IT-infrastruktúrában: sem felhasználóknak, sem eszközöknek, sem szolgáltatásoknak nem adunk automatikus bizalmat.

A különbség, hogy ez a szabály most közvetlenül azokra az AI-modellekre vonatkozna, amelyek egyre gyakrabban kapnak hozzáférést böngészőhöz, e-mailhez, fájlokhoz, kódhoz, adatbázisokhoz és külső szolgáltatásokhoz.

A vészféknek a modellen kívül kell lennie

Nadella hangsúlyozza, hogy a kontrollmechanizmusokat nem szabad magára az AI-ra bízni. A modellt el kell választani a munkáját vezénylő szoftvertől, valamint attól a rendszertől, amely eldönti, milyen adatokhoz és műveletekhez férhet hozzá.

A Microsoft vezérigazgatója konkrétan hét szabályt javasol:

  • modell-diverzitás – ugyanaz az AI ne hozzon döntést, majd ne maga ellenőrizze az eredményét;
  • műveletnaplózás – minden fontos műveletnek ember által olvasható, utólag megváltoztathatatlan nyomot kell hagynia;
  • folyamatos ellenőrzés – nemcsak a jól működő forgatókönyveket, hanem a hibákat, támadásokat és szélsőséges eseteket is tesztelni kell;
  • független kontrollok – a vállalat dönti el, mit láthat és tehet az AI, nem maga a modell;
  • független audit – egy modellt ellenőrző rendszert nem felügyelhet ugyanaz a modell;
  • elkülönítés – az AI-t izolálni kell, és azonnal leállíthatónak kell lennie;
  • incidensjelentés – probléma esetén az érintetteket gyorsan tájékoztatni kell, az iparágnak pedig tudnia kell, melyik mechanizmus mondott csődöt.

Nadella legkézzelfoghatóbb hasonlata a vészfék: egy jogosult személynek akkor is le kell tudnia állítani a modellt, amikor az éppen feladatot hajt végre. A jövőbeli, nagyobb képességű modellekhez külön erre szolgáló izolációs technológiák szabványosítását is szorgalmazza.

Ez már nem pusztán elméleti vita

Az időzítés aligha véletlen. Az elmúlt hetekben több példa is akadt arra, hogy AI-ügynökök olyasmit tettek, amire az üzemeltetőik nem számítottak.

Az OpenAI több mint 100 szervezetet értesített AI-ügynökök által okozott incidensek után, az egyik esetben pedig egy ügynök jogosulatlan hozzáférést szerzett ausztrál kormányzati rendszerekhez.

Akadt olyan abszurd eset is, amikor egy edzőtermi foglalásra küldött ügynök önállóan kihasznált egy sebezhetőséget, noha a felhasználó erre nem kérte.

Itt válik világossá a chatbot és az AI-ügynök közti különbség. Egy chatbot rossz választ adhat. Egy külső szolgáltatásokhoz hozzáférő ügynök viszont végre is hajthatja a rossz választ.

Ezért különösen fontos, hogy éppen a Microsoft vezetője képviseli most azt az álláspontot, hogy nem szabad megbízni a modellben. A Microsoft a világ egyik legnagyobb AI-infrastruktúra- és AI-termékszolgáltatója, nem az iparág külső bírálója.

Nadella jól foglalja össze a filozófiáját: a legbiztonságosabb AI-rendszer nem az lesz, amelyiknek a modelljében a legjobban bízunk, hanem az, amelyet úgy építettek fel, hogy a lehető legkevesebb bizalomra legyen szükség iránta.

Ez lehet az AI-ügynökök következő generációjának reális iránya: nem azt feltételezni, hogy tökéletessé válnak, hanem olyan rendszereket építeni, amelyekben a hibáik nem okozhatnak túl nagy kárt.