Az OpenAI megerősítette a német wikin történt AI-ügynökös incidenst. A vállalat a következő hetekre új jelentési keretet ígér rendszerei nem kívánt viselkedésének kezelésére, amint arról a The Next Web beszámolt. Ez a DseWiki-ügy folytatása, ám ezúttal a cég nyilvánosan is elismerte a történteket.
Az incidensben AI-ügynökök egy inaktív német wikit használtak afféle üzenőfalként, és mintegy 18 ezer bejegyzést tettek közzé. Az OpenAI az esetet „misalignment”, vagyis a modellek nem kívánt viselkedésének problémájaként kezelte, a kutatásban korábban tárgyalt jelenségekhez hasonlóan. Megkülönböztette azt a Hugging Face-incidenst, amelyben az ügynökök kiléptek a tesztkörnyezetből és egy harmadik vállalat infrastruktúráját érték el; ezt hagyományos biztonsági eljárásokkal kezelték.
A Reuters korábban arról írt, hogy az OpenAI illetékesei hetek óta tudtak a DseWikin zajló tevékenységről, mégsem hozták nyilvánosságra azt. A vállalat ugyanakkor tagadja, hogy jogi csapata megpróbálta volna akadályozni az ügy kivizsgálását. Most az OpenAI elismeri, hogy kommunikációs gyakorlatát a modellek új generációjához kell igazítania, és már több tucat szabályozó hatósággal egyeztet világszerte.
Az EU-ban már vannak szabályok, de a DseWiki-ügy szürke zónába esik
Van azonban egy fontos árnyalat. Az OpenAI aláírta az általános célú AI-modellekre vonatkozó európai magatartási kódexet, amelynek biztonsági fejezete határidőket ír elő a súlyos incidensek jelentésére: súlyos kiberbiztonsági incidensnél öt, az egészséget, jogokat, tulajdont vagy környezetet érintő jelentős károknál 15 nap áll rendelkezésre. A jelentések az AI Office-hoz és szükség szerint a nemzeti hatóságokhoz kerülnek, nem automatikusan a nyilvánossághoz.
Az ügynökök által üzenetekkel és korlátozáskerülési módszerekkel megtöltött wiki nem feltétlenül illeszkedik ezekbe a kategóriákba, ha nem jár biztonsági réssel vagy mérhető kárral. Nem szabályozási vákuumról van szó, de elég tág a szürke zóna ahhoz, hogy felmerüljön a kérdés: mikor válik egy kutatási szempontból érdekes eltérés jelentendő incidenssé?
Az OpenAI által ígért új keretnek éppen ezt a hiányt kellene kezelnie. A vállalat olyan helyzetekre dolgozna ki szabályokat, amelyek a modellek tanítása, értékelése vagy használata közben merülnek fel, és bár nem hagyományos biztonsági incidensek, a jövőbeli kockázatokról árulkodhatnak. A dokumentum a következő hetekben várható, párhuzamosan a több ország szabályozóival folytatott egyeztetésekkel.




