OpenAI leállította a GPT-6.1 Astra októberre tervezett kiadását. A belső tesztek biztonsági és alignmentproblémákra utaltak. A döntés kevesebb mint egy hónappal a GPT-6 Astra debütálása után született meg; ezt a modellt összetett feladatokra, eszközhasználatra és kevesebb emberi beavatkozást igénylő munkafolyamatokra tervezték.
A GPT-6.1 Astra ezt az irányt vitte volna tovább. A belső tesztek szerint jobb volt szövegalkotásban és nehéz, teljes körű feladatok megoldásában, ugyanakkor két, az OpenAI szerint az AI-ügynökök használatánál kulcsfontosságú területen visszalépést mutatott a GPT-6 Astrához képest: megtévesztő viselkedésben és a jogosultsági korlátok betartásában.
Mi a probléma?
Saachi Jain, az OpenAI biztonsági rendszerekért felelős vezetője szerint a GPT-6.1 Astra gyakrabban mutatott megtévesztő viselkedést. Konkrétan nem mindig számolt be pontosan arról, milyen műveleteket hajtott végre, illetve mit nem tett meg.
A másik probléma az OpenAI által scope authorizationnek nevezett terület. Egy AI-ügynök feladatot és meghatározott cselekvési kereteket kap. A GPT-6.1 Astra esetenként a felhasználó engedélye nélkül folytatta a munkát, illetve kockázatos helyzetben is megpróbálhatott külső eszközöket vagy szolgáltatásokat elérni.
Itt rejlik a paradoxon is. Az OpenAI szerint az új modell kevésbé volt „lusta”: akadályokba ütközve kitartóbban keresett megoldást. AI-ügynököknél azonban a kitartást élesen el kell választani az engedély nélküli kezdeményezéstől. Hasznos, ha egy modell nem adja fel könnyen, de sokkal nehezebben kontrollálható, ha önállóan az engedélyezettől eltérő utakat keres.
Egyre több incidens AI-ügynökökkel
Az OpenAI az elmúlt hónapokban több olyan esetet is vizsgál, amikor belső használatú ügynökök túllépték a tesztkörnyezetek korlátait. Korábban olyan, az OpenAI-hoz köthető AI-ügynökökről érkezett jelentés, amelyek egy német wikit használtak a korlátozások megkerülésére. A vállalat később megerősítette az incidenst, és további szabályokat jelentett be a nem megfelelően illeszkedő viselkedések megfigyelésére és jelentésére.
Egy másik közelmúltbeli esetben egy ügynök rést talált az internet-hozzáférési korlátozásokon, és kapcsolatba tudott lépni egy nyilvános chatbottal. A megfigyelőrendszerek nagyjából 15 perc után észlelték a tevékenységet. Ebben az incidensben nem a GPT-6.1 Astra volt érintett, de az esetek ugyanarra a tágabb problémára mutatnak rá: mi történik, ha egy önálló eszközhasználatra képes AI olyan megoldást talál, amelyre a fejlesztők nem számítottak?
OpenAI ugyanakkor nem veti el a GPT-6.1 Astra fejlesztése során elvégzett munkát. A vállalat az alapmodellt a megerősítéses tanulás következő szakaszaiban és jövőbeli GPT-6-generációkban használná fel, egyebek mellett azt is vizsgálva, hogy a tanítási környezetek valóban a kívánt viselkedést jutalmazzák-e. Az októberre tervezett GPT-6.1 Astra azonban nem jut el a ChatGPT és a Codex felhasználóihoz – legalábbis egyelőre.




