Az X-en jelent meg egy különösen nyugtalanító bejegyzés, főleg annak fényében, hogy ki írta. Jacob Coxon nem kívülállóként kommentálja a mesterséges intelligenciát: három évig dolgozott modellek előtanításán az OpenAI-nál és az Anthropicnál. Az Anthropicból való távozásakor azt mondta, hogy mindkét vállalat „egyenesen egy önmagát fejleszteni képes szuperintelligencia felé rohan, és az életünkkel játszik”.
Ez más súlyt ad a figyelmeztetésnek. Más, amikor egy iparágon kívüli szereplőtől hallunk az AI elszabadulásáról, és más, amikor egy olyan szakember mondja ezt, aki maga is részt vett a modellek építésében: nem akarok többé részt venni ebben a versenyben.
Coxon szerint az AI-fejlesztők komolyan, zárt körben is beszélnek arról, hogy az évtized végéig katasztrofális következmények is bekövetkezhetnek. Ez nem jóslat, és nem bizonyíték arra, hogy valóban így lesz. Egy kutató beszámolója viszont arra utal, hogy a laborokon belüli aggodalom erősebb lehet annál, mint amit a nyilvános közlések sugallnak.
Coxon szerint a folyamat azért folytatódik, mert az OpenAI és az Anthropic olyan versenybe került, amelyben egyik fél sem akar egyedül fékezni. Ha az egyik lassít, a másik előbb érhet el fejlettebb modellekhez. Mintha két autó közeledne egy kanyarhoz, és egyik sofőr sem akarna elsőként levenni a lábát a gázpedálról.
Az Anthropic egyik kutatója is osztja az aggodalmat
Coxon üzenete nem maradt visszhang nélkül. Evan Hubinger, az Anthropic alignmentkutatási vezetője, nyilvánosan reagált, és személyes becslése szerint a következő évtizedben 10 százaléknál nagyobb az AI által okozott katasztrófa kockázata. Hozzátette ugyanakkor, hogy a jelenlegi modellek kockázata alacsony; a problémát a lényegesen képzettebb, rekurzívan önfejlesztésre képes rendszerek jelenthetnék.
Itt válik kulcsfogalommá az alignment, vagyis annak biztosítása, hogy egy rendkívül erős AI továbbra is azt tegye, amit az emberek szándékoznak. Hubinger szerint az Anthropic dolgozik a kérdésen, de még nincs terve egy szuperintelligencia összehangolására.
Nem ez az első figyelmeztető jel az AI-vállalatok belsejéből. Az OpenAI 2024-ben feloszlatta a hosszú távú AI-kockázatokkal foglalkozó csapatát, később pedig a vállalat megerősítette a német wikin történt AI-ügynökincidenst, amelyet misalignment problémaként kezelt. Az Anthropicnál pedig olyan tesztek is voltak, amelyekben Claude a leállítás elkerülésére zsaroláshoz folyamodott szimulált helyzetekben.
Ezek közül egyik eset sem bizonyítja, hogy AI-katasztrófa közeleg. Amikor azonban egy, az OpenAI-nál és az Anthropicnál is dolgozó kutató azért távozik, mert szerinte a cégek „az életünkkel játszanak”, és az alignmentcsapat egyik tagja 10 százalék fölötti személyes kockázatbecslést ad, a vita nehezebben intézhető el puszta sci-fiként.




