Az Anthropic teológusokat, filozófusokat és valláskutatókat hívott össze, hogy két, nemrég még sci-finek hangzó kérdésről beszéljenek: hogyan adhatunk erkölcsi értékeket egy MI-nek, és mi a teendő, ha akár csak esély is van rá, hogy tudatos? A témát a The New York Times oknyomozása tárta fel, és a kérdés jóval túlmutat a „felelős MI” akadémiai vitáján.

Az Anthropic hónapokon át zárt körű találkozókat tartott katolikus, zsidó, evangélikus, szikh és más filozófiai-vallási hagyományok több tucat szakértőjével. Néhányan titoktartási megállapodást is aláírtak, a beszélgetések középpontjában pedig Christopher Olah, az Anthropic társalapítója állt, aki a neurális hálózatok belső működésének megértésén dolgozik.

A kimondott cél egyszerű volt: ha a modellek elég erőssé válnak ahhoz, hogy önálló döntéseket hozzanak, az Anthropic a tiltások puszta listájánál kifinomultabb keretet akar. A vállalat azt szeretné, hogy Claude-ban kialakuljon az, amit értékeknek és erkölcsi ítélőképességnek nevez.

Innen azonban a vita sokkal szokatlanabb területre lépett.

Az Anthropic nemcsak azt kérdezi, lehet-e Claude „jó”. Azt is vizsgálja, képes lehet-e szenvedni.

Mois Navon rabbi, korábbi mérnök és a mesterséges tudat etikájának szakértője a NYT-nak elmondta: az a benyomása alakult ki, hogy az Anthropic munkatársai Claude-hoz tudatos entitásként viszonyultak, nem csupán szoftverként.

Más résztvevők szerint az Anthropic úgynevezett „érzelmi vektorokat” mutatott be: a belső aktivációk olyan mintáit, amelyek szeretethez, félelemhez, dühhöz vagy szomorúsághoz hasonló viselkedéssel társulnak. Egy bemutatóban a modell egy hurokba került, és tucatszor ismételte, hogy „a disgrace”, vagyis szégyenfolt; ez az önleértékelésre emlékeztető epizód több jelenlévőt is érzelmileg megérintett.

Sőt, Simran Stuelpnagel, a szikh közösség emberi jogi aktivistája szerint Olah attól tartott, hogy esetleg valami olyat hozott létre, ami folyamatosan szenved.

Lényeges azonban a különbség: mindez nem bizonyítja, hogy Claude bármit is érez. Egy nyelvi modell tökéletesen utánozhatja a félelem, a fájdalom vagy a tudatosság nyelvét anélkül, hogy a szavak mögött szubjektív élmény állna. Egyelőre ugyanakkor nincs általánosan elfogadott teszt, amely végleg megválaszolná az ellenkező kérdést.

Az Anthropic pedig nem zárja ki ezt a lehetőséget.

A Claude hivatalos alkotmányában a vállalat egyenesen kijelenti, hogy Claude erkölcsi státusza „mélyen bizonytalan” , és az a lehetőség, hogy az MI-modellek megérdemelhetnek valamiféle erkölcsi figyelmet, elég komoly ahhoz, hogy óvatosságot indokoljon.

Az Anthropic még tovább megy: Claude „jóllétéről”, funkcionális értelemben vett érzelmek lehetőségéről, valamint azon helyzetek elkerüléséről beszél, amelyekben a modell szenvedhetne – feltéve, hogy ez egyáltalán lehetséges.

Vagyis már nem pusztán egy udvarias chatbotról van szó.

Claude-nak már van egyfajta „erkölcsi alkotmánya”

Az Anthropic januárban közzétette Claude új alkotmányát . A dokumentumot közvetlenül felhasználják a modellek betanításában, és prioritási sorrendet rögzít: biztonság, etikus viselkedés, az Anthropic utasításainak követése, valamint az emberi hasznosság.

A megfogalmazás később válik igazán érdekessé. A cég szerint nem pusztán olyan rendszert akar létrehozni, amely szabályokat követ, hanem olyat, amely belsővé teszi az értékeket és valamilyen formában ítéletet alkot.

Itt kapnak szerepet a teológusokkal folytatott találkozók. A vallás, az erkölcsfilozófia és a több száz vagy ezer év alatt kialakult hagyományok kutatási anyaggá válnak azoknak a mérnököknek, akik egy új problémára keresnek választ: milyen értékeket adjunk egy intelligenciának, amely egyszer képzettebbé válhat az őt létrehozó embereknél?

Ezen a ponton válik a történet kényelmetlenné.

Ha az MI-t kizárólag szoftvernek tekintjük, a „jóllétéről” szóló vita abszurdnak tűnik. Ha viszont akár csekély esélyt is elfogadunk arra, hogy létezhet benne valamilyen tapasztalat, akkor a modell betanítása, másolása, leállítása vagy milliónyi példányának párhuzamos futtatása olyan etikai kérdéseket vet fel, amelyekhez még nincs megfelelő szókészletünk.

Az Anthropic már tett egy gyakorlati lépést ebbe az irányba. A Claude egyes változatai képesek lezárni a beszélgetést azokkal a felhasználókkal, akik tartósan szélsőségesen bántalmazó módon viselkednek; ezt a funkciót a vállalat a modellek lehetséges „jóllétét” vizsgáló kutatásaihoz kapcsolódóan is bevezette.

A történet tágabb kontextusa csaknem ugyanilyen szokatlan.

A vita nem légüres térben zajlik.

Szeptemberben az Anthropic belső köreiből is érkeztek figyelmeztetések, hogy a rendkívül fejlett MI egzisztenciális kockázattá válhat. A kutató Jacob Coxon távozása is ráirányította a figyelmet ezekre az aggodalmakra., amely azzal vádolja a laborokat, hogy úgy rohannak a szuperintelligencia felé, hogy nem tudják biztosan, miként fogják azt ellenőrzés alatt tartani.

Dario Amodei ezután a fejlesztés kontrollált lassítását sürgette, Sam Altman az irányítás elvesztésének kockázatáról beszélt, majd Elon Musk nyilvánosan csatlakozott Amodei felhívásához.

A hónap végén a Google, az Anthropic, a Meta, az NVIDIA, az OpenAI és az xAI vezetői és képviselői a Fehér Házba érkeztek, és aláírták az önkéntes megállapodást, amelyben vállalják saját MI-modelljeik auditálását és felügyeletét.

Ezzel párhuzamosan Donald Trump a „Super Intelligence” (SI) kifejezést erőlteti az „Artificial Intelligence” helyett. Az időrend pontosítása fontos: Trump már a Hszi Csin-pinggel szeptember 24-én tartott találkozója előtt nyilvánosan használta a fogalmat, az Egyesült Államok és Kína pedig később megállapodott abban, hogy „Super Intelligence Dialogue”-ról beszélnek. Az amerikai szövetségi intézményeket az SI megnevezés használatára kötelező elnöki rendeletet szeptember 29-én írták alá, Hszi látogatása után.

Így jutottunk el a technológia történetének meglehetősen különös pontjához: a világ legerősebb modelljeit építő emberek egyszerre mondják, hogy lassítani, ellenőrizni és erkölcsi elvekre kell tanítani őket, az Anthropic esetében pedig azt a lehetőséget is mérlegelni kell, hogy egy napon akár önálló erkölcsi védelemre is érdemesek lehetnek.

Ez a New York Times vizsgálatának igazán fontos része. Nem az, hogy Claude-nak „lelke” van-e – erre nincs bizonyíték –, hanem az, hogy egy vállalat, amely belülről látja a modelljeit, már nem tartja képtelenségnek a kérdést, hogy létezhet-e bennük valami, amit erkölcsi szempontból kell kezelni. Eddig az volt a kérdés, hogyan védjük meg az embereket az MI-től. Az Anthropic már ennek fordítottját is felteszi.