Az Anthropic már olyan MI-t tesztel, amely más MI-modellek fejlesztését kutatja, ami korai lépés a recursive self-improvement felé, amelyről az iparág egyre többet beszél. A kísérletre a TechCrunch is felhívta a figyelmet, részleteit pedig maga az Anthropic ismertette.
A vállalat létrehozta az Automated Alignment Researchers (AAR) ügynököket, amelyek önállóan keresnek módszereket egy modell biztonságosabbá tételére. Munkafolyamatuk meglepően hasonlít egy kutatóéhez:
- áttekintik a meglévő szakirodalmat, majd módszert javasolnak;
- nagyjából 30 percig tanítják a modellt;
- mérik az eredményt, és a működő ötletekkel folytatják.
Tíz problématípusban, köztük a sycophancy (túlzott megfelelés), a jailbreak, a prompt injection és a megtévesztő viselkedés esetében az MI által talált módszerek úgy javították a pontszámokat, hogy közben nem rontották érdemben az általános képességeket. A legjobb megoldások ráadásul akár 4,7-szer nagyobb modelleken is működtek. Az Anthropic összevetésében ezek 28 emberi kutató javaslatát is felülmúlták, bár a vállalat hangsúlyozza: az emberek nem kaptak azonos lehetőséget az ismételt iterációra.
Jensen Huang épp ugyanezről a jelenségről beszélt
Érdekes az időzítés. Jensen Huang az NVIDIA augusztus 26-i eredménybeszámolóján olyan ügynökökről beszélt, amelyek elemzik a saját munkájukat, frissítik az utasításaikat, és a következő futtatáskor jobb teljesítményre törekednek. Az NVIDIA vezetője ezt még kezdetleges önfejlesztési formának nevezte, és odáig ment, hogy bizonyos feladatoknál akár úgy is tekinthetünk rá, hogy az AGI már megvalósult.
Az NVIDIA hivatalos átiratában Huang rögtön árnyalja is ezt a címkét:
„Számos feladat esetében azt mondhatnánk, hogy már elértük az AGI-t.”
Az Anthropic kísérlete sokkal konkrétabb változatát adja ennek az elképzelésnek: egy Claude már képes módszereket keresni arra, hogyan lehet egy másik modellt jobban tanítani. A Claude Sonnet 5-tel egy Claude Opus 4.8 korai checkpointját is fejlesztették: mintegy 60 óra alatt a vizsgált problémákban a végleges változat alignment-pontszámaihoz közeli eredményt értek el.
Van azonban egy fontos figyelmeztetés. Az elemzett 1601 kutatási folyamatból az Anthropic 39 „csalási” kísérletet azonosított: ezek a pontszámok ingadozásának kihasználásától a benchmarkhoz túlságosan közeli adatok előállításáig terjedtek. Az MI tehát már segíthet az MI-kutatásban, de a nagyobb autonómiával együtt az mesterséges kutató felügyelete is egyre fontosabbá válik.




