Az OpenAI bemutatta a GPT-6.1 Sol modellt, a GPT-6 Sol frissítését, amely összetett feladatoknál programozásban, dokumentumelemzésben és számítógép-használatban ígér fejlődést. A vállalat több értékelésben a GPT-6 Astra közelébe pozicionálja, lényegesen alacsonyabb költség mellett.

A fókusz azokon az AI-ügynökökön van, amelyek több lépésből álló műveleteket tudnak végrehajtani: kódot írnak és hibát keresnek benne, összetett PDF-eket értelmeznek, illetve alkalmazásokban dolgoznak. Az OpenAI hivatalos dokumentációja az Astránál olcsóbb, programozási és professzionális feladatokra szánt megoldásként mutatja be.

Az OpenAI bemutatta a GPT-6.1 Solt: Astra-közeli teljesítmény alacsonyabb költséggel
Az OpenAI bemutatta a GPT-6.1 Solt: Astra-közeli teljesítmény alacsonyabb költséggel 6

A vállalat által közzétett eredmények szerint a valós projektek szoftveres problémáira épülő DeepSWE v1.1 értékelésben a GPT-6.1 Sol az Astra teljesítményét annak nagyjából ötödéért éri el. Ugyanitt 6,4 százalékponttal felülmúlja a GPT-6 Solt, alacsonyabb következtetési szintet használva.

Az AutomationBench üzleti munkafolyamatok helyes végrehajtását vizsgáló tesztjében az elődhöz képest 4,8 százalékpontos javulást ért el közepes következtetési szinten. Számítógép-használatban, az offline OSWorld 2.0 készleten hét százalékpont az előny, miközben a feladatonkénti költség kevesebb mint a fele. Ezek ugyanakkor az OpenAI saját értékeléseinek eredményei, nem minden projektre érvényes garanciák.

A modell tudományos kutatási feladatokban is előrelépést mutat: a Terminal-Bench Science 0.1 teszten, maximális következtetési szinten megduplázza a GPT-6 Sol pontszámát. Az átlagos feladatonkénti költség 5,47 dollár, szemben a Astra 23,80 dolláros értékével; az Astra továbbra is a legjobb pontszámot hozza, és a legnehezebb tudományos feladatokra ajánlott.

A tényszerűségi tesztben az legalább egy hibát tartalmazó válaszok aránya alacsony következtetési szinten 11,4%-ról 7,7%-ra csökken. Az OpenAI hangsúlyozza, hogy a teszt szándékosan nehéz, olyan beszélgetésekből vett kérdéseket használ, amelyekben a felhasználók korábban hibát jeleztek, ezért az arányok nem a hétköznapi használatot írják le.

A GPT-6.1 Sol a ChatGPT Workben és a Codexben érhető el Plus, Pro, Business, Enterprise és Edu felhasználóknak, Chat módban egyelőre nincs hozzáférés. A fejlesztők API-n keresztül, a következő néven használhatják: „gpt-6.1-sol”. Az alapdíj egymillió bemeneti tokenre 2 dollár, az újrahasznált, gyorsítótárból érkező bemenetre 0,10 dollár, egymillió generált tokenre pedig 10 dollár.

A gyorsítótáras ár így 95%-kal alacsonyabb a normál bemeneténél, ami előnyt jelenthet az azonos kontextust ismételten használó ügynököknél. Az OpenAI a következő napokra a Codexben elérhető Sol Ultrafast változatot is bejelentette, amely akár nyolcszor gyorsabb tokenkibocsátást ígér.