OpenAI tocmai a anunțat GPT-6.1 Sol, o versiune îmbunătățită a GPT-6 Sol, orientată spre programare, utilizarea computerului și sarcini profesionale complexe. Compania susține că noul model se apropie în mai multe teste de performanțele GPT-6 Astra, dar la costuri considerabil mai mici: aproximativ o cincime din cost în anumite scenarii.
GPT-6.1 Sol este poziționat între modelul Sol anterior și Astra, cu accent pe raportul dintre performanță și preț. Principalele îmbunătățiri vizează scrierea și analiza de cod, înțelegerea documentelor complexe, automatizarea unor fluxuri de lucru cu mai mulți pași și interacțiunea cu aplicații de desktop.
GPT-6.1 Sol se apropie de Astra în coding și sarcini profesionale
În DeepSWE v1.1, benchmark pentru sarcini complexe de software engineering realizate în codebase-uri reale, GPT-6.1 Sol ajunge la nivelul GPT-6 Astra la aproximativ 20% din cost. Față de cel mai bun rezultat al GPT-6 Sol, noul model obține un scor mai mare cu 6,4 puncte procentuale, folosind în același timp un nivel mai redus de „gândire”.
OpenAI raportează îmbunătățiri și în lucrul cu documente. În GDP.pdf, un benchmark care testează capacitatea modelelor de a răspunde la întrebări folosind PDF-uri cu tabele, grafice, diagrame și informații detaliate, GPT-6.1 Sol depășește Opus 5.5 cu fallbacks la mai puțin de jumătate din costul per task și se apropie de GPT-6 Astra la aproximativ o cincime din cost.
În AutomationBench, modelul obține un rezultat cu 2,2 puncte procentuale peste Opus 5.5 la nivel mediu de reasoning, la aproximativ o treime din cost. Față de GPT-6 Sol, diferența este de 4,8 puncte procentuale în aceeași configurație.
Progrese la computer use și cercetare
GPT-6.1 Sol aduce și îmbunătățiri în sarcinile de computer use. În setul offline OSWorld 2.0, modelul depășește GPT-6 Sol cu șapte puncte procentuale la nivel maxim de gândire și ajunge la doar 2,1 puncte procentuale de rezultatul Astra, la aproximativ 1/7 din costul per sarcină.

Diferențe mai mari apar în Terminal-Bench Science 0.1, unde sunt evaluate sarcini precum analiza datelor, simulările și demonstrarea de teoreme. GPT-6.1 Sol obține un scor de peste două ori mai mare decât GPT-6 Sol la nivel maxim de gândire. Costul mediu raportat este de 5,47 dolari per task, comparativ cu 23,21 dolari pentru Opus 5.5 și 23,80 dolari pentru Astra. Astra rămâne însă modelul cu cel mai mare scor din acest test, 68,1%.
OpenAI spune că a redus și rata erorilor factuale
La nivel redus de gândire, proporția răspunsurilor care conțin cel puțin o eroare factuală a scăzut de la 11,4% în cazul GPT-6 Sol la 7,7% pentru GPT-6.1 Sol, o reducere de aproximativ 32%. OpenAI precizează însă că testul folosește conversații selectate special deoarece utilizatorii semnalaseră anterior o eroare, deci rezultatele nu sunt reprezentative pentru utilizarea obișnuită.
Compania raportează și rezultate mai bune în testele de respectare a restricțiilor utilizatorului. De exemplu, într-un test în care modelul trebuie să recunoască faptul că instrumentul de căutare nu funcționează, GPT-6.1 Sol nu semnalează problema în 2,1% dintre cazuri, față de 4,9% pentru GPT-6 Sol și 1,5% pentru Astra. OpenAI subliniază că și aceste teste folosesc situații construite pentru a provoca erori.

Preț și disponibilitate pentru GPT-6.1 Sol
GPT-6.1 Sol este disponibil începând de astăzi pentru utilizatorii Plus, Pro, Business, Enterprise și Edu în ChatGPT Work și Codex, dar nu este încă disponibil în Chat. Dezvoltatorii îl pot accesa prin API sub denumirea gpt-6.1-sol. Prețul API este de 2 dolari pentru un milion de tokeni de input, 0,10 dolari pentru un milion de tokeni de input cached și 10 dolari pentru un milion de tokeni de output.
OpenAI spune că în zilele următoare va introduce și GPT-6.1 Sol Ultrafast, cu o viteză de generare a tokenilor de până la opt ori mai mare în Codex.
