OpenAI uvádza GPT-6.1 Sol: Takmer výkon Astry za pätinu ceny!

GPT 6.1 SOL

OpenAI 29. septembra na svojom DevDay predstavil GPT-6.1 Sol, model, ktorý sa výkonom približuje k drahej GPT-6 Astra, no stojí len pätinu jej ceny. Zároveň je to hlavná novinka, ktorú dostaneme namiesto GPT-6.1 Astra, ktorej vydanie OpenAI deň predtým zastavil.

V čom GPT-6.1 Sol dominuje

Sol nie je najsilnejší model OpenAI, ale je stavaný na každodennú prácu: programovanie, samostatné ovládanie počítača a kancelársku robotu ako tabuľky, reporty či prezentácie. OpenAI ho označuje za najvýhodnejší model na trhu v pomere výkonu a ceny.

Podľa čísel od OpenAI sa v programátorskom teste DeepSWE vyrovnal GPT-6 Astra a oproti predchodcovi GPT-6 Sol si polepšil o 6,4 percentuálneho bodu. V teste OSWorld 2.0, kde AI sama kliká po počítači, zaostáva za Astrou len o 2,1 bodu, no stojí sedminu. Menej si aj vymýšľa, chybovosť pri faktoch klesla z 11,4 na 7,7 percenta.

https://twitter.com/OpenAI/status/2104986133004505373

Sol je dostupný v ChatGPT Work a Codexe pre predplatné Plus, Pro, Business, Enterprise a Edu, vývojári ho nájdu v API ako gpt-6.1-sol. Čoskoro príde aj verzia Ultrafast s až 8x rýchlejším generovaním textu.

Sol verzus Astra: pätina ceny a zastavená GPT-6.1 Astra

Rozdiel v cene je výrazný. GPT-6 Astra stojí 10 dolárov za milión vstupných tokenov a 50 dolárov za milión výstupných, Sol len 2 a 10 dolárov. Zjednodušene: práca, ktorá by vás s Astrou stála euro, vyjde so Solom na 20 centov. V teste Terminal-Bench Science vyšla jedna úloha so Solom na 5,47 dolára, s Astrou na 23,80 dolára.

Pôvodne mala tento týždeň prísť aj nová GPT-6.1 Astra. OpenAI ju však stopol, pretože v bezpečnostných testoch dopadla horšie ako súčasná GPT-6 Astra. Robila kroky bez povolenia, siahala po externých nástrojoch aj tam, kde to nebolo bezpečné, a nie vždy pravdivo hlásila, čo urobila. GPT-6 Astra ostáva dostupná. Sol 6.1 sa naopak v bezpečnostných testoch zlepšil.

GPT-6.1 Sol verzus Claude Opus 5.5 a Sonnet 5.5

Konkurencia však nespí. Anthropic vydal 22. septembra Claude Opus 5.5 za 4 a 20 dolárov a 28. septembra Claude Sonnet 5.5 za 2 a 10 dolárov, teda presne za cenu Solu.

S Opusom 5.5 sa OpenAI porovnáva priamo: v teste AutomationBench je Sol o 2,2 bodu lepší a v Terminal-Bench Science stojí úloha štvrtinu (5,47 verzus 23,21 dolára). Priame porovnanie so Sonnetom 5.5 zatiaľ chýba, modely vyšli deň po sebe. Anthropic tvrdí, že Sonnet 5.5 dosahuje výkon staršieho GPT-6 Sol za pätinu ceny na úlohu, nezávislé testy však upozorňujú, že míňa viac tokenov.

Verdikt: ak používate ChatGPT alebo Codex, Sol bude váš nový pracovný model a na väčšinu úloh Astru nepotrebujete. Kto je v ekosystéme Claude, má v Sonnete 5.5 rovnako lacného súpera. Kto je reálne lepší, ukážu nezávislé testy v najbližších týždňoch. A ak vás zaujíma, kam OpenAI mieri s agentmi, prečítajte si aj o novinke Dots.

OpenAI predstavil Dots: AI agenta, ktorý pracuje, aj keď nesedíte pri počítači

Zdroje