
Společnost OpenAI spustila pro svůj vlajkový čip GPT-5.6 Sol nový ultrarychlý režim , který slibuje čtrnáctinásobné zvýšení rychlosti zpracování. Toto vylepšení jde nad rámec jednoduchého vylepšení výkonu; jeho cílem je eliminovat tradiční kompromis mezi rychlostí a kapacitou a poskytnout téměř okamžité odezvy bez kompromisů v inteligenci nejpokročilejšího modelu společnosti.
Nová technologie, která je v současné době k dispozici v náhledové verzi pro vybranou skupinu zákazníků, využívá infrastrukturu společnosti Cerebras, výrobce čipů specializujícího se na inferenci umělé inteligence. Podle údajů poskytnutých společností OpenAI dokáže systém generovat až 750 tokenů za sekundu , což je čtyřikrát více než většina současných komerčních modelů a posouvá tuto technologii na novou úroveň v rámci odvětví.
Skok v rychlosti bez obětování modelu
Dosavadní dosažení rychlé odezvy obvykle znamenalo uchýlit se k menšímu nebo specializovanějšímu modelu, což je kompromis, kterému se OpenAI snažila u Ultrafastu vyhnout. Místo vytvoření zjednodušené verze se společnost rozhodla zrychlit stejný GPT-5.6 Sol a ponechat jeho schopnosti uvažování a generování textu nedotčené. To znamená, že vývojáři a společnosti používající API si budou moci užívat minimální latence, aniž by obětovali kvalitu výsledků.
Rychlost 750 tokenů za sekundu znamená, že odstavec odpovědi je vygenerován za méně než sekundu, takže interakce je prakticky okamžitá. Tato funkce je obzvláště cenná v aplikacích, kde se počítá každá milisekunda, jako je algoritmické obchodování, zákaznická podpora s velkým objemem dotazů nebo reakce na bezpečnostní incidenty. OpenAI zdůrazňuje, že rychlost již nevyžaduje obětování inteligence , což je sdělení, které rezonovalo s uživateli prvních verzí.
Infrastruktura Cerebras, klíč k výkonu
Tajemství technologie Ultrafast spočívá ve spolupráci se společností Cerebras, jejíž procesor Wafer-Scale Engine integruje 44 GB SRAM a udržuje váhy modelů blízko výpočetních jednotek. Tato architektura drasticky snižuje pohyb dat mezi externí pamětí a procesorem, což je jedno z hlavních úzkých míst při odvozování velkých modelů. Podle společnosti váhy zůstávají na čipu, zatímco tokeny procházejí vrstvami , což umožňuje zpracovat stovky tokenů za sekundu bez degradace.
Integrace se společností Cerebras nejen prospívá OpenAI, ale také představuje milník pro výrobce čipů, jehož infrastruktura podporuje hraniční model v rámci komerční služby. I když kapacita zůstává omezená, obě společnosti potvrdily, že přístup rozšíří, jakmile budou k dispozici zdroje. V současné době je Ultrafast nabízen pouze prostřednictvím API a není dostupný na ChatGPT, což OpenAI jasně uvedla ve své tiskové zprávě.
Případy užití určené pro kritická prostředí
OpenAI identifikovala několik scénářů, kde nízká latence hraje významnou roli. Patří mezi ně reakce na incidenty , kdy agent může analyzovat protokoly, kontrolovat trasování a navrhovat řešení, i když je výpadek stále aktivní; finanční výzkum , který vyžaduje zpracování tržních signálů v reálném čase; a zákaznický servis , kde konverzace probíhají hladce bez znatelných zpoždění. Zmíněn je také elektronický obchod s personalizovanými doporučeními a správou zásob v reálném čase.
Společnosti jako Jane Street, Podium, Basis a Rogo již testují Ultrafast v aplikacích souvisejících s programováním, obchodem a podporou. První výsledky naznačují, že zkrácení času stráveného na každém úkolu může transformovat procesy, které dříve probíhaly v nočních dávkách, na nepřetržité iterace po celý den . OpenAI však upozorňuje, že konečný výkon závisí na složitosti každého pracovního postupu, včetně externích nástrojů a volání databáze, takže číslo 750 tokenů za sekundu je pouze referenčním bodem pro maximální rychlost generování.
Omezená dostupnost a další kroky
Ultrafast je v současné době ve fázi omezeného náhledu a OpenAI neoznámila datum jeho všeobecné dostupnosti. Společnost potvrdila, že přístup se bude s rostoucí kapacitou rozšiřovat , ale prozatím si jej může aktivovat pouze vybraná skupina zákazníků. Veřejná cena této nové úrovně služeb také nebyla zveřejněna, což je pro firmy klíčový faktor pro posouzení, zda snížená latence ospravedlňuje dodatečné náklady.
OpenAI tvrdí, že Ultrafast ve srovnání s konkurencí překonává režim Claude Fast od Anthropic, který však stejných rychlostí nedosahuje. Tento rozdíl by se mohl stát rozhodujícím faktorem pro organizace, které se spoléhají na téměř okamžité odezvy. Vývojáři si mezitím již představují aplikace, které byly dříve nepraktické kvůli čekacím dobám, od generování kódu v reálném čase až po interaktivní textové hry.
Stručně řečeno, příchod Ultrafastu představuje zlom v závodě o nejrychlejší umělou inteligenci na trhu. Díky spolupráci se společností Cerebras a přístupu, který nedělá kompromisy ve výkonu modelu, si OpenAI jasně stanovila nový standard v oblasti nízké latence. Ačkoli ceny a všeobecná dostupnost jsou stále v hledáčku, preview již ukazuje, že rychlost může jít ruku v ruce s inteligencí a že sekundy ušetřené u každého úkolu mají v podnikových prostředích skutečnou hodnotu.
