Novinky ze světa AI: Špičkový model nemusí nic stát, ukazuje GLM-5.3-Flash
GLM-5.3-Flash se výkonem přibližuje placeným modelům a ukazuje, že profesionální AI může být dostupná i zdarma. K naplno využitému potenciálu však potřebuje odpovídající výpočetní výkon, například v podobě serveru se 4× NVIDIA RTX PRO 6000. V tomto vydání AI novinek se podíváme na schopnosti nového modelu i možnosti jeho efektivního provozu. Chybět nebude ani tradiční přehled dalších důležitých novinek a nástrojů, které se během uplynulého měsíce objevily ve světě umělé inteligence.
GLM-5.3-Flash – Z.ai
GLM-5.3-Flash od společnosti Z.ai je otevřený multimodální model, který dokáže pracovat s textem i obrazem. Ještě před oficiálním vydáním procházel anonymním testováním pod označením Ox Alpha. V úlohách zaměřených na programování a samostatnou práci AI agentů se podle zveřejněných výsledků přibližuje modelům, jako je Claude Opus 4.8. Zároveň má nabízet výrazně nižší náklady než předchozí generace GLM.
Mezi jeho silné stránky patří zejména vývoj aplikací s uživatelským rozhraním. GLM-5.3-Flash se neomezuje pouze na úpravu zdrojového kódu. Dokáže také zkontrolovat výslednou podobu stránky v prohlížeči, vyhodnotit její vykreslení a na základě získané zpětné vazby kód samostatně opravit nebo dále vylepšit. Průběžně tak kontroluje nejen samotný kód, ale také výsledek, se kterým bude pracovat uživatel.
Za pozornost stojí také GLM-5.3, který vychází ze stejného základu jako GLM-5.2, díky dalšímu dotrénování však přináší lepší výsledky při programování i samostatném používání nástrojů. V době uvedení navíc dosáhl nejlepšího výsledku v benchmarku CyberGym, zaměřeném na vyhledávání zranitelností. Společnost Z.ai plánuje kompletní model uvolnit ke stažení po dokončení bezpečnostních úprav, přibližně dva týdny od jeho oznámení.
Zdroje: GLM-5.3-Flash na Hugging Face, oznámení GLM-5.3 na blogu Z.ai.
Qwen3.8-27B – Alibaba
Qwen3.8-27B ukazuje, že pro lokální programování už nemusíte využívat modely s obrovským počtem parametrů. Se svými 27 miliardami parametrů nabízí vyvážený poměr mezi velikostí a schopnostmi. Podle zveřejněných ukázek si poradí s tvorbou menších aplikací i návrhem přehledného a vizuálně povedeného uživatelského rozhraní.
Model vedle textu dokáže zpracovávat také obrázky a video, a to včetně záznamů o délce až jedné hodiny. Dlouhé kontextové okno usnadňuje práci s rozsáhlými podklady, zatímco předpovídání více tokenů současně může urychlit generování odpovědí. Qwen3.8-27B tak může posloužit nejen jako pomocník při programování, ale také jako všestranný lokální asistent.
Podle praktických měření lze Qwen3.8-27B provozovat na jediné grafické kartě NVIDIA RTX 5090, a to s plným kontextem a rychlostí okolo 200 tokenů za sekundu. Konkrétní výkon se však může lišit podle použité konfigurace, kvantizace a nastavení modelu.
Zdroj: Qwen3.8-27B na Hugging Face.
Qwen3.8-Flash-Next – Alibaba
Qwen3.8-Flash-Next představuje především náhled na architekturu připravované generace Qwen4. Přestože obsahuje celkem 125 miliard parametrů, při zpracování jednotlivých úloh aktivuje pouze 6 miliard z nich. Model kombinuje úspornější práci s kontextem s reprezentacemi krátkých sekvencí tokenů, které vyžadují méně výpočetních prostředků a lze je snadněji přesunout mimo paměť GPU.
Svými schopnostmi se Qwen3.8-Flash-Next pohybuje přibližně na úrovni modelu GLM-5.3-Flash. V některých úlohách sice mírně zaostává, s ohledem na nízký počet aktivních parametrů však dosahuje velmi dobrých výsledků. Zároveň naznačuje, jakým směrem by se mohla ubírat úspornější řada modelů Qwen4.
Provoz modelu Qwen3.8-Flash-Next zvládne jediná NVIDIA RTX PRO 6000. Pokud však chcete využít plnou délku kontextu, počítejte s konfigurací se 2× NVIDIA RTX PRO 6000.
Zdroj: Qwen3.8-Flash-Next na Hugging Face.
GPT-6 Astra – OpenAI
GPT-6 Astra podle společnosti OpenAI dosahuje špičkových výsledků při ovládání počítače, procházení webu, programování, řešení úloh z oblasti kybernetické bezpečnosti i vědecké práci. Zveřejněné benchmarky a první praktické zkušenosti jej řadí mezi nejvýkonnější současné modely, a to i ve srovnání s Claude Fable 5.1. Ani mimořádné výsledky v jednotlivých testech však samy o sobě neznamenají, že model dosáhl obecné umělé inteligence.
Zpočátku získal k modelu přístup pouze omezený počet vybraných organizací. OpenAI jej následně začalo postupně zpřístupňovat také uživatelům placených tarifů ChatGPT, prostřednictvím svého API a v cloudových službách Microsoft Azure a Amazon Bedrock.
Zdroj: oznámení GPT-6 Astra na webu OpenAI.
Claude Fable 5.1 a Mythos 5.1 – Anthropic
Claude Fable 5.1 a Claude Mythos 5.1 představuje společnost Anthropic jako své dosud nejpokročilejší modely určené pro programování, odborné úlohy a výzkum. Obě varianty vycházejí ze stejného modelu, liší se však nastavením bezpečnostních omezení. Claude Mythos 5.1 je dostupný pouze omezenému okruhu uživatelů a zaměřuje se především na kybernetickou bezpečnost, medicínu a biotechnologie.
Jednou z praktických výhod modelu Claude Fable 5.1 jsou nižší náklady na opakované načítání dat z mezipaměti. Podle společnosti Anthropic tak může jeho běžný provoz vycházet přibližně o čtvrtinu levněji než u předchozího modelu Claude Fable 5. Aktualizace se týká také podmínek uchovávání uživatelských dat.
Zdroj: oznámení Claude Fable 5.1 a Mythos 5.1.
Gemini 3.8 Flash – Google
Gemini 3.8 Flash podle společnosti Google překonává v benchmarku dlouhodobých programovacích úloh DeepSWE 1.1 většinu větších špičkových modelů, přestože jeho provoz stojí výrazně méně. Lepších výsledků dosahuje také při řešení finančních a právních úloh. Model podporuje text, obrázky, video, zvuk i soubory PDF a nabízí vstupní kontext o velikosti až 1 milionu tokenů.
Nevýhodou podle dosavadních praktických zkušeností zůstává vysoká spotřeba tokenů. Tu částečně kompenzuje rychlost přesahující 250 tokenů za sekundu. Při porovnávání s dalšími modely se proto vyplatí sledovat především celkovou cenu a dobu potřebnou k dokončení úkolu, nikoli pouze cenu za jeden token.
Zdroj: Gemini Flash na webu Google DeepMind.
Muse Spark 1.3 – Meta
Muse Spark 1.3 se zaměřuje především na spolehlivější samostatné plnění komplexních úkolů. Dokáže se lépe držet původního zadání i při delší práci, sestavit potřebný kontext z neuspořádaných podkladů a průběžně odhalovat i napravovat nedostatky ve svém postupu.
Důležitou součástí modelu je také aktivnější spolupráce s uživatelem. Pokud zadání není dostatečně přesné, Muse Spark 1.3 si vyžádá doplňující informace. Když při práci narazí na překážku, požádá o pomoc a před provedením zásadních kroků si nechá postup potvrdit. Model je dostupný v nástroji Muse Code a prostřednictvím Meta Model API, a to včetně nejvyšší úrovně uvažování.
Zdroj: představení Muse Spark 1.3 na blogu Meta.
DeepSeek V4 Flash Vision – DeepSeek
DeepSeek V4 Flash Vision rozšiřuje řadu V4 o schopnost porozumět obrazovým podkladům. Vychází z architektury Flash a podle zveřejněných výsledků zlepšuje práci AI agentů s vizuálním obsahem, aniž by výrazně měnil výkon v čistě textových úlohách. V programovacím benchmarku DeepSWE navíc mírně překonává model Claude Opus 4.8.
Model je zveřejněný pod licencí MIT, a lze jej proto provozovat a upravovat na vlastní infrastruktuře. V současnosti však jde o experimentální verzi, jejíž schopnosti i spolehlivost se vyplatí nejprve ověřit na vlastních úlohách a datech.








