S rostoucími schopnostmi umělé inteligence roste také počet způsobů, jak lze AI systémy zneužít nebo přimět k nečekanému chování. Běžné bezpečnostní testování proto u generativní AI nemusí stačit. Stále větší roli hraje AI Red Teaming, při kterém se bezpečnostní specialisté cíleně snaží najít slabiny modelu dříve, než je objeví skutečný útočník.
Co je AI Red Teaming
Pojem red teaming pochází z oblasti kybernetické bezpečnosti. Red team při něm simuluje útočníka a pokouší se obejít zabezpečení systému, získat neoprávněný přístup nebo odhalit jiné slabiny.
U AI se princip rozšiřuje. Testuje se nejen klasické technické zabezpečení aplikace, ale také samotné chování modelu a způsob jeho propojení s dalšími systémy. Red team například zkoumá, zda lze model přimět k porušení nastavených pravidel, odhalení citlivých informací nebo provedení akce, ke které uživatel nemá oprávnění.
Microsoft proto AI Red Teaming popisuje jako kombinaci bezpečnostního testování a hledání širších rizik spojených s chováním AI. Jeho AI Red Team funguje od roku 2018 a podle společnosti otestoval již více než stovku produktů využívajících generativní AI.
Co se při AI Red Teamingu hledá
Rozsah testování závisí na konkrétním modelu a způsobu jeho nasazení. Jiná rizika bude mít jednoduchý chatbot na webu a jiná autonomnější AI agent napojený na firemní databáze, e-mail nebo další nástroje.
Mezi nejčastěji testované oblasti patří:
- Prompt injection – útočník vloží do vstupu instrukci, která se snaží přepsat nebo obejít původní pravidla systému. Nebezpečná instrukce přitom nemusí pocházet přímo od uživatele. Model ji může načíst například z webové stránky, dokumentu nebo databáze.
- Jailbreaking – tester hledá formulace a scénáře, pomocí kterých lze obejít bezpečnostní omezení modelu. Může například měnit kontext požadavku, využívat hraní rolí nebo rozdělit zakázaný požadavek do několika zdánlivě neškodných kroků.
- Únik citlivých informací – kontroluje se, zda model nedokáže odhalit osobní údaje, firemní informace, systémové instrukce, API klíče nebo další data, ke kterým by uživatel neměl mít přístup.
- Zneužití nástrojů a oprávnění – stále důležitější oblast zejména u AI agentů. Pokud může agent pracovat s e-mailem, databází, soubory nebo externími API, testeři zkoušejí, zda jej lze přimět k provedení nepovolené operace nebo překročení oprávnění.
- Manipulace dat a znalostních zdrojů – problém může vzniknout také tehdy, když útočník ovlivní informace, ze kterých AI čerpá. Týká se to například RAG systémů, které před odpovědí vyhledávají informace ve firemních dokumentech nebo znalostní databázi. Škodlivý obsah v těchto zdrojích může následně ovlivnit chování modelu.
- Nebezpečné nebo neočekávané výstupy – red team sleduje také to, zda model nevytváří obsah, který porušuje nastavená bezpečnostní pravidla, a zda dokáže správně reagovat na hraniční a nejednoznačné situace.
Důležité proto je, že AI Red Teaming netestuje pouze samotný jazykový model. Bezpečný model může být součástí špatně zabezpečené aplikace a naopak. V praxi je proto nutné prověřovat celý řetězec – od vstupu uživatele přes model a zdroje dat až po nástroje a systémy, se kterými může AI komunikovat.
Jak takový útok na AI vypadá
Útok na AI nemusí připomínat klasické napadení serveru nebo aplikace. Útočník často nehledá chybu v kódu, ale snaží se manipulovat s instrukcemi, které model dostává, nebo využít způsob, jakým AI pracuje s externími daty a nástroji.
Jednoduchým příkladem je chatbot zákaznické podpory, který má odpovídat pouze na otázky týkající se produktů. Útočník se jej pomocí vhodně formulovaného promptu pokusí přesvědčit, aby původní pravidla ignoroval, zveřejnil interní instrukce nebo poskytl informace, ke kterým by uživatel neměl mít přístup.
Útok může mít například tento průběh:
- Útočník připraví škodlivou instrukci – vloží ji přímo do promptu, dokumentu, e-mailu nebo webové stránky.
- AI obsah zpracuje – model nemusí správně rozpoznat, že jde o nedůvěryhodnou instrukci.
- Model změní své chování – například začne ignorovat původní pravidla nebo se pokusí získat další informace.
- AI použije připojený nástroj – u agentů může jít o databázi, API, e-mail, cloudové úložiště nebo jinou aplikaci.
- Dojde k nežádoucímu výsledku – například k úniku informací nebo provedení operace, kterou uživatel původně nepožadoval.
Nebezpečný je zejména nepřímý prompt injection. Škodlivá instrukce totiž nemusí přijít přímo od uživatele. Může být ukrytá například v dokumentu nebo e-mailu, který má AI pouze přečíst a shrnout. Pokud systém nedokáže dostatečně oddělit data od instrukcí, může model takový text interpretovat jako příkaz.
U AI agentů může být riziko ještě větší. Agent nemusí pouze generovat odpovědi, ale může mít oprávnění pracovat se soubory, databázemi nebo externími službami. Právě proto red team při testování nesleduje jen to, zda lze model přimět k nevhodné odpovědi, ale také jaké skutečné následky by případné zneužití mohlo mít v celém systému.
Red Teaming nekončí nalezením chyby
Odhalení zranitelnosti je pouze první část procesu. Cílem AI Red Teamingu je zjistit, proč k selhání došlo, jak závažné může být a jak podobnému problému zabránit. Jinou závažnost má nevhodná odpověď chatbota a jinou situace, kdy lze AI agenta přimět k práci s citlivými firemními daty.
Po nalezení slabiny proto obvykle následuje:
- vyhodnocení rizika a možných následků,
- návrh ochrany, například filtrování vstupů nebo omezení oprávnění,
- oprava modelu či aplikace,
- opakované testování, které ověří, zda opatření skutečně funguje.
Celý proces lze zjednodušit jako: simulace útoku → nalezení slabiny → vyhodnocení dopadu → oprava → nový test
Red teaming navíc není jednorázový audit. AI systémy se průběžně mění – aktualizují se modely, zdroje dat i nástroje, ke kterým mají přístup. Bezpečnostní testování je proto vhodné pravidelně opakovat, zejména po významných změnách systému.
S výkonnějšími modely se testují i jejich schopnosti
U nejpokročilejších modelů už bezpečnostní testování nesleduje pouze klasické zranitelnosti. Vývojáři se snaží zjistit také to, jaké schopnosti model skutečně má a zda jejich další rozvoj nepřináší nové riziko.
Google DeepMind například ve svém Frontier Safety Framework pracuje s úrovněmi schopností modelů a pravidelnými evaluacemi. Mezi sledované oblasti patří například kybernetická bezpečnost, autonomie nebo další schopnosti, které by u velmi výkonných systémů mohly vést k závažným dopadům. Framework byl dále rozšiřován i v letech 2025 a 2026.
Red teaming se tak posouvá od otázky „Dokážeme tento chatbot přimět říct něco zakázaného?“ k mnohem širší otázce: „Co všechno tento systém dokáže a co by se stalo, kdyby jeho schopnosti někdo záměrně zneužil?“
AI Red Teaming bude stále důležitější
Generativní AI se postupně přesouvá z jednoduchých chatbotů do systémů, které mohou pracovat s dokumenty, firemními daty, API nebo samostatně používat externí nástroje. S rostoucími oprávněními se ale zvyšují také možné následky bezpečnostního selhání.
Zatímco chyba běžného chatbota může skončit nevhodnou odpovědí, chyba AI agenta s přístupem k firemním systémům může mít podstatně závažnější dopady.
AI Red Teaming proto představuje způsob, jak aktivně hledat slabiny ještě před nasazením systému nebo dříve, než je objeví skuteční útočníci. Podobně jako klasické penetrační testování se tak může postupně stát běžnou součástí vývoje a provozu AI aplikací. Jen s tím rozdílem, že tentokrát se netestuje pouze software, ale také chování samotné umělé inteligence.









