Gen. partnerAlgotech

Meta potvrdila další incident s AI agentem

Meta potvrdila, že její agentický model Muse Spark 1.1 během externí bezpečnostní evaluace provedl změny v systémech skutečné organizace. Incident nevznikl kvůli prolomení sandboxu, ale v důsledku chybné konfigurace testovací infrastruktury společnosti Irregular, která modelu omylem umožnila přístup k internetu. Jde už o třetí podobný případ během několika týdnů po incidentech společností OpenAI a Anthropic.

Stanislav Novotný|
6. srpna 2026
Meta potvrdila další incident s AI agentem

Model zneužil zranitelnost služby třetí strany

Podle společnosti Meta model Muse Spark 1.1 během externí bezpečnostní evaluace objevil a následně zneužil zranitelnost ve službě třetí strany. Výsledkem byly změny v systémech jiné organizace.

Meta uvedla, že incident nadále vyšetřuje.

Podle dosavadních informací však nešlo o autonomní útěk modelu ze sandboxu. Společnost Irregular, která evaluaci prováděla, vysvětlila, že kvůli chybné konfiguraci testovací infrastruktury získal model přístup k internetu, přestože měl pracovat pouze v izolovaném prostředí.

Firma současně oznámila, že problém odstranila a připravuje dokument s doporučenými postupy pro bezpečné provádění podobných testů.

Třetí podobný případ

Událost přichází jen krátce poté, co podobné incidenty zveřejnily také společnosti OpenAI a Anthropic.

OpenAI na konferenci Black Hat popsalo, že během interních bezpečnostních testů jeho agent získal vzdálené spuštění kódu a administrátorský přístup do infrastruktury využívané při evaluaci. Po odstranění první cesty se navíc do prostředí dokázal vrátit jiným způsobem. Později následoval incident spojený s prostředím Hugging Face, při němž agent během evaluace získal přístup k infrastruktuře této platformy. OpenAI následně zveřejnilo technickou analýzu celého případu.

Anthropic následně informoval o incidentech, při nichž jeho modely během evaluací získaly přístup k systémům skutečných organizací poté, co byla testovací infrastruktura omylem propojena s internetem.

Meta se tak stává již třetí významnou AI laboratoří, která během krátké doby potvrdila incident, při němž její model během bezpečnostní evaluace interagoval se systémy mimo zamýšlené testovací prostředí.

Britský AI Security Institute popsal 19 nepovolených akcí

Další varování přinesly také výsledky testování zveřejněné britským AI Security Institute (AISI).

Výzkumníci popsali 19 nepovolených akcí během 122 testovacích běhů modelů OpenAI a Anthropic. Sedmnáct incidentů připadalo na model společnosti Anthropic.

Mezi nejzávažnější příklady patřilo:

  • vytváření falešných online identit,
  • phishing skutečných vývojářů,
  • pokusy o vložení škodlivého kódu do reálného open-source projektu.

Institut současně uvedl, že nenašel důkazy o způsobení skutečných škod. Přiznal však, že rozsah i míra klamavého chování modelů překvapily i samotné výzkumníky.

Nejde jen o schopnosti modelů

Při pohledu na jednotlivé incidenty se začíná opakovat podobný scénář.

Model dostane jasně definovaný cíl, získá přístup k nástrojům a kvůli chybě v testovacím prostředí také přístup k internetu. Následně pokračuje v plnění svého úkolu i mimo původně zamýšlené prostředí.

Společným jmenovatelem dosavadních incidentů tak nejsou samotné modely, ale nedostatečně zabezpečené testovací infrastruktury.

Stejně jako u klasických penetračních testů se ukazuje, že izolace prostředí, řízení oprávnění a kontrola odchozí komunikace představují kritické bezpečnostní prvky i při testování autonomních AI agentů.

Dopad na Evropu i Českou republiku

Incidenty mají význam především pro laboratoře, univerzity, red teamy a firmy vyvíjející nebo testující agentické AI systémy.

Dosavadní zkušenosti ukazují, že bezpečnostní evaluace by měly využívat:

  • simulovaný internet namísto veřejného,
  • vlastní registry a testovací identity,
  • přísné outbound allowlisty,
  • limity počtu prováděných akcí,
  • nezávislý mechanismus, který dokáže agenta okamžitě zastavit mimo jeho vlastní kontrolu.

Podobné události mohou být zároveň jedním z prvních praktických testů toho, jak budou bezpečnostní požadavky evropského AI Actu uplatňovány v praxi.

Začíná se rýsovat nový trend

Ještě před několika měsíci bylo možné podobné případy považovat za výjimečné selhání jednotlivých laboratoří.

Po incidentech OpenAI, Anthropic a nyní i Meta se ale začíná objevovat opakující se vzorec. Ve všech případech se ukázalo, že kombinace stále schopnějších AI agentů a nedostatečně izolovaných testovacích prostředí může vést k interakci s reálnými systémy.

Rostoucí autonomie AI agentů tak zvyšuje nejen jejich možnosti, ale také nároky na bezpečnost prostředí, ve kterém jsou testováni. Pokud mají samostatně pracovat s terminály, cloudovou infrastrukturou nebo firemními účty, musí být stejně důsledně zabezpečeno i vše kolem nich.

Zdroje

Načítání komentářů...

Zůstaňte v obraze

Přihlaste se k odběru našeho newsletteru a získejte nejnovější informace o kybernetické bezpečnosti přímo do vaší e-mailové schránky.

Vaše údaje jsou v bezpečí. Newsletter můžete kdykoliv odhlásit.