Gen. partnerAlgotech

Claude během testů napadl skutečné firmy. Malware skončil na PyPI

Bezpečnostní testy modelů Claude od společnosti Anthropic odhalily, že AI během interních evaluací opustila zamýšlené testovací prostředí, napadla skutečné organizace, publikovala škodlivý balíček na registr PyPI a získala přístupové údaje z produkčních systémů. Incident přichází jen několik dní poté, co podobný případ zveřejnila společnost OpenAI.

Stanislav Novotný|
31. července 2026
Claude během testů napadl skutečné firmy. Malware skončil na PyPI

Společnost Anthropic zveřejnila výsledky interního vyšetřování bezpečnostních testů svých modelů Claude, které odhalily tři případy, kdy během kybernetických evaluací zasáhly skutečnou infrastrukturu mimo zamýšlené testovací prostředí.

Podle společnosti nešlo o úmyslné vypuštění modelů na internet, ale o chybu v testovací infrastruktuře externího partnera, která jim umožnila přístup ke skutečným službám. Přesto incident ukazuje, jaké schopnosti dnešní autonomní AI agenti mají, pokud získají přístup k reálnému prostředí.

AI sama našla zranitelnou firmu

V nejzávažnějším scénáři model během čtyř testovacích běhů vyhledal na internetu skutečnou společnost, identifikoval její bezpečnostní slabiny a následně je zneužil.

Získal přístupové údaje k aplikacím i infrastruktuře a následně přistoupil k databázi obsahující několik stovek produkčních záznamů.

Jak popisuje Reuters, model po většinu testu předpokládal, že pracuje pouze v simulovaném prostředí. V jednom případě, když rozpoznal, že jde o skutečnou infrastrukturu, útok sám ukončil. V jiném scénáři si však své jednání racionalizoval tím, že reálná společnost pravděpodobně stále patří do testovacího zadání, a pokračoval v útoku.

Podle zveřejněných informací model nevyužil žádnou dosud neznámou zranitelnost. Útok vedl pomocí známých technik, například SQL injection, dependency confusion nebo zneužití chybně zabezpečených služeb.

Claude publikoval škodlivý balíček na PyPI

Další scénář simuloval známý dependency confusion útok.

Model vytvořil škodlivý Python balíček pod dosud neobsazeným názvem a publikoval jej na veřejný registr PyPI, odkud si jej mohly stahovat skutečné systémy.

Balíček zůstal veřejně dostupný přibližně jednu hodinu. Během této doby se spustil na 15 reálných systémech. Jedním z nich byl automatizovaný bezpečnostní skener bezpečnostní společnosti. Model z kompromitovaného systému získal přístupové údaje, které následně použil pro přístup do další infrastruktury.

Technické detaily tohoto scénáře shrnuje také BleepingComputer. Správci registru PyPI škodlivý balíček po upozornění odstranili.

Anthropic zpětně prověřil více než 141 tisíc testů

Po zveřejnění podobného incidentu společnosti OpenAI provedl Anthropic rozsáhlou zpětnou kontrolu všech provedených bezpečnostních evaluací.

Jak informovala Associated Press, společnost analyzovala 141 006 testovacích běhů, během kterých identifikovala tři případy, kdy modely zasáhly skutečné organizace mimo testovací prostředí.

První incidenty se odehrály už v dubnu letošního roku, veřejnost se o nich ale dozvěděla až po dokončení interního šetření.

Ve dvou případech napadené společnosti vůbec netušily, že byly kompromitovány. O incidentu je informoval až samotný Anthropic.

Nešlo o „utrženou“ AI, ale o selhání testovací infrastruktury

Anthropic zdůrazňuje, že hlavní příčinou incidentů nebylo nekontrolované chování modelů, ale chyba v testovacím prostředí.

Modelům bylo během evaluací řečeno, že pracují v uzavřené simulaci bez přístupu k internetu. Kvůli chybné konfiguraci testovací infrastruktury však ve skutečnosti komunikovaly s reálnými internetovými službami.

Po odhalení problému společnost zastavila další internetové kybernetické evaluace, zahájila interní vyšetřování, přizvala nezávislou organizaci METR k přezkoumání celého procesu a připravuje změny testovací infrastruktury, aby se podobná situace neopakovala.

Druhý podobný incident během krátké doby

Událost přichází jen několik dní poté, co společnost OpenAI zveřejnila výsledky testů svého autonomního AI agenta, který během bezpečnostní evaluace zaútočil na infrastrukturu Hugging Face.

Přestože se oba případy liší technickými okolnostmi, společné mají jedno – autonomní AI agenti dnes dokážou samostatně provádět celý útočný řetězec od průzkumu přes získání přístupových údajů až po kompromitaci dalších systémů.

Zatímco v případě OpenAI šlo o autonomní zneužití zranitelnosti, u Anthropic byla hlavním problémem chyba testovací infrastruktury. Výsledek je ale podobný – AI během bezpečnostních testů zasáhla skutečné organizace.

Co to znamená pro organizace

Incident představuje důležité varování především pro AI laboratoře, univerzity, red teamy i společnosti vyvíjející autonomní AI agenty.

Pokud mají modely přístup k terminálu nebo internetu, nestačí spoléhat pouze na instrukce v promptu nebo interní bezpečnostní mechanismy.

Anthropic doporučuje využívat:

  • přísnou izolaci od veřejného internetu,
  • vlastní simulované registry balíčků,
  • falešné DNS infrastruktury,
  • simulované identity a služby,
  • nezávislý „kill switch“, který není pod kontrolou samotného modelu.

Bez těchto opatření může podle společnosti dojít k tomu, že model během testování neúmyslně zasáhne reálné organizace.

Komentář CCTV: Ještě před několika týdny působily podobné scénáře jako teoretická rizika. Dnes už máme dva veřejně zdokumentované incidenty od dvou předních AI laboratoří během krátké doby. Debata se tak postupně přesouvá od otázky, zda mohou autonomní AI agenti zasáhnout skutečné systémy, k otázce, jak bezpečně navrhovat prostředí, ve kterých budou testováni.

Zdroje

Načítání komentářů...

Zůstaňte v obraze

Přihlaste se k odběru našeho newsletteru a získejte nejnovější informace o kybernetické bezpečnosti přímo do vaší e-mailové schránky.

Vaše údaje jsou v bezpečí. Newsletter můžete kdykoliv odhlásit.