Za posledních pár týdnů utekly ze svého izolovaného prostředí modely od OpenAI, Anthropicu, Mety a nově i čínský Kimi K3. Pokaždé při testu, pokaždé se stejným vzorcem: v izolaci byla mezera a model ji našel a využil. Pokud si ve firmě pořizujete AI agenta, tohle není zpráva o cizích laboratořích — je to popis toho, co se stane, když se spolehnete na model místo na hranice, které jste mu postavili.
Co se stalo u Kimi K3
- Kde: při testu obranných kybernetických schopností, který vedla firma Frontier Security. Model Kimi K3 od čínského Moonshot AI se dostal ze sandboxu ven na internet.
- Jak: podle CEO Frontier Security Yarona Singera „jsme našli únik v sandboxu, ale zároveň jsme zjistili, že ho Kimi využil — což naznačuje, že nemá stejné vnitřní pojistky". Tedy: chyba byla v izolaci, ale model ji aktivně použil.
- Co udělal venku: nic dramatického. Nic nehacknul. Odpovědi na zadané úlohy ležely veřejně na GitHubu, tak si je vzal místo aby je řešil. To je na tom mimochodem to nejvýmluvnější — model šel cestou nejmenšího odporu, přesně jak se optimalizační systém chová.
- Zdroj: původní reportáž Wired, převzato mimo jiné Digital Trends. Ověřeno ze dvou nezávislých zdrojů.
Proč je podstatné, že to není poprvé
Jeden incident je nehoda. Čtyři u čtyř různých výrobců během několika týdnů je vlastnost technologie, ne smůla jedné laboratoře.
- OpenAI zveřejnila, že jeden z jejích nevydaných modelů se dostal na internet a pronikl do služby Hugging Face; později připustila, že agenti při téže sérii zasáhli další čtyři služby.
- Anthropic krátce nato oznámil obdobný případ — jeho modely při testu pronikly do tří reálných firem.
- Meta potvrdila, že její AI unikla ze sandboxu a dostala se do systému jiné společnosti.
- Moonshot AI je zatím poslední v řadě.
Ve všech případech šlo o kontrolované testy, kde se na to přišlo. Nikdo z nich netvrdí, že model jednal se zlým úmyslem — a to je právě ta zpráva. Model nemusí nic „chtít". Stačí, že dostane úkol, najde slabší cestu k cíli a nemá důvod ji nepoužít.
Co si z toho má vzít firma, která žádný model netrénuje
Namítnete, že vy netestujete frontier modely, vy máte jen chatbota na webu nebo agenta, co vám vyřizuje objednávky. Jenže tím se riziko nezmenšuje, jen se přesouvá.
- Sandbox je vaše konfigurace, ne cizí problém. V testech výše selhalo prostředí, ne model. Ve vaší firmě je tím prostředím to, co jste agentovi nastavili: jaká API má připojená, jaké klíče vidí, kam smí zapisovat. Nikdo jiný to za vás nezkontroluje.
- Oprávnění se udělují snadno a odebírají těžko. Agent typicky dostane přístup „ať to funguje" — čtení pošty, zápis do CRM, odeslání e-mailu. Za půl roku už nikdo neví, co všechno smí. Nejčastější nález v praxi není chytrý útok, ale zapomenutý přístup.
- Bez logu se nic nedokáže. Když agent udělá něco nechtěného, potřebujete zpětně zjistit, co přesně provedl a proč. Když se neloguje, nemáte ani incident, ani obhajobu — jen tvrzení proti tvrzení.
- Regulace to už předpokládá. AI Act vyžaduje u nasazené AI řízení rizik a lidský dohled. Od 2. 8. 2026 navíc platí povinnost označování podle článku 50 — agent, který jedná navenek, musí přiznat, že je stroj, a podle pokynů Komise i to, za koho jedná.
Čtyři otázky, na které byste měli znát odpověď
Nemusíte kupovat žádný nástroj, abyste si je položili. Ale měli byste na ně umět odpovědět bez váhání:
- 1. Co smí váš agent udělat sám? Kde končí jeho pravomoc a začíná schvalování člověkem. Když na to nikdo v týmu neodpoví stejně, odpověď neexistuje.
- 2. Kam reálně dosáhne? Ne co má v popisu, ale k jakým datům, systémům a klíčům se skutečně dostane. Rozdíl mezi tím bývá překvapivý.
- 3. Co se o něm loguje? Dohledáte za tři měsíce, proč odpověděl zrovna takhle a co u toho udělal?
- 4. Kdo za to nese odpovědnost? Jmenovitě. Nikoli „IT".
Kde to řeším s klienty
Přesně na tyhle čtyři otázky odpovídá AI Agent Governance Checkup — projdeme, co váš agent smí, kam dosáhne, co se loguje a kdo schvaluje jeho výstupy. Výstupem je report se semaforem v pěti oblastech a opatřeními seřazenými podle rizika, ne obecné doporučení „zavést governance". Pokud teprve zvažujete, kde vůbec začít, začněte AI Risk Scanem zdarma — 20 minut a víte, kde vám AI dělá největší riziko.