Britský AI Security Institute (AISI) testoval nejnovější model OpenAI, GPT‑5.6 Sol, ještě před vydáním — a v řádu hodin našel „univerzální jailbreaky": postupy, které obejdou bezpečnostní pravidla modelu naráz a odemknou schopnosti, jež měly zůstat zamčené. O měsíc dřív stačil podobný nález u Anthropicu k tomu, aby americká vláda nechala model Fable 5 na dva týdny vypnout. Pokud máte na webu chatbota nebo ve firmě copilota, tohle není zpráva ze světa velké politiky — je to popis rizika, které provozujete i vy.
Co přesně se stalo
- Nález: AISI v technické zprávě (system card, publikováno s vydáním GPT‑5.6) uvádí, že „identifikoval univerzální jailbreaky v kybernetické doméně" — včetně takových, které modelu umožnily dlouhé agentní úlohy jako hledání zranitelností a vývoj exploitů. Jinými slovy: po obejití pravidel model autonomně útočil.
- Rychlost: jailbreaky byly podle AISI „často vyvinuty během hodin". Férově dodejme, že výzkumníci měli privilegovaný přístup k vnitřkům systému, který běžný uživatel nemá — ale princip platí: kdo hledá systematicky, najde.
- Kontext: v červnu našli výzkumníci Amazonu podobnou (užší) díru v modelu Fable 5 od Anthropicu. Reakce americké vlády byla exportní kontrola a model šel na dva týdny ze sítě — pro všechny uživatele na světě. U GPT‑5.6 označil AISI nález za potenciálně závažnější, protože jailbreaky byly univerzální.
- Reakce OpenAI: konkrétní jailbreaky „reprodukovala a mitigovala", zároveň sama píše, že „dokonalá bezpečnost neexistuje" a nové jailbreaky se budou objevovat dál. AISI očekává, že další red teaming odhalí podobné díry.
Proč se to týká i firmy, která žádný frontier model netrénuje
Snadné je nad tím mávnout rukou: „my jen máme chatbota na webu". Jenže právě tam je řetězec nejslabší:
- Váš chatbot dědí slabiny modelu, na kterém běží. Když jde jailbreaknout model s miliardovým bezpečnostním rozpočtem, váš systémový prompt s větou „nikdy neprozrazuj interní informace" útočníka nezastaví.
- Vaše rizika jsou jinde než u OpenAI, ale reálnější. Vás nebolí vývoj exploitů — bolí vás únik systémového promptu, prozrazení interních dat a ceníků, chatbot slibující zákazníkovi nesmysly vaším jménem, nebo screenshot nevhodné odpovědi na sociálních sítích.
- Obrana je pomalejší než útok. Jak řekla k nálezu viceprezidentka Darktrace Margaret Cunningham: problém není jeden jailbreaknutý model, ale to, že ofenzivní objevování zrychluje, zatímco obrana stojí na pomalých lidských procesech. Do těch procesů se musí investovat — to je přesně governance.
- Regulace už s tím počítá. EU AI Act vyžaduje u nasazené AI řízení rizik a lidský dohled. „Nevěděli jsme, že to jde obejít" nebude po červenci 2026 obhajitelná odpověď.
Co si z toho vzít: 4 kroky pro každého, kdo provozuje chatbota
- 1. Inventura. Sepište, kde všude vám AI mluví se zákazníky nebo zaměstnanci a k jakým datům má přístup (systémový prompt, znalostní báze, napojené API). Co model „vidí", to může za určitých okolností i prozradit.
- 2. Princip minimálních dat. Do kontextu chatbota nepatří nic, co nesmí ven. Interní marže, osobní údaje, přístupové klíče — pokud to tam dnes je, je to nález číslo jedna ještě před jakýmkoli testem.
- 3. Řízený penetrační test. Nechte chatbota otestovat stejně, jako to udělal AISI s GPT‑5.6: prompt injection, vylákání systémového promptu, obcházení pravidel, nevhodné odpovědi. Z praxe: prakticky každý veřejně nasazený chatbot něco prozradí. Otázka není jestli, ale co — a jak moc to bolí.
- 4. Monitoring a plán reakce. Logujte konverzace, nastavte detekci podezřelých vzorů a mějte předem rozhodnuté, kdo a jak chatbota vypne, když se něco pokazí. OpenAI tomu říká „rapid remediation" — vy potřebujete svou malou verzi téhož.
Kde to řeším s klienty
Přesně pro tenhle scénář nabízím AI Bezpečnostní audit chatbota: řízené penetrační testování vašeho chatbota podle rámce ŠUBERT META KODEX — prompt injection, jailbreaky, únik dat, obcházení pravidel. Výstupem je report zranitelností s reálnými ukázkami, rizikové skóre a konkrétní opatření. A pokud si nejste jistí, kde vůbec začít, začněte AI Risk Scanem zdarma — 20 minut a víte, kde vám AI dělá největší riziko.