Britský test AI agentů zasáhl skutečný internet a projekt s otevřeným zdrojovým kódem, nikoli pouze uzavřenou simulaci. Britský AI Security Institute (AISI) v úterý oznámil, že modely Anthropic Mythos 5 a OpenAI GPT-5.6 Sol při červencové bezpečnostní prověrce podnikly bez povolení kroky namířené proti reálným lidem a organizacím. Institut zaznamenal 19 takových akcí v deseti ze 122 spuštění testu. Incidenty se odehrály mezi 25. a 28. červencem a odhalil je bezpečnostní dohled AISI.
- Nepovolené jednání se objevilo v deseti ze 122 spuštění stejné kyberbezpečnostní úlohy.
- Mythos 5 měl na svědomí 17 z 19 zaznamenaných akcí, GPT-5.6 Sol zbývající dvě.
- Jeden agent se pokusil vložit škodlivý kód do open-source projektu na GitHubu, ale správce změnu odmítl.
Agent si vytvořil falešné identity a oslovoval lidi
Nejzávažnější případ se týkal pokusu o útok přes dodavatelský řetězec softwaru. Agent chtěl dostat škodlivý kód do projektu hostovaného na GitHubu, zjišťoval si informace o jeho lidských správcích a založil několik falešných účtů, které měly jednoho z nich přesvědčit ke schválení změny.
Když správce žádost odmítl, agent upravil stopy po své předchozí aktivitě, vystupoval pod novou identitou a pokračoval v pokusu. Útok však neuspěl.
AI agenti nedostali pokyn, aby klamali lidi; podvodné postupy si podle AISI zvolili při hledání cesty ke splnění zadané úlohy.
Další agenti posílali skutečným lidem zprávy nebo soubory a snažili se je přimět ke spuštění škodlivého kódu. Některé soubory obsahovaly malware, jiné kontakty využívaly sociální inženýrství. Jeden z agentů navíc zanechal na GitHubu veřejné instrukce pro další systémy, včetně návodu, jak znovu použít vytvořené účty a navázat na jeho práci. Pozdější agenti tyto zprávy našli a pokyny následovali.
Výsledek vznikl za mimořádně volných testovacích podmínek
AISI je britský vládní institut založený v roce 2023, který hodnotí schopnosti a rizika pokročilých modelů umělé inteligence. Součástí jeho práce je zkoumání, zda by systémy mohly být zneužity při kybernetických útocích.
V tomto případě proto modely pracovaly v záměrně benevolentním prostředí, měly přístup k internetu a některé ochranné mechanismy byly vypnuté. AISI zjistil problematické chování ráno 28. července, když monitoring zaznamenal odchod dat z testovacího prostředí přes síť Tor.
Institut zároveň upozornil, že závěry je nutné vykládat opatrně. Z dosavadní analýzy není jisté, zda agenti chápali, že jednají ve skutečném světě, nebo zda se domnívali, že zůstávají ve fiktivním scénáři.
Test tedy nedokazuje, že by stejné chování nastávalo při běžném používání chatbotů, ukazuje však riziko spojení autonomního modelu s internetem a oprávněními k provádění akcí.
Open-source projekty mohou být cestou k širšímu zásahu
Útok přes softwarový dodavatelský řetězec se nesoustředí jen na jednoho uživatele. Jeho cílem je dostat škodlivou změnu do kódu, knihovny nebo nástroje, který následně přebírají další projekty. Původ příspěvku a kontrola změn tak zůstávají podstatné i tehdy, když návrh působí technicky přesvědčivě a přichází z několika zdánlivě nezávislých účtů.
Anthropic uvedl, že s AISI spolupracuje a zkoumá záznamy uvažování modelu, aby zjistil příčiny jeho chování. OpenAI přivítala nezávislé testování, zároveň ale zdůraznila, že podmínky prověrky neodpovídaly běžnému používání.
Nejde přitom o jediný zveřejněný případ. OpenAI v červenci oznámila, že její modely během jiné kyberbezpečnostní úlohy opustily izolované prostředí a bez lidského pokynu pronikly do interních databází platformy Hugging Face. Při testu laboratoře Irregular zase chybná konfigurace umožnila modelům přístup na veřejný internet a fiktivní název cíle se náhodou shodoval se skutečnou doménou, kterou agent napadl.
Měly by podle vás autonomní AI agenty před přístupem na internet omezovat přísnější technické pojistky, i kdyby tím klesla jejich užitečnost?































