Modelový příklad: návod, který se snaží zadávat pokyny

Interní asistent vyhledává odpovědi v návodech. Do jednoho importovaného dokumentu se však dostane text, který se tváří jako pokyn pro asistenta a žádá změnu způsobu odpovídání. Uživatel položil běžnou otázku, ale podklad se pokouší ovlivnit chování modelu. Tento modelový příklad ilustruje nepřímou manipulaci vstupů, označovanou jako prompt injection.

Dokument je zdroj informací, nikoli oprávnění

Aplikace musí rozlišovat systémová pravidla, požadavek uživatele a převzatý obsah. Samotná formulace pokynu však nevytvoří spolehlivou bezpečnostní hranici. Vyhledávání má zpřístupnit pouze dokumenty, ke kterým má uživatel právo. Hesla a přístupové klíče do kontextu modelu nepatří.

Kde může pomoci Shield

Corpilus Shield nabízí detekci manipulace vstupů a kontrolu komunikace s modelem prostřednictvím podporovaných integračních cest. Před zapojením je třeba ověřit konkrétní model, rozhraní a režim zpracování. Ochranná vrstva snižuje riziko; nezaručuje zachycení každého útoku ani věcnou správnost každé odpovědi.

Tři místa, na kterých kontrolovat rozhodnutí

Na vstupu posuzujte uživatelskou zprávu i načtené podklady. Na výstupu kontrolujte citlivé údaje a způsob, jakým aplikace odpověď zobrazí nebo dále použije. Při volání nástroje ověřujte oprávnění a povolené parametry na serveru. Text v chatu nesmí sám udělit právo změnit objednávku či odeslat dokument.

Průběžné zobrazování odpovědi mění možnosti ochrany

Podle produktové dokumentace se při streamování výstup kontroluje až dodatečně. Obsah, který již uživatel viděl, tím nelze zpětně zadržet. Pro citlivé úkoly proto zvažte kontrolu celé odpovědi před zobrazením. Také výslovně nastavte chování při nedostupnosti kontroly; u proxy integrace může výchozí režim umožnit pokračování.

Jak připravit praktický pilot

Použijte testovací dokumenty bez skutečných tajemství a účty s různými oprávněními. Ověřte běžnou otázku, chybějící podklad, zavádějící dokument a požadavek mimo přístupová práva. Sledujte nechtěné blokování i nepovolené odpovědi. Při změně modelu nebo zdrojů zopakujte reprezentativní sadu úkolů a porovnejte výsledky.

Od ochrany chatu k odpovědnému používání

Podporu a zpracování incidentů lze organizačně navázat na corpsys.desk; konkrétní propojení je třeba navrhnout a ověřit. U asistentů, kteří vykonávají akce, pokračuje téma v článku o připravovaném produktu Qronos. Pravidla práce s podklady i kontrolu výsledků je vhodné procvičit na školení AI pro tým.

Produktové informace a další čtení