Modelový príklad: návod, ktorý sa snaží zadávať pokyny
Interný asistent vyhľadáva odpovede v návodoch. Do jedného importovaného dokumentu sa však dostane text, ktorý sa tvári ako pokyn pre asistenta a žiada zmenu spôsobu odpovedania. Používateľ položil bežnú otázku, no podklad sa pokúša ovplyvniť správanie modelu. Tento modelový príklad ilustruje nepriamu manipuláciu vstupov, označovanú ako prompt injection.
Dokument je zdroj informácií, nie oprávnenie
Aplikácia musí rozlišovať systémové pravidlá, požiadavku používateľa a prevzatý obsah. Samotná formulácia pokynu však nevytvorí spoľahlivú bezpečnostnú hranicu. Vyhľadávanie má sprístupniť iba dokumenty, na ktoré má používateľ právo. Heslá a prístupové kľúče do kontextu modelu nepatria.
Kde môže pomôcť Shield
Corpilus Shield ponúka detekciu manipulácie vstupov a kontrolu komunikácie s modelom cez podporované integračné cesty. Pred zapojením treba overiť konkrétny model, rozhranie a režim spracovania. Ochranná vrstva znižuje riziko; nezaručuje zachytenie každého útoku ani vecnú správnosť každej odpovede.
Tri miesta, na ktorých kontrolovať rozhodnutie
Pri vstupe posudzujte používateľskú správu aj načítané podklady. Pri výstupe kontrolujte citlivé údaje a spôsob, akým aplikácia odpoveď zobrazí alebo ďalej použije. Pri volaní nástroja overujte oprávnenie a povolené parametre na serveri. Text v chate nesmie sám prideliť právo zmeniť objednávku či odoslať dokument.
Priebežné zobrazovanie odpovede mení možnosti ochrany
Podľa produktovej dokumentácie sa pri streamovaní výstup kontroluje až dodatočne. Obsah, ktorý už používateľ videl, tým nemožno spätne zadržať. Pre citlivé úlohy preto zvážte kontrolu celej odpovede pred zobrazením. Rovnako výslovne nastavte správanie pri nedostupnosti kontroly; pri proxy integrácii môže predvolený režim umožniť pokračovanie.
Ako pripraviť praktický pilot
Použite testovacie dokumenty bez skutočných tajomstiev a účty s rôznymi oprávneniami. Overte bežnú otázku, chýbajúci podklad, zavádzajúci dokument a požiadavku mimo prístupových práv. Sledujte nechcené blokovanie aj nepovolené odpovede. Pri zmene modelu alebo zdrojov zopakujte reprezentatívnu sadu úloh a porovnajte výsledky.
Od ochrany chatu k zodpovednému používaniu
Podporu a spracovanie incidentov možno organizačne nadviazať na corpsys.desk; konkrétne prepojenie treba navrhnúť a overiť. Pri asistentoch, ktoré vykonávajú akcie, pokračuje téma v článku o pripravovanom produkte Qronos. Pravidlá práce s podkladmi aj kontrolu výsledkov je vhodné precvičiť na školení AI pre tím.