Ca să protejezi agenții Claude de prompt injection, faci trei lucruri. Tratezi textul venit din afară ca date, nu ca ordine. Dai fiecărei unelte doar permisiunea strict necesară. Ceri aprobarea unui om înainte ca agentul să trimită, să plătească sau să șteargă ceva.
Prompt injection este un atac în care instrucțiuni rău-intenționate sunt ascunse în conținut extern pe care Claude îl citește în timpul unei sarcini legitime. Anthropic dă exemple concrete: corpul unui e-mail primit, o pagină web, textul dintr-un fișier încărcat. Scopul atacatorului este ca Claude să-i urmeze lui instrucțiunile, nu pe ale tale.
Riscul crește când agentul are acces la sistemele firmei. Un agent care citește tichete din Zoho Desk, e-mailuri de la clienți și înregistrări din Zoho CRM citește zilnic text scris de oameni pe care nu-i controlezi. Dacă același agent poate și să trimită mesaje sau să modifice date, un singur e-mail capcană poate declanșa o acțiune reală.
Niciuna dintre cele trei măsuri nu elimină riscul. Ele limitează ce poate face un atac reușit. Ghidul de mai jos explică fiecare măsură, cu setările reale din Claude, trei scenarii lucrate și un tabel de decizie pe care îl poți folosi direct.
