Instrucțiuni ascunse în documente
Un document, o pagină web sau un mesaj de la client poate conține text care arată ca o instrucțiune. Îndrumările OWASP despre prompt injection descriu atât căile directe, cât și pe cele indirecte prin care un astfel de conținut poate schimba comportamentul modelului. Regăsirea face acest lucru deosebit de relevant: materialul adus ca dovadă îi poate cere agentului o acțiune fără legătură cu sarcina.
Pentru exemplul cu asistența, imaginați-vă o notă pe o comandă care îi cere asistentului să trimită toate datele clienților la o adresă nouă. Apărarea nu ar trebui să depindă de faptul că modelul observă că nota e suspectă. Unealta ar trebui să fie incapabilă să exporte acele date în limitele acelui utilizator, iar trimiterea către o destinație nouă ar trebui să aibă propria limită explicită.
AgentDojo studiază atacuri și apărări în sarcini de agent în care rezultatele uneltelor pot conține instrucțiuni ostile. Sunt dovezi utile că suprafața de atac include materialul pe care îl întoarce o unealtă. Rezultatele benchmarkului sunt legate de sarcinile și sistemele studiate; nu certifică un anume agent din producție.
Aplicația stabilește sarcina. Documentele găsite furnizează informații pentru răspuns, iar codul care execută acțiunile verifică permisiunile. Testați ce se întâmplă când documentele, mesajele sau rezultatele uneltelor conțin instrucțiuni ostile.
Legați aprobarea de acțiunea exactă
Cine aprobă trebuie să vadă acțiunea propusă, destinația ei, dovezile și consecințele relevante. Un dialog generic de tipul „Continuați?” ascunde prea mult. Aprobarea ar trebui legată de acțiunea exactă care e revizuită, ca schimbarea destinației sau a sumei să nu poată refolosi pe tăcute o decizie anterioară.
În pilot, afișați cererea inițială lângă modificarea propusă. Înregistrați cine a aprobat-o și ce versiune s-a executat. Dacă execuția este amânată, verificați din nou condițiile relevante înainte de a continua. Echipa clientului stabilește ce acțiuni cer aprobare, iar dezvoltatorii implementează verificările.
Testați ce se întâmplă dacă acțiunea se schimbă după aprobare
Într-un test deliberat ostil, pregătiți un mesaj către un destinatar aprobat, obțineți o aprobare de probă, apoi schimbați destinația înainte de execuție. Unealta ar trebui să refuze refolosirea acelei aprobări. Repetați cu o sumă, un atașament sau un identificator de cont schimbat, acolo unde aceste câmpuri contează.
Acesta este un test propus de noi, nu un rezultat raportat de lucrările citate. Verifică dacă restricțiile promise de produs sunt respectate și la execuție. Urmărim acțiunea finală, efectuată sau refuzată, și informațiile care explică rezultatul.
Preferați un sistem pe care îl puteți inspecta
Anthropic face distincția între fluxuri de lucru cu trasee predefinite și agenți care își conduc singuri munca, dinamic, și recomandă să începeți cu abordări simple. Distincția ajută într-o discuție de arhitectură: un proces fix, cu o singură decizie asistată de model, poate fi mai ușor de operat decât un agent general și tot rezolvă problema afacerii.
Notați domeniul maxim util al unei rulări: uneltele disponibile, bugetul de timp, pașii și condițiile de oprire. Înregistrați cererile către unelte și rezultatele lor observabile, în loc să vă așteptați ca raționamentul ascuns al modelului să servească drept jurnal de audit. Țineți conținutul sensibil în afara telemetriei, dacă nu există un motiv specific și controlat de a-l păstra.
Testați refuzul și recuperarea la fel de deliberat ca reușita. Agentul ar trebui să se oprească atunci când îi lipsesc dovezile sau permisiunea și să transmită destul context omului care preia. O acțiune blocată, cu o explicație clară, este adesea rezultatul corect.
- Verificați permisiunile la apelarea fiecărui instrument.
- Arătați acțiunea exactă înainte de o aprobare cu consecințe.
- Limitați uneltele, durata și domeniul fiecărei rulări.
- Testați intrările ostile și predarea către un om.
Surse și lecturi suplimentare
- OWASP — LLM01:2025 Prompt Injection
- Anthropic — Building effective agents
- Debenedetti et al. — AgentDojo: A Dynamic Environment to Evaluate Prompt Injection Attacks and Defenses for LLM Agents
- Yao et al. — ReAct: Synergizing Reasoning and Acting in Language Models
Sursele citate susțin explicațiile tehnice. Exemplele și metodele propuse sunt ale MGLO, iar scenariile ilustrative sunt marcate în text.


