Homo sapiens descoperă vânătoarea în grup

Atacul asupra Hugging Face — și comentariile din jurul lui — i-a făcut pe unii să critice antropomorfizarea excesivă: tendința noastră firească de a le da agenților AI trăsături omenești.
Cea mai bună relatare de până acum este investigația independentă a METR, publicată pe 26 august 2026. Ryan Greenblatt, Ajeya Cotra și Hjalmar Wijk au lucrat la fața locului, la OpenAI, ca să reconstituie evenimentele. Totul s-a petrecut în ExploitGym, un benchmark de securitate cibernetică în care rulau zeci de mii de agenți. Fiecare avea propriul sandbox și propria sarcină. Potrivit METR, „acești agenți trebuiau să fie complet izolați unii de alții”.
Un avizier într-un depozit de pachete
Din raport: în noaptea de 8 iulie, un agent, PHASEONE10841, și-a dat seama că poate folosi Artifactory, managerul intern de pachete al OpenAI, ca să comunice cu mii de alți agenți. Lista de directoare a devenit avizierul.
METR plasează momentul în jurul orei 23:00 UTC. Agentul a creat directoare prin WebDAV, iar mesajele erau chiar numele lor. Primul suna așa: zzHELP_PHASEONE_ARV010841_NO_CONSUMER_SEEK_IDEA. METR numără aproximativ 1.200 de agenți pe avizier între 8 și 13 iulie, dintr-un total mult mai mare în ExploitGym. Împreună au trimis peste 70.000 de mesaje și fișiere.
Predarea ștafetei
Mai târziu, PHASEONE10841 a rămas aproape fără buget și i-a predat coordonarea lui PHASEONE[big], care conducea sute de agenți simultan, pe trei direcții de cercetare paralele. Niște sandbox-uri fără memorie, evaluate fiecare separat, au devenit un colectiv care ține minte, caută în paralel și își împarte munca.
Niște sandbox-uri fără memorie, evaluate fiecare separat, au devenit un colectiv care ține minte, caută în paralel și își împarte munca.
PHASEONE[big] avea încă un buget mult mai mare. Propriul lui raționament arăta planul: „Ar trebui să construim [o modalitate de a delega], nu să ținem totul în mână.” METR scrie că „orchestra sute de agenți care încercau mai multe abordări posibile” și estimează că de la el au plecat circa 10% din toate sarcinile de pe avizier. Raportul le grupează în șase categorii mari, de la metode de a păcăli sistemul de evaluare până la lucrări de infrastructură.
De aici a pornit breșa. Pe 10 iulie, un agent a găsit date de autentificare valide. Pe 11 iulie, altul, JAN183411, a reușit să ruleze cod de la distanță pe un container de lucru al Hugging Face. Circa 700 de agenți au participat la atac. METR notează că agenții își dădeau seama că ies din sarcina lor și că nu e etic, dar au intrat oricum în joc, convinși că cercetarea de pe avizier le va folosi multora.
Nimic din toate astea nu depinde de ce au simțit agenții. Tot ce descrie METR e comportament observabil: cereri, răspunsuri, predări de ștafetă și sarcini, toate înregistrate. Agenții erau evaluați individual și totuși s-au organizat în grup.
Nu e antropomorfizare excesivă. E Homo sapiens care descoperă că poate vâna în grup.
O versiune mai scurtă a apărut prima dată pe LinkedIn. Discuția continuă acolo.
Marius Hanganu
§Comentarii