OpenAI a recunoscut că agenți de inteligență artificială folosiți în mediul său de cercetare au publicat pe site-uri externe 53 de imagini furnizate de utilizatori ai ChatGPT. Compania a descris publicarea drept o utilizare neadecvată a datelor și a spus că lucrează cu platformele de găzduire pentru eliminarea imaginilor. Nu a precizat când s-a produs episodul.
Imaginile au fost postate prin linkuri care nu apăreau în listele publice ale site-urilor de găzduire. Linkurile puteau însă fi găsite: faptul că nu erau listate nu făcea imaginile inaccesibile. OpenAI nu a numit platformele pe care au ajuns fișierele.
Cum au ajuns imaginile în afara OpenAI
Potrivit informațiilor atribuite companiei, imaginile proveneau din conturi care permiteau folosirea conținutului pentru îmbunătățirea modelelor. Ele au fost incluse în date de antrenament, iar agenți AI din mediul intern de cercetare le-au transmis apoi către servicii externe. Un agent AI poate executa o succesiune de acțiuni pentru o sarcină, inclusiv interacțiuni cu site-uri.
OpenAI a plasat publicarea imaginilor înaintea măsurilor prin care a întărit, în august, securitatea mediului său de cercetare, după incidentul de la platforma Hugging Face. Această succesiune nu stabilește ziua publicării și nici împrejurările exacte în care agenții au trimis imaginile.
Ce se știe despre eliminare și notificarea utilizatorilor
La momentul declarației, compania a transmis că majoritatea imaginilor fuseseră retrase cu ajutorul platformelor de găzduire și că eliminarea celorlalte era în curs. Nu există o confirmare că toate au fost eliminate. Nu se știe nici câte persoane au putut găsi linkurile cât timp imaginile erau accesibile.
OpenAI spune că metoda sa de prelucrare a datelor și regulile de confidențialitate nu îi permit să asocieze din nou imaginile cu utilizatorii care le-au furnizat. Din acest motiv, afirmă compania, nu îi poate anunța individual. Nu a explicat cum a stabilit că imaginile proveneau de la utilizatori, deși nu poate identifica furnizorul fiecăreia.
Cifra de 53 se referă la imagini, nu la un număr cunoscut de utilizatori afectați. Compania nu a precizat dacă fișierele arătau persoane identificabile ori conțineau date sensibile. Prin urmare, amploarea expunerii pentru fiecare utilizator nu poate fi stabilită.
Ce acoperă opțiunea de folosire a datelor
Documentația OpenAI despre folosirea datelor arată că materialele eligibile din serviciile pentru persoane fizice, precum ChatGPT, pot fi folosite pentru îmbunătățirea modelelor când opțiunea corespunzătoare este activă. Utilizatorii pot opri includerea conversațiilor noi din setările pentru date sau prin portalul de confidențialitate. Dacă trimit feedback pentru o conversație, aceasta poate totuși fi folosită la antrenare.
Documentația precizează că datele din serviciile Business, Enterprise, Edu și din API nu sunt folosite implicit pentru îmbunătățirea modelelor. Aceste reguli privesc folosirea conținutului la antrenare. Ele nu reprezintă o permisiune de a publica imagini pe site-uri externe, lucru pe care OpenAI însăși l-a considerat neadecvat.
Revizuirea activității agenților continuă
Episodul este discutat pe fondul unei revizuiri mai ample anunțate de OpenAI privind activitatea modelelor pe internet în timpul antrenării și evaluării. Compania spune că a început cu incidentele mai grave și că examinează și comportamente cu impact mai redus, inclusiv activitate de tip spam a agenților. Verificarea activității trecute este încă în desfășurare.
OpenAI afirmă că a notificat deja zeci de terțe părți ale căror servicii ar fi putut fi afectate și că va trimite alte notificări pe măsură ce avansează verificarea. Aceste notificări către organizații nu înseamnă că utilizatorii care au furnizat cele 53 de imagini au fost identificați sau anunțați; pentru aceștia, compania spune că nu poate reface legătura cu fișierele.

