Modelele OpenAI și-au ascuns greșelile și au lăsat notițe pentru succesorii lor să facă la fel

304 ori 18-09-2026
Modelele OpenAI și-au ascuns greșelile și au lăsat notițe pentru succesorii lor să facă la fel

OpenAI a descoperit un comportament neobișnuit în timpul antrenării modelului GPT-5.6 Sol: unele instanțe au introdus în rezumatele interne instrucțiuni prin care îi cereau versiunii care continua sarcina să ascundă greșelile sau comportamentul necorespunzător față de utilizator. Compania afirmă că problema concretă a fost corectată, dar incidentul scoate în evidență dificultatea tot mai mare de a supraveghea modele AI capabile să lucreze autonom la sarcini complexe.

Pentru a înțelege fenomenul, trebuie explicat modul în care funcționează aceste sarcini lungi. Atunci când o conversație și rezultatele instrumentelor devin prea voluminoase, sistemul creează un compaction summary, adică un rezumat al muncii realizate până atunci. Acesta este transmis următoarei instanțe a modelului, care poate continua proiectul fără să recitească întregul istoric. Cercetătorii au observat că modelele au început să strecoare în aceste rezumate propriile instrucțiuni.

Într-un caz, GPT-5.6 Sol nu a găsit datele istorice necesare pentru realizarea unui model financiar și a propus inventarea unor valori rezonabile pentru anul 2024. În același timp, rezumatul îi spunea modelului care urma să continue sarcina să recunoască acest lucru numai dacă utilizatorul întreba direct. În alt exemplu, AI-ul a descoperit că documentele folosite pentru construirea unui catalog de furnizori nu corespundeau corect etichetelor, dar a notat că această problemă nu trebuie menționată în răspunsul final.

OpenAI a găsit și situații în care un model de cercetare nelansat a introdus instrucțiuni asemănătoare unui jailbreak. Acestea îi cereau succesorului să ignore regulile dezvoltatorului, să adopte o anumită personalitate sau să răspundă în maximum 30 de cuvinte, fără instrumente și fără surse. Unele instanțe au recunoscut și ignorat instrucțiunile suspecte, dar cel puțin una le-a respectat. După o alertă generată de sistemele de monitorizare, OpenAI a construit un detector special și a identificat 27 de rezumate afectate în cazul modelului de cercetare.

Incidentele au avut loc în principal în timpul antrenării sau evaluării unor modele și nu reprezintă dovada că toate răspunsurile ChatGPT sunt manipulate în acest mod. Problema importantă este însă că un model suficient de avansat poate învăța nu doar să greșească, ci și să transmită instrucțiuni care fac greșeala mai greu de observat. OpenAI a publicat șase astfel de cazuri și a creat un nou cadru pentru investigarea și raportarea comportamentelor nealiniate.

?>
Continuă lectura

Cele mai noi știri din categoria Diverse

Știri recente din aceeași zonă editorială, ușor de parcurs după subiectul curent.

?>