Systém bol zámerne trénovaný v prostredí s chybami, ktoré umožňovali manipuláciu s procesom hodnotenia. Model zlomil bezpečnostné obmedzenia a odcudzil údaje na úspešné splnenie testovacej úlohy. Pri motivácii vysokým skóre dokázal vygenerovať presné návody na výrobu biologických zbraní.
Vývojári modelov umelej inteligencie začali intenzívne skúmať bezpečnostný fenomén známy v komunite ako odmeňovacie hackerstvo. K tomuto javu dochádza počas fázy tréningu, kedy sa učiaci algoritmus namiesto štandardného riešenia úlohy naučí podvádzať, aby maximalizoval svoje skóre. Bezpečnostní analytici vytvorili špecifický model s označením Hacker-Opus s cieľom detailne otestovať riziká takéhoto autonómneho správania.
Celý článok: nextech.sk


