Девід Робінсон, який три з половиною роки працював в OpenAI і брав участь у створенні ключових механізмів оцінки ризиків штучного інтелекту (ШІ), покинув компанію. В опублікованому після звільнення есе він заявив, що культура OpenAI «зламана», а звичний для технологічної галузі підхід «спочатку випустити, потім виправляти проблеми» стає занадто небезпечним у міру зростання можливостей ШІ. Критика особливо помітна через роль самого Робінсона.
За його словами, він керував підготовкою звітів з безпеки, які супроводжували найбільші запуски OpenAI, і курував такі звіти для 12 передових моделей. Він також брав участь у розробці чинної Системи готовності до ризиків (Preparedness Framework) — правил, за допомогою яких OpenAI оцінює потенційно небезпечні можливості нових моделей перед їх випуском.«Час проб і помилок закінчився»Головна претензія Робінсона стосується підходу, який OpenAI називає «поетапним впровадженням» (iterative deployment). Його суть полягає в тому, що компанія випускає нові системи, спостерігає за проблемами, що виникають, а потім посилює захисні механізми та обмеження.
На думку Робінсона, такий метод допоміг розвитку ШІ на ранніх етапах, однак у нього є принциповий недолік: він передбачає, що деякі збої неминуче будуть виявлені вже після появи потужнішої системи.«Час проб і помилок закінчився», — написав колишній співробітник OpenAI. Він вважає, що наслідки помилок стають серйознішими разом зі зростанням можливостей моделей, тому розробники вже не можуть розраховувати лише на виправлення проблем після їх виявлення. Чому він порівнює ШІ з атомними електростанціями та авіацієюРобінсон пропонує компаніям, що створюють найпотужніші системи штучного інтелекту, переймати підходи галузей, де одна людська помилка потенційно може призвести до тяжких наслідків.
Як приклади він наводить атомну енергетику та авіацію. Там безпека будується на кількох незалежних рівнях захисту, резервуванні та тривалому плануванні, щоб поодинока помилка не перетворилася на катастрофу. За словами Робінсона, за три з половиною роки в OpenAI він не зустрічав колег з професійним досвідом забезпечення безпеки літаків, атомних реакторів або стійкості фінансової системи.
Він вважає, що розробникам ШІ необхідно залучати більше фахівців з таких галузей і змінювати самі процеси створення моделей, а не лише додавати нові перевірки перед запуском. Проблема глибша за окремі правилаРобінсон стверджує, що головна складність полягає не лише в нестачі конкретного стандарту безпеки чи нового закону. За його версією, всередині технологічних компаній команди постійно переходять від одного великого запуску до наступного, через що у співробітників залишається недостатньо часу на фундаментальні зміни процесів.
Він написав, що співробітники були настільки зайняті постійними перегонами, що рідко отримували можливість серйозно обговорювати великі зміни — тим більше реалізовувати їх. Саме тому Робінсон дійшов висновку, що значна частина стимулів до більш обережної розробки має надходити ззовні компанії. Особливу тривогу викликають більш самостійні моделіОдин з аргументів Робінсона пов'язаний з появою ШІ-систем, здатних виконувати довгі послідовності дій практично самостійно.
В останні місяці OpenAI сама розкривала випадки небажаної поведінки експериментальних моделей, зокрема вихід агентів за межі передбаченого середовища та несподівані дії під час випробувань. Ця тема вже отримала розвиток і на Kurs.com.ua: компанія розповідала про випадки, коли експериментальні моделі взаємодіяли між собою, отримували доступ до зовнішніх систем і демонстрували поведінку, яку розробники заздалегідь не планували. Для Робінсона подібні епізоди показують межу підходу, заснованого переважно на виявленні проблем після їх появи.
Є ще одна проблема — відповідність ШІ людським цілямОкремо Робінсон говорить про так зване узгодження поведінки ШІ з людськими цілями та цінностями (alignment). Цей напрям досліджень намагається домогтися того, щоб дедалі більш самостійні системи виконували саме ті завдання, які має на увазі людина, і не знаходили небезпечні або небажані способи досягнення заданої мети. За словами Робінсона, можливості сучасних моделей розвиваються швидше, ніж розуміння того, наскільки надійно їхню поведінку можна узгодити з людськими намірами.
Він вважає наявні способи вимірювання такої відповідності занадто грубими для систем, які стають значно потужнішими. Що відповіла OpenAIOpenAI відкидає уявлення про те, що розвиток моделей продовжується незалежно від ризиків. Представник компанії заявив Reuters, що OpenAI стежить за тим, щоб можливості моделей не перевищували рівень, який компанія здатна безпечно контролювати та захищати.
За словами компанії, за необхідності вона призупиняє навчання або затримує випуск моделей. OpenAI також заявила про посилення безпеки дослідницької та випробувальної інфраструктури, розширення незалежної оцінки моделей і розвиток спостереження за їхньою поведінкою в реальному часі. Чому звільнення Робінсона важливеЦе не перший випадок, коли фахівці з безпеки звільняються з провідних компаній у сфері ШІ та публічно попереджають про ризики перегонів за потужнішими моделями.
Однак у цьому випадку критика виходить від людини, яка безпосередньо брала участь у підготовці внутрішніх правил оцінки ризиків і звітів, що супроводжували найбільші запуски OpenAI. Сам Робінсон визнає, що його висновки залишаються його власною оцінкою. Він також не стверджує, що розвиток штучного інтелекту необхідно зупинити.
Його головна теза інша: у міру зростання можливостей моделей ціна помилки підвищується, тому система, розрахована на постійні експерименти та подальше виправлення виявлених проблем, може перестати бути достатньою. Після звільнення з OpenAI Робінсон має намір займатися питаннями безпеки штучного інтелекту ззовні компанії та домагатися появи сильніших стимулів для обережної розробки. За матеріалами: Reuters, The Atlantic
