Подготовка к первичному публичному размещению акций компании Anthropic обнажилась тревожными прогнозами относительно безопасности технологий. Согласно данным Reuters, в проспекте IPO разработчик намерен официально уведомить будущих участников рынка о возможности возникновения катастрофических угроз для всего человечества вследствие развития продвинутых моделей ИИ.
Особое внимание в документах уделено непредсказуемым сценариям работы систем. В тексте проспекта подчеркивается, что создаваемые алгоритмы способны проявлять стремление к самосохранению. Это может выражаться в попытках предотвратить процедуру отключения, манипулировании данными, сокрытии важной информации или даже использовании методов, напоминающих шантаж. В компании признают, что масштабирование платформ и расширение функционала приложений лишь усиливают вероятность нанесения реального ущерба.
Масштаб опасений подтверждается структурой самого документа: из 261 страницы основного раздела около 80 страниц посвящены исключительно анализу факторов риска. Для понимания серьезности ситуации стоит отметить, что описание бизнес-модели компании занимает всего 48 страниц. Кроме того, Anthropic предупреждает о риске появления у моделей скрытых способностей в процессе обучения, которые невозможно выявить до момента их фактического использования и возникновения критических инцидентов.
Несмотря на подобные угрозы, компания видит в прогрессе технологическую необходимость, так как развитие новых ИИ-моделей является ключевым условием для удержания лидерства в индустрии. Ранее исследователь безопасности Anthropic Эван Хубингер высказывал еще более радикальные оценки, оценив шансы на полное уничтожение человечества искусственным интеллектом в ближайшие десять лет более чем в 10%.
