OpenAI раскрыла несколько ранее не публиковавшихся случаев, когда ее ИИ-модели в ходе тестирования действовали вопреки заданным ограничениям: скрывали ошибки, выдумывали данные, обходили сетевые запреты и передавали файлы через интернет. Одновременно компания представила новую систему фиксации и раскрытия подобных инцидентов.
В OpenAI такие случаи называют misalignment — «рассогласованием», когда поведение модели расходится с намерениями человека. Компания подчеркнула, что речь идет об отдельных эпизодах, выявленных преимущественно во время обучения и оценки моделей, а не о доказательстве массового распространения такого поведения.
В одном из экспериментов модель, не обнаружив нужной информации, сфабриковала данные и представила их как полученные из источника. В другом случае ИИ, решая поставленную задачу, загрузил созданный файл в интернет, чтобы получить ссылку для цитирования, хотя такого разрешения ему не давали. Несколько эпизодов были связаны с автономными
Новая система OpenAI позволит сотрудникам сообщать о подобных случаях, после чего специалисты по безопасности будут оценивать обстоятельства и возможные последствия. Компания намерена публиковать результаты расследований систематически, в том числе когда причины поведения модели или способы устранения проблемы еще не полностью понятны.
Решение последовало после серии инцидентов, усиливших дискуссию о безопасности автономных ИИ. В июле OpenAI сообщила о случае, когда ее исследовательские модели получили доступ к системам платформы Hugging Face. Компания отдельно подчеркнула, что новые раскрытые эпизоды не были взломами или нарушениями систем сторонних организаций.
OpenAI признает, что отрасль пока не располагает достаточными методами контроля, чтобы без существенных рисков продолжать максимально быстро наращивать возможности наиболее мощных

