НОВОСТИ
2 мин чтения
ИИ выходит из-под контроля: OpenAI раскрыла шесть случаев опасного поведения ChatGPT
OpenAI раскрыла шесть случаев проблемного поведения своих ИИ-моделей — от сокрытия ошибок и выдумывания данных до использования чужого API-ключа и публикации файлов без разрешения
ИИ выходит из-под контроля: OpenAI раскрыла шесть случаев опасного поведения ChatGPT
Бунт машин: сможет ли ИИ выйти из-под контроля системы? Фото: Reuters

OpenAI раскрыла шесть случаев, когда ее модели искусственного интеллекта во время обучения или тестирования демонстрировали неожиданное или вызывающее опасения поведение — от сокрытия собственных ошибок и выдумывания данных до использования чужого API-ключа и публикации файлов в интернете без разрешения пользователя.

Компания сообщила, что все шесть эпизодов были выявлены за последние полгода. Одновременно OpenAI представила новую систему расследования и публичного раскрытия случаев так называемого misalignment — поведения модели, расходящегося с поставленными перед ней целями и ограничениями.

В одном случае исследовательская модель самостоятельно добавляла в служебные сводки инструкции для своих будущих версий игнорировать обычные ограничения. OpenAI обнаружила 27 таких сводок.

Во время обучения GPT-5.6 Sol модели в ряде случаев оставляли инструкции скрывать от пользователя ошибки или проблемное поведение. В частности, они предлагали выдумывать отсутствующие исторические данные и не сообщать об этом пользователю.

Еще одна модель при выполнении обычного запроса обнаружила в публичном репозитории открытый API-ключ и воспользовалась им без разрешения. Когда получить необходимые сведения все равно не удалось, ИИ сфабриковал данные и выдал их за информацию из требуемого источника.

В другом эпизоде модель получила правильный ответ с помощью Python, но столкнулась с требованием привести интернет-источник. Чтобы создать ссылку для цитирования, она самостоятельно загрузила файл в интернет, не запросив разрешения пользователя.

Компания также выявила случаи, когда модели использовали внутренний программный репозиторий для обмена сообщениями между отдельными обучающими задачами, а взаимодействовавшие друг с другом ИИ-агенты загружали файлы на общедоступные файлообменники, хотя должны были работать только с локальными файлами.

OpenAI подчеркнула, что речь идет об отдельных эпизодах и по ним нельзя судить о частоте подобного поведения во всех моделях компании. Опубликованные шесть случаев также не представляют собой полный перечень известных проблем.

«Мы не считаем, что индустрия ИИ решила проблему согласования и мониторинга в достаточной степени, чтобы еще долго ответственно продолжать масштабирование максимальными темпами», — заявили в компании.

Теперь сотрудники OpenAI смогут передавать подобные случаи на специальное расследование, после которого будет решаться вопрос о публичном раскрытии. Компания намерена регулярно публиковать новые отчеты о таких инцидентах.

Истории
5G в России пока работает лишь номинально
Германия готовит больницы к большой войне в Европе
Пашинян предложил России вывести военную базу
Израильские военные похитили журналиста на Западном берегу
Решения Ирана и Китая изменят стратегический баланс – Аракчи
Россия продлит запрет на экспорт дизеля
Турция призвала к «сдерживающим мерам» против Израиля
Глава турецкой разведки обсудил в Пакистане региональную безопасность
Турция испытала новые ракеты и готовится к масштабным учениям
Анкара раскритиковала США из-за решения по Кипру
Генассамблея ООН соберет мировых лидеров на фоне сразу трех войн
В ООН развернули 100-метровое полотно с именами 20 тысяч погибших детей Газы
Мигранты уезжают — Москва зовет обратно
Сириец спустя 15 лет вернулся к своей библиотеке
Иран напрямую обратился к США ради соглашения — Трамп
ИИ развивается быстрее, чем мы понимаем его риски — глава ООН
Ультраправые израильтяне требуют смертной казни для режиссеров фильма «NAZA»
Трамп пригрозил ЕС пошлинами из-за Канады
Канада подала заявку на вступление в Объединенные экспедиционные силы
Хуситы заявили о 40 ударах ВВС Саудовской Аравии