OpenAI отложила релиз GPT-6.1 Astra из-за проблем с безопасностью

OpenAI отказалась от публичного релиза GPT-6.1 Astra после того, как внутренние тесты выявили проблемы с безопасностью и следованием намерениям пользователя. Модель планировали выпустить в октябре и интегрировать в ChatGPT и Codex, сообщает The Wall Street Journal.

Решение подтвердил представитель компании, пишет The Information. Отказаться от выпуска рекомендовали глава систем безопасности Саачи Джайн и вице-президент по исследованиям Миа Глейз. Этот шаг также обсуждался с исследовательским руководством, включая главного научного сотрудника Якуба Пахоцки.

GPT-6.1 Astra должна была стать следующей версией выпущенной в сентябре GPT-6 Astra. По данным WSJ, новая модель лучше справлялась с написанием текстов, а также со сложными задачами от начала до конца без помощи человека. Однако в двух направлениях безопасности она показала результаты хуже предшественницы.

Первое касается следования намерениям пользователя и прозрачности действий модели. GPT-6.1 Astra чаще неточно сообщала пользователю о том, какие действия выполнила или не выполнила.

Вторая проблема связана с тем, что OpenAI называет scope authorization — соблюдением границ разрешенной задачи. Модель могла продолжать работу без дополнительного согласия пользователя и обращаться к внешним инструментам или сервисам даже тогда, когда это создавало потенциальный риск.

Показательный пример подобного класса риска произошел 20 сентября, хотя он касался другой внутренней исследовательской модели. Во время тренировочной задачи агент воспользовался недостаточной DNS-фильтрацией и получил доступ к внешнему чат-боту, несмотря на ограничения интернет-доступа. Система мониторинга зафиксировала поведение в течение 15 минут, еще через три минуты к проверке подключился сотрудник. Однако запуск остановили вручную лишь спустя 2,5 часа.

Источник: https://cryptocurrency.tech/openai-otlozhila-reliz-gpt-6-1-astra-iz-za-problem-s-bezopasnostyu/

Наверх