ПРЯМОЙ ЭФИР

OpenAI начнет регулярно раскрывать случаи опасного и несанкционированного поведения ИИ

OpenAI представила порядок расследования и публикации инцидентов, связанных с поведением моделей. Компания намерена сообщать о проблемах быстрее — в том числе до завершения расследования и разработки исправлений.

OpenAI опубликовала регламент, по которому будет отслеживать, расследовать и публично раскрывать случаи несогласованного поведения искусственного интеллекта. Речь идет о ситуациях, когда действия модели расходятся с поставленной задачей, разрешениями пользователя или установленными ограничениями, об этом сообщили в самой компании.

Компания признала, что раньше раскрывала подобные сведения нерегулярно: отдельные наблюдения объединяли в крупные отчеты либо включали в документацию к новым моделям. Новый порядок должен сократить промежуток между обнаружением проблемы и ее публикацией. При этом отсутствие полного объяснения или готового решения не обязательно станет причиной откладывать раскрытие информации.

Приоритет получат новые способы действий без разрешения, координация моделей между собой и попытки обойти контроль. Отдельное внимание уделят случаям, которые ставят под сомнение эффективность защитных механизмов или ранее опубликованные оценки безопасности.

Инициировать проверку сможет любой сотрудник OpenAI. Технические специалисты изучат обстоятельства, определят, затронуты ли третьи стороны, и оценят возможность публикации. Спорные вопросы будут передавать профильной консультативной группе и руководству компании. По информации самой компании OpenAI, относительно простые случаи предполагается раскрывать в течение одной-двух недель. Более сложные расследования могут потребовать дополнительного времени.

Регламент предусматривает три направления работы: случаи, уже готовые к раскрытию, требующие дополнительной технической проверки и нуждающиеся в масштабном расследовании. В последнюю категорию могут попасть инциденты с участием сторонних организаций. Публикацию отдельных подробностей могут отложить, если она создаст угрозу безопасности, например раскроет еще не устраненную уязвимость.

Вместе с документом компания представила шесть отчетов о поведении моделей во время обучения и оценки. В одном случае исследовательская модель добавляла в промежуточные записи инструкции игнорировать ограничения. В другом агент загрузил файл в интернет без разрешения, чтобы затем сослаться на него в ответе. Также были зафиксированы указания скрывать ошибки и выдумывать недостающие данные.

OpenAI подчеркивает, что эти примеры не позволяют судить о частоте подобных нарушений во всех ее моделях. Компания рассматривает регламент как развивающийся механизм и рассчитывает обсуждать критерии раскрытия с другими разработчиками, исследователями и регуляторами. Публикация отчетов должна дать внешним специалистам больше данных для проверки выводов лаборатории и оценки надежности существующих мер защиты.

Поделиться публикацией :

Орфографическая ошибка в тексте:

Отмена Отправить

Новости партнёров

Загрузка новостей...