OpenAI: усиление защиты ChatGPT Atlas от prompt injection
Факт: OpenAI сообщает, что усиливает ChatGPT Atlas против атак prompt injection. Для этого используется automated red teaming, обученный с reinforcement learning.
Что поменялось: заявлен проактивный цикл discover-and-patch. Он должен помогать раньше находить новые варианты эксплойтов и усиливать защиту browser agent по мере того, как AI становится более agentic.
Кого задевает:
— команды, тестирующие AI-браузеры и агентные сценарии
— продукты с доступом AI к веб-страницам и пользовательским данным
— compliance и security-функции, оценивающие риски prompt injection
Что делать: учитывать prompt injection как отдельный риск в агентных браузерах. Для внутренних тестов фиксировать не только успешность задач, но и поведение агента при недоверенном контенте на страницах.
Белый шум модерации
@rule_change
OpenAI: усиление защиты ChatGPT Atlas от prompt injection
Источники:
Этот пост опубликован в Telegram-канале Белый шум модерации. Подписаться можно по ссылке: @rule_change.