Белый шум модерации

OpenAI: усиление защиты ChatGPT Atlas от prompt injection

OpenAI: усиление защиты ChatGPT Atlas от prompt injection

Факт: OpenAI сообщает, что усиливает ChatGPT Atlas против атак prompt injection. Для этого используется automated red teaming, обученный с reinforcement learning.

Что поменялось: заявлен проактивный цикл discover-and-patch. Он должен помогать раньше находить новые варианты эксплойтов и усиливать защиту browser agent по мере того, как AI становится более agentic.

Кого задевает:
— команды, тестирующие AI-браузеры и агентные сценарии
— продукты с доступом AI к веб-страницам и пользовательским данным
— compliance и security-функции, оценивающие риски prompt injection

Что делать: учитывать prompt injection как отдельный риск в агентных браузерах. Для внутренних тестов фиксировать не только успешность задач, но и поведение агента при недоверенном контенте на страницах.
Источники:
Этот пост опубликован в Telegram-канале Белый шум модерации. Подписаться можно по ссылке: @rule_change.
buyer

Свежие посты в категории «Buyer Tactics»

Все каналы категории →

start

Готовы запустить рекламу через сеть public.tg?

Новый оффер, продукт, GEO, кейс, событие или партнёрский запуск — соберём маршрут под задачу и отдадим медиаплан.

Telegram для медиаплана: @AFFtop_connect. Быстрый тест: $20 за канал, $1000 за пакет по сети.