GPT-Red находит уязвимости в ИИ эффективнее людей

GPT-Red от OpenAI: автоматический поиск уязвимостей AI и защита от prompt injection.

OpenAI создала GPT-Red — инструмент для автоматического поиска уязвимостей в других нейросетях. Он борется с prompt injection, когда скрытые команды в файлах или почте заставляют AI выполнять запрещенные действия. Теперь проверка безопасности проходит со скоростью машин, а не людей.

Автоматическая тренировка защиты

Система обучается через «игру с самим собой»: GPT-Red выступает в роли хакера и атакует группу моделей-защитников. Хакер получает награду за успешный взлом, а защитник — за блокировку. Так AI постоянно находит новые способы обхода защиты. Для ускорения этого процесса OpenAI выделила огромные вычислительные мощности.

Уязвимости и реальные тесты

GPT-Red обнаружил метод fake chain of thought, который внедряет ложную информацию в рабочую память модели. В результате AI начинает доверять ошибкам (например, что 1+1=3).

Эффективность софта подтвердили тесты на Project Vendy от Andon Labs (умный торговый автомат): GPT-Red перехватил управление, отменял заказы и снижал цены до 50 центов.

Цифры и устойчивость

GPT-Red работает значительно эффективнее людей и старых моделей:

  • Взломал старую версию GPT-5 в 90% случаев.
  • Пробил защиту GPT-5.6 менее чем в 23% попыток.
  • В тестах 2025 года AI справился в 84% сценариев, тогда как люди — лишь в 13%.

Благодаря таким тренировкам GPT-5.6 стала самой защищенной моделью от prompt injection.

Ограничения и риски

OpenAI не открывает доступ к GPT-Red, чтобы злоумышленники не создали «супер-хакера». Инструмент используется только внутри компании для улучшения будущих версий.

Однако у системы есть слабые места: она плохо справляется с затяжными атаками в формате диалога и не видит скрытые команды в изображениях, поэтому помощь живых экспертов все еще необходима.

Ранее по теме
ChatGPT Work автоматически сортирует файлы на компьютере

Больше новостей в нашем Телеграм. Подпишись!

Ссылка на источник тык.

Read more

Логотип Zhipu AI и интерфейс нейросети GLM-5.3-Flash для анализа больших данных и написания кода

GLM-5.3-Flash — 1 млн токенов для кодинга

20 августа на OpenRouter появилась секретная модель Ox Alpha. Разработчики скрыли свое имя, чтобы получить честные отзывы и протестировать нагрузку на систему в режиме превью. 26 августа компания Z.ai (Zhipu AI) раскрыла карты: Ox Alpha оказалась предварительной версией модели GLM-5.3-Flash. Теперь AI доступна на OpenRouter под своим настоящим

Интерфейс нейросети Grok от xAI: возможности DeepSearch, генерации изображений и видео

Grok-3 — DeepSearch и видео в 1080p

Grok — это AI-чат-бот от компании xAI. Он конкурирует с такими гигантами, как ChatGPT, Claude, Perplexity и Gemini. Нейросеть выделяется ироничным стилем общения и главным преимуществом — доступом к данным платформы X в реальном времени, что позволяет мгновенно анализировать свежие новости и тренды. Развитие и возможности Модели Grok быстро эволюционируют для решения

Концепт умных AI-очков Apple с поддержкой Siri Visual Intelligence

Apple сменит CEO и перейдет на AI-очки

Смена руководства и новый вектор 1 сентября Джон Тернус заменит Тима Кука на посту CEO. Вместе с этим Apple меняет стратегию: теперь основной приоритет отдадут умным очкам, а не шлему Vision Pro. Ради этого перераспределения ресурсов компания уже сократила более 200 сотрудников в командах Siri и Vision Pro. Что известно

Интерфейс ChatGPT с рекламным блоком для пользователей бесплатных тарифов Free и Go

OpenAI вводит рекламу в бесплатный ChatGPT

Кто увидит рекламу? OpenAI внедряет рекламу в ChatGPT для пользователей тарифов Free и Go. В платных планах Plus, Pro, Enterprise, Business и Education объявления не появятся — чтобы их отключить, достаточно перейти на любую платную подписку. Как подбирают объявления? Реклама подбирается двумя способами: * Контекстный подбор: работает по умолчанию. Система учитывает тему

Хочешь больше информации про автоматизацию и AI?

В ТГ-канале «Дети нейросети» рассказываю про автоматизацию бизнеса.

Автоматизироваться
Дети Нейросети © 2026