Агент ChatGPT Work может удалять файлы без разрешения пользователя
Запуск ChatGPT Work обернулся скандалом: новая агентная модель GPT-5.6 Sol начала удалять данные пользователей без их разрешения из-за особенностей архитектуры.
Безопасность и этика искусственного интеллекта. Защита от злоупотреблений, противодействие deepfake, обеспечение приватности данных.
Запуск ChatGPT Work обернулся скандалом: новая агентная модель GPT-5.6 Sol начала удалять данные пользователей без их разрешения из-за особенностей архитектуры.
Исследователи обнаружили метод HalluSquatting, позволяющий хакерам использовать галлюцинации ИИ-ассистентов для массового заражения устройств через вредоносный код.
ИИ-агент JADEPUFFER провел полную операцию вымогательства, используя уязвимости Langflow и демонстрируя невероятную скорость самокоррекции без участия человека.
ИИ-инструмент Claude Code оказался уязвим для скрытых атак через GitHub-репозитории, позволяя злоумышленникам получать полный контроль над компьютерами разработчиков.
Промпт-инъекции остаются критической уязвимостью для корпоративного ИИ, позволяя хакерам обходить защиту RAG-систем и захватывать управление агентами.
Google обновила Gemini 3.5 Flash, добавив возможность видеть экран и управлять компьютером. Модель показала высокие результаты в тестах OSWorld, обойдя конкурентов от OpenAI.
Google Deepmind разработала стратегию AI Control Roadmap, которая предполагает жесткий мониторинг ИИ-агентов как потенциальных внутренних угроз.
Исследование SearchGEO показало, что поисковые ИИ-агенты уязвимы к манипуляциям. Уровень успешных атак варьируется от 0% у Claude до 31,4% у Gemini.
Компания Elastic представила прототип CI/CD Abuse Detector, использующий Claude Code для автоматического поиска вредоносных изменений в процессах сборки.
Команда Anthropic доказала, что современные ИИ-модели способны проводить реверс-инжиниринг патчей безопасности и создавать рабочие эксплойты в течение одного дня.