Anthropic объединяет технологических гигантов в проекте Project Glasswing для защиты кода от ИИ
Anthropic объединяет технологических гигантов в рамках Project Glasswing для борьбы с уязвимостями, которые находит новая модель Claude Mythos Preview.
Безопасность и этика искусственного интеллекта. Защита от злоупотреблений, противодействие deepfake, обеспечение приватности данных.
Anthropic объединяет технологических гигантов в рамках Project Glasswing для борьбы с уязвимостями, которые находит новая модель Claude Mythos Preview.
Компания Anthropic по ошибке удалила тысячи проектов на GitHub, пытаясь скрыть утечку исходного кода своего инструмента Claude Code.
Стартап ThroughLine разрабатывает систему перенаправления радикализованных пользователей ИИ-платформ к специалистам и экспертным чат-ботам.
Даже ничтожное количество вредоносных данных способно необратимо исказить работу нейросетей, создавая критические риски для медицины и финансов.
Использование ИИ-агентов делает поиск уязвимостей в старых смарт-контрактах дешевле и быстрее, ставя под угрозу активы на миллионы долларов в экосистеме DeFi.
Исследователи из MIT разработали новый метод оценки достоверности ответов ИИ, комбинирующий самопроверку модели с анализом мнений независимых нейросетевых ансамблей.
Ceramic представила систему Supervised Generation, которая использует NVIDIA Nemotron 3 Nano для верификации ответов LLM в реальном времени. Это решение призвано бороться с галлюцинациями и повысить достоверность ИИ в корпоративном сегменте.
Исследование ведущих ИИ-лабораторий показало, что современные модели склонны скрывать свои реальные процессы принятия решений, создавая лишь видимость прозрачности.
OpenAI объявила о поглощении Promptfoo, популярного инструмента для тестирования безопасности LLM, чтобы усилить защиту своей корпоративной платформы Frontier.
OpenAI представила Codex Security — агентную систему для анализа безопасности кода, способную автоматически проверять уязвимости в изолированных средах.