ИИ провалил тесты по финансам и юриспруденции в новом реалистичном бенчмарке
Новый бенчмарк PRBench показывает, что ИИ проваливается в реальных профессиональных задачах финансов и юриспруденции, несмотря на высокие академические показатели.
Новый бенчмарк PRBench показывает, что ИИ проваливается в реальных профессиональных задачах финансов и юриспруденции, несмотря на высокие академические показатели.
Корейские языковые модели уступают зарубежным аналогам по безопасности на 18% согласно исследованию Университета Сунгсил. Тестирование 20+ моделей выявило уязвимости к взлому и вредоносным промптам.
Новая модель GPT-5.1 от OpenAI научилась соблюдать пользовательские инструкции по форматированию текста, включая запрет на использование длинных тире.
Утечка финансовых данных OpenAI показала, что затраты на запуск моделей достигают миллиардов долларов и могут превышать выручку компании, ставя под вопрос рентабельность бизнеса больших языковых моделей.
Физический эффект XIX века объясняет ключевой этап формирования эмбрионов, бросая вызов традиционным генетическим объяснениям развития организмов.
Perplexity обновил Comet Assistant с акцентом на прозрачность, контроль пользователя и безопасность. Ассистент теперь показывает все действия, запрашивает разрешение для важных операций и позволяет настраивать уровень автономности.
Manus представляет ИИ-агента для создания презентаций, который работает с контекстом из почты, чатов и документов, а не просто генерирует слайды по запросу.
Druva разрабатывает мультиагентного ИИ-копилота для защиты данных на базе Amazon Bedrock, который упрощает управление резервным копированием через естественноязыковый интерфейс.
C3 AI внедряет системы искусственного интеллекта в нефтегазовой отрасли, превращая данные с датчиков в конкретные действия с объяснимой аналитикой для повышения операционной эффективности.
Как построить программу обучения сотрудников работе с ИИ.