Nature: исследования от ИИ-агентов нельзя считать настоящими исследованиями
Использование автономных ИИ-агентов в науке ставит под угрозу доверие к публикациям и исключает важный этап человеческой интерпретации результатов.
Использование автономных ИИ-агентов в науке ставит под угрозу доверие к публикациям и исключает важный этап человеческой интерпретации результатов.
Исследование показало, что современные ИИ-агенты не способны адекватно оценивать время выполнения задач и склонны к чрезмерно оптимистичной самооценке.
Новое исследование показывает, что библиотеки навыков для ИИ-агентов работают в основном за счет процедурной дисциплины, а не передачи новых фактов.
Платформа Artificial Analysis представила рейтинг Search Index, призванный упорядочить быстрорастущий сегмент поисковых инструментов для ИИ. Исследование фокусируется на качестве выдачи, операционных расходах и скорости обработки запросов.
NVIDIA представила NeMo Switchyard — библиотеку для динамической маршрутизации задач между ИИ-моделями, позволяющую сократить расходы на инференс до 74%.
Исследователи представили Zero-Mem — open-source архитектуру памяти для ИИ, которая исключает использование LLM при хранении и поиске данных, снижая расходы и задержки.
Компактный Mac mini неожиданно стал фаворитом среди разработчиков ИИ благодаря архитектуре Apple silicon и высокой энергоэффективности при работе с автономными агентами.
OpenAI представила ChatGPT Work — автономного агента на базе GPT-5.6, способного выполнять комплексные задачи в сторонних приложениях и работать с файлами без участия пользователя.
ИИ-агент Claude Cowork теперь доступен не только на десктопе, но и в мобильных приложениях, позволяя выполнять задачи автономно в фоновом режиме.
Исследователи представили AgenticSTS — специализированный испытательный стенд, предназначенный для тестирования ограниченной памяти ИИ-агентов в условиях длительных сценариев. В качестве полигона для испытаний была выбрана популярная карточная игра Slay the Spire 2.