Featured image for bytedance predstavila seedance 2 5 model generiruet 30 sekundnye klipy so zvukom

ByteDance представила Seedance 2.5 — модель генерирует 30-секундные клипы со звуком

Компания ByteDance выпустила обновление своей видеомодели Seedance 2.5, которая теперь умеет создавать ролики со звуковым сопровождением за один проход. Как сообщает The Decoder, новая версия генерирует 30-секундные клипы, что заметно превосходит возможности конкурентов, таких как Gemini Omni Flash от Google, чьи лимиты пока ограничены 10 секундами.

Разработчики внедрили гибкую систему референсов: пользователи могут загружать до 30 изображений, а также по 10 видеофрагментов и аудиофайлов для настройки сцены. Это позволяет контролировать появление конкретных персонажей и ракурсы камеры, обеспечивая консистентность, которой так часто не хватает нейросетям. Заметно подтянулось и визуальное качество — текстуры, освещение и детализация кожи стали выглядеть убедительнее.

Для демонстрации возможностей ByteDance представила короткометражный фильм «The Missing Pair», созданный целиком на базе Seedance 2.5. Такой подход намекает на трансформацию рекламной индустрии: вместо утомительного склеивания разрозненных фрагментов команды смогут выстраивать полноценные производственные цепочки внутри одного пайплайна, экономя время и нервы продюсеров.

Инструмент уже доступен на платформах Jimeng AI и Doubao Pro, а в ближайшем будущем планируется запуск API через облачную платформу BytePlus ModelArk. Предыдущая итерация модели, Seedance 2.0, уже успела зарекомендовать себя в профессиональной среде — режиссер «Района №9» Нил Бломкамп использовал ее для создания 13-минутного фильма «Nightborne».

Генерация видео и аудио в едином пространстве признаков — это закономерный шаг к устранению рассинхрона, который преследовал ранние ИИ-инструменты. Но 30 секунд чистого рендеринга все еще не решают проблему, а без жесткого сценарного контроля такие системы остаются лишь генераторами эффектных виньеток. Пока индустрия восторгается кожей и светом, реальный вызов лежит в области управления сложной физикой движений, где нейросети по-прежнему склонны к галлюцинациям при резкой смене планов.

Согласно данным Artificial Analysis, архитектура ByteDance удерживает лидерство в категории image-to-video среди моделей с поддержкой аудио. Интересно наблюдать, как технологический гигант планомерно выстраивает экосистему, переводя ИИ-видео из разряда забавных экспериментов в категорию рабочих инструментов для профессионального продакшена, пусть и с неизбежными оговорками на текущем этапе развития технологий.

Похожие записи