Сбер выдал 445,5 млрд рублей ипотеки в сентябре 2026 года
17:38
Фоторепортаж Древний некрополь в центре Иркутска: парк Парижской коммуны обретает новую жизнь
17:21
Более 630 млн рублей СФР по Иркутской области направило на поддержку будущих мам
17:20
Общегородской субботник пройдет в Иркутске 10 октября
17:18
Обесточились несколько улиц в Октябрьском районе Иркутска
17:00
Сбер отвечал пользователям в чате поддержки на 90 языках — включая татарский и эльфийский
16:46
Сбербанк первым получил лицензию цифрового депозитария
16:40
Приговор вынесли по делу о подкупе при поставках запчастей для трамваев в Иркутске
16:10
МТС остается лидером по числу коммерческих внедрений сетей Private LTE/5G
16:05
Пользователи ГигаЧата теперь могут создавать видео со звуком
15:27
Рецидивист получил срок за махинации с социальным контрактом в Усть-Илимске
15:17
Космос, связь и микроэлектроника: почему абитуриенты из Иркутска выбирают ТУСУР в Томске
14:53
10 детей пострадали в ДТП на дорогах Иркутска и района за две недели
14:51
Глава Национального ESG Альянса высоко оценил передовые практики экологического менеджмента проекта Сухой Лог
14:40
Аферисты запугали ученого из института СО РАН в Иркутске утечкой данных сотрудников
14:20

Пользователи ГигаЧата теперь могут создавать видео со звуком

С нейросетью Сбера Kandinsky 6.0 Video любой может создавать видео со звуком — специальные навыки не нужны
Пользователи ГигаЧата теперь могут создавать видео со звуком Предоставлено банком
Пользователи ГигаЧата теперь могут создавать видео со звуком
Фото: Предоставлено банком
Нашли опечатку?
Ctrl+Enter

Пользователи ГигаЧата (12+) могут создавать видео с речью, музыкой и звуками окружения — в Full HD-качестве и полностью бесплатно. Это стало возможно благодаря новой модели Kandinsky 6.0 Video (12+), которая генерирует ролики с синхронным звуком. Чтобы получить готовый ролик с озвучкой, достаточно описать сцену текстом или загрузить первый кадр и добавить описание звукового ряда. Максимальная длительность ролика со звуком — пять секунд, со временем разработчики планируют её увеличить. Кроме того, модель стала лучше передавать физику реального мира: движения людей, животных и техники в роликах выглядят естественнее и правдоподобнее. Kandinsky стал первой российской нейросетью, способной создавать видео с синхронным звуком, сообщает пресс-служба Сбера.

"Мы хотим, чтобы генеративный ИИ стал таким же естественным инструментом креатора, как сегодня текстовый редактор или камера телефона. Любой человек получает возможность снимать более выразительные личные видео. А для профессионального контента это означает более быстрое и выгодное производство. Модель Kandinsky 6.0 Video мы отдаём разработчикам бесплатно и без ограничений — строить на ней свои сервисы может каждый", — сказал старший вице-президент, руководитель блока "Развитие генеративного ИИ" Сбербанка Антон Фролов.

Возможности модели

Kandinsky 6.0 Video — мультимодальная модель, которая одновременно "видит" и "слышит" то, что генерирует. Поэтому диалоги, эффекты и фоновая музыка синхронизированы с картинкой, а губы героя движутся вместе с речью. Если звук не нужен, можно попросить нейросеть создать видео без него. Когда модель не знает, как выглядит объект из запроса, например, новый персонаж поп-культуры, она ищет референсы и генерирует точный результат. Так можно создавать даже те объекты, которые появились уже после обучения модели.

Kandinsky создаёт натуральный звук в широком диапазоне: от разговора и цифровых эффектов до шагов, шума ветра или звука проезжающей машины. В одном ролике можно разыграть диалог, добавить музыку — от "испанской гитары" до "саундтрека к погоне", "лоу-фая для сонного вечера" или любой другой. Модель создает чистый и детализированный звук, без "шипения" и потери качества: в 44 кГц, стандартном качестве большинства стриминговых сервисов.

Эти возможности пригодятся для самых разных задач: с их помощью можно оживить семейную фотографию, записать видеооткрытку с речью или музыкой для близкого человека, снять ASMR-ролик с шелестом бумаги, потрескиванием дров или скрипом снега, или оживить старый мем или кадр из фильма.

Разработчикам новая модель доступна в опенсорсе под лицензией MIT — её можно бесплатно интегрировать в собственные продукты. Модель также будет доступна в популярных инструментах для запуска и интеграции нейросетей, например, FAL (18+), Diffusers (18+), FastVideo (18+), ComfyUI (18+), SGLang (18+) и vLLM-omni (18+). Разработчикам не нужно писать интеграцию с нуля: Kandinsky 6.0 Video можно подключить прямо в существующий продукт.

Качество видео

Kandinsky 6.0 Video создаёт ролики в разрешении до Full HD. В ГигаЧате пользователи смогут выбрать нужное качество прямо в окне ввода перед отправкой запроса: SD для более быстрой генерации, HD или Full HD для более чёткой и детализированной картинки. Kandinsky 6.0 Video точнее передаёт физику реального мира. Движения людей, животных и предметов в роликах выглядят естественнее, а сцены целиком — правдоподобнее. Это особенно заметно в динамичных роликах с быстрым движением или сменой ракурса.

Обновление будет полезно всем, кто создаёт видео — в профессиональных и личных проектах:

● Авторам контента для соцсетей: создать короткий ролик с озвученной репликой персонажа или фоновым звуком без микрофона, актёров и монтажа звука.

● Малому бизнесу: сделать голосовой рекламный ролик о товаре или услуге без съёмочной группы.

● Маркетологам и SMM-специалистам: собрать тестовый ролик с диалогом и фирменной атмосферой — звуком окружения и музыкальной подложкой — для соцсетей и мессенджеров.

● Преподавателям: оживить архивное фото или портрет исторической личности с озвученной репликой — для урока истории или литературы.

● Дизайнерам: собрать черновой ролик со звуком для питча или демонстрации идеи.

Как обучали модель

Kandinsky 6.0 Video состоит из двух связанных модулей, которые отвечают за создание видео и звука. Звуковой модуль обучен более чем на 20 млн разнообразных видео со звуком. Для обучения команда отбирала ролики только с чистым, качественным звуком, а также видео с говорящими людьми крупным планом для более точной синхронизации речи и мимики.

В Kandinsky 6.0 Video Pro (18+) качество генерации значительно выросло в общем визуальном качестве, следовании промпту и движении камеры. Новая модель лучше Kandinsky 5.0 (12+) в среднем в 71% случаев по всем критериям, также уверенно обходит открытую LTX 2.5 (12+). Кроме того, в задаче оживления изображения превосходит и ведущую закрытую модель Veo 3.1 Fast (12+) — по визуальному качеству, соответствию исходному изображению и движению камеры.

Пользователи ГигаЧата теперь могут создавать видео со звуком

Пользователи ГигаЧата теперь могут создавать видео со звуком. Фото: Предоставлено банком

Реклама. Рекламодатель — ПАО "Сбербанк" (ОГРН 1027700132195. Юридический адрес: Москва, ул. Вавилова, 19).

190699
14
50