Разделы

Пользователи GigaChat смогут генерировать уникальную музыку по текстовому запросу

«Сбер» расширит возможности своего сервиса благодаря интеграции в GigaChat нейросетей CLaMP и SymFormer

Скоро GigaChat сможет генерировать музыкальные треки по произвольным текстовым запросам пользователей. Об этом рассказал вице-президент по цифровым поверхностям «Салют» Сбербанка Денис Филиппов.

Для генерации музыки человеку будет достаточно сформулировать задачу, например, «Сочини весёлую музыку в стиле кантри» или «Напиши трек для лаундж-зоны бизнес-центра». В ответ GigaChat будет выдавать аудиофайл с уникальной музыкальной композицией и нотную партитуру в формате MIDI, который понимает любая DAW (Digital Audio Workstation). Пользователь сможет прослушать и скачать получившийся трек, а MIDI-файл использовать в собственных творческих проектах (редактировать гармонии, изменять аранжировку и получать разнообразные варианты звучания трека) и даже в музыкальном продакшене.

Генерация музыки в GigaChat возможна благодаря интеграции нейросетей CLaMP и SymFormer. Для обучения SymFormer использовались платформа ML Space на базе суперкомпьютера Christofari и датасет из более 200 тыс. композиций разных стилей: от классики до современной электронной музыки и рока. Модель для генерации треков основана на принципе рассмотрения музыки в качестве нотного текста — в этом помогла адаптация подхода text-2-image к нотному домену.

Создание музыкальных треков происходит в несколько этапов:

Первый этап. С помощью модели CLaMP текстовый запрос пользователя обрабатывается и конвертируется на понятный для генератора мелодий язык.

Замглавы Минпромторга Василий Шпак в интервью CNews: Таких темпов роста нашей электронной отрасли не было никогда
импортонезависимость

Второй этап. Полученные данные, включая информацию о стиле, попадают в SymFormer, где происходит генерация нескольких вариантов мультидорожечного трека, из которых нейросеть выбирает наиболее удачные варианты по стилю и композиции.

Третий этап. На финальном этапе механизм рендеринга формирует аудиофайл и передаёт результат пользователю.

Денис Филиппов, вице-президент по цифровым поверхностям «Салют» Сбербанка, сказал: «Новые возможности GigaChat будут полезны не только музыкальным энтузиастам и представителям творческих профессий. Одним из сегментов целевой аудитории сервиса мы видим представителей среднего и малого предпринимательства. Благодаря GigaChat они смогут быстро, качественно и, что важно, абсолютно легально решать задачи бизнеса: создавать фоновое музыкальное сопровождение для кафе, салонов красоты и залов ожидания, генерировать треки для рекламных видеороликов и соцсетей».