Suno v5.5 Your Voice ч.4

Ваш голос с Suno v5.5 (ч.4)

Тестирование ч.4

Продолжение тестирования опции "Your Voice" (см. ч.1, ч.2 и ч.3). Собрал новые DS (теперь их более 30).

Голоса для рэпа

Это явно не мой стиль, но хотелось проверить. В итоге — 3 новых голоса (H0, H1, H2) не сразу, а после нескольких итераций:

1. h0: начитал пару текстов "в манере" в среднем регистре, нарезал, почистил, загрузил, сгенерил. Вышло слишком живо, хотя говорил монотонно, а ещё голос "смеялся" вначале и паузах, вместо нужных "Ёо, Ёо", "Еа, Еа", "Мм, Мм".

2. h0t: тот же материал, только вырезал даже минимальные намёки на усмешку и оттюнил. Стало лучше, но и autotune заметен.

3. h0Et: пришлось ещё раз пересобрать — сделал тюнинг помягче и добавил "Ёо, Ёо", "Еа, Еа", "Мм, Мм" почти перед каждой фразой. Итоговый голос H0.

4. H1: собрал ещё один, наговорив чуть повыше и напевнее. Учёл нюансы с тюнингом, добавил "Ёо, Ёо".

5. H2: наговорил пониже и немного Breathy, ну, и всё как в H0, H1.

Отдельно о тюнинге

Есть разные инструменты, но я по привычке пользуюсь Melodyne (к слову, когда-то встречался с этой командой в Германии). Есть 3 опции, дающие детальное редактирование кривой тона (Pitch Curve):

Correct Pitch: "округление" до ближайших нот (хроматический звукоряд);
Pitch Drift: размах подъездов;
Pitch Modulation: размах вибрато.

Если только Correct Pitch, то ноты встанут на ближайшие стандартные, не меняя характер извлечения.

Если Pitch Drift — будет усилено/ ослаблено движение тона: подъезды, съезды, наклон в пределах ноты — всё, что не относится к периодическим колебаниям.

Если Pitch Modulation — будет усилено/ ослаблено вибрато.

С тюнингом 2 важных момента: 1) любое сильное изменение кривой приводит к появлению металлического оттенка/ голосу робота. 2) Заметное смещение по высоте изменяет тембр: вверх будет "буратинить", вниз — станет глухим, как с зажатым носом. Но, в Melodyne спектр можно корректировать — Edit Formant.

Примеры с рэп-голосами

Собрал песню. Чтобы была моя мелодия во вступлении, темп и тональность, генерил с Audio Upload (Cover) с раздельными черновиками (MIDI/mp3) для Verse и Chorus. Style: "Rap, Hip-hop", параметры — 0,40,90%.

Фрагменты:
DS h0 — без тюнинга, со "смешками", без "Ёо, Ёо".

DS h0t — средний тюнинг, без "смешков" и без "Ёо, Ёо".

DS h0tE — лёгкий тюнинг, без "смешков" и с "Ёо, Ёо" — тот, что стал финальным H0.

DS H1 — повыше и напевнее, обработка как в H0.

DS H2 — пониже, чуть с "придыхом", обработка как в H0.

Целиком:
DS H0 для Verse и H2 для Chorus.

O2 — новый OneSong голос

Вернулся к "нормальному" голосу. Хотелось собрать голос с опорой и высокими нотами, чтобы можно было использовать в песнях, где требуется серьёзность и драматизм. Из прежних к этому были ближе OneSong и SongSet, но попытки сделать кавер, где есть высокие ноты, приводили к переключению на дефолтный.

Для сборки O2:

= спел песню "Странная девушка" (Suno v3.5), понизив на 4 полутона;
= затем часть (~20%) поднял на 3 полутона (компенсируя изменения тембра);
= также пропел отдельно низкие ноты. В итоге мой диапазон (D большой — E первой) расширился до G первой октавы;
= слегка прибрал вибрато (Pitch Modulation);
= но не округлял до стандартных нот — для Suno это неважно, а вносить доп. искажения не хотелось;
= как обычно, удалил паузы, разбил на короткие фразы/ слова и переставил их, чтобы нарушить порядок и не давать Suno явную мелодию и ритмику.
Тестируя опцию "Your Voice", я прежде всего хочу сделать свои песни, т.е. где мои и мелодия, и текст или хотя бы текст. Поэтому сначала проверил O2 на каверах 3-х песен. Две — мои реальные треки, один — генерация Suno v3.5. Пришлось сделать множество генераций. Большинство треков были "кривыми" — или много обрывов волны и щелчков, или не та манера.

Первый раз целеноправленно боролся с деградацией тембра (переходом в дефолтный) к концу трека. Песню генерил по частям: (Verse1+Chorus, Chorus+Verse2 и т.д.). При этом, делая пустой (инструментальный) такт вначале и 2,4 инструментальных такта вконце. Для этого делал Split (Voc./Instr.) и сохранял части так, чтобы вокал из предыдущей части не попадал в DS.

Такой подход также позволяет уменьшить вариативность (изменение мелодии). К слову, Verse1 и Verse2 можно сгенерить на том же DS, а если хочется развития, то немного изменить Style. Допустим, для Verse1 было "Acoustic ballad", а для Verse2 задать "Acoustic ballad, guitar inserts".
«Жена чужая» (свой трек) — из 3 треков (всего 80). // Народная песня. Правильнее было бы делать её в шансоне, но меня всегда тянуло к джазу. Кто бы мне сказал в 1997г., что через 30 лет я услышу свои импровизации, записанные в MIDI "почти в живом исполнении" (с 3:06)!

«Странная девушка» (Suno) — из 7 тр. (всего 130). // Текст 1995г.

«Только мы вдвоём» (свой трек) — из 9 (всего 35). // Моя русская версия "Just The Two Of Us" Г.Вашингтона (G. Washington) в стилистике Э.Сеймура (A. Seymour).

Чаще генерил без стиля (NoStyle) или с простыми и близкими к оригиналу. Параметры: 10,10,90 — 10,50,90.

В принципе, O2 работает, но он кажется излишне оптимистичным, наивным. Иногда появлялись смешки, хотя в DS и намёка на них не было. Чтобы от этого избавиться, добавлял в стиль "sad, regret" — слегка помогало.

Выводы

1. По DS типа O2. Если кавер, то:

= Соблюдать регистр. Ваш голос должен перекрывать (или почти) диапазон песне. Suno без проблем расширит диапазон на терцию вниз и вверх без особого искажения тембра. Но если требуется больше, вероятность подмены на дефолтный возрастает. Лучше сразу понизить/ повысить трек "под себя" — на качестве аккомпанемента это отразится не сильно, особенное если исходный трек достаточно чистый.

= Генерить частями. Это хлопотно, но даёт больше гарантии сохранения тембра, плюс исходная мелодия будет меняться не так сильно.

= Если нет большой необходимости задавать стиль, то лучше NoStyle. Опасность в том, что стиль, особенно отличающийся от исходного, может спровоцировать Suno на дополнительное изменение голоса — вдруг он требует вокальных приёмов, которых в вашем DS нет? В моей практике лучше всего работали стили, которые "тупо" перечисляли присутствующие инструменты. Например: "Piano, acoustic bass, standard drum kit", без указания "Ballad" или "Bossa-nova". При этом доверять системе в её автоопределении стиля при загрузке DS нельзя абсолютно. Suno пишет на 90% бред, как по инструментам, темпу, тональности, так и по жанру и обработке звука.
Если генерить не кавер со своим голосом, Suno выберет удобную для голоса тональность, "широту" мелодии. И хотя попыток переходить в дефолтный после 2 минут будет меньше, они останутся. Ну и заметное несоответствие Style голосовому DS, как обычно, увеличит переключения на дефолтный.

2. По DS типа H0,H1,H2. Здесь, как мне показалось, главное в: а) монотонности; б) умеренном тюнинге; с) включении характерных "Ёо, Ёо".

В моих тестах было очень много голосовых звуков, не присутствующих в Lyrics. Может стоит их прописывать изначально, чтобы система меньше добавляла от себя? Или нужно поработать с командами в Lyrics? Не знаю. Похоже, с одним голосом типа H0,H1,H2 нормальный трек (когда требуются мелодичные вставки, смена гендера) не сгенерировать.

3. Косяки "Your Voice" v5.5. Уже отмечал, что в генерациях со своим голосом много огрехов: обрывы на 40-70 мс, щелчки. Если с Audio Upload, их даже больше. Некоторые варианты, подходящие по характеру, приходилось править, но это не всегда можно выполнить безупречно — что-то заметно в примерах.

4. Универсальность голоса. На этом этапе становится очевидным, что с одним голосом все песни не сгенерить. Придётся использовать разные, может даже для одной песни. Ну, или, может, есть какой-то подход, который мне неизвестен.
Комментарий / Имя файла
© 2009-2026 A.Ustinov || Муз.ИИ: MAX, ВКонтакте, Telegram