ByteDance запускає Seed Audio 1.0 — генерує діалоги та звукові ефекти за одним запитом

Згідно з Beating, Seed Audio 1.0 від ByteDance було запущено 22 липня. Вона дає змогу генерувати діалоги, звукові ефекти та фонове аудіо одним запитом із точністю синхронізації 100 мс. Модель підтримує введення тексту й аудіо-прикладів, може генерувати приблизно дві хвилини аудіо за одну генерацію з розширеними можливостями та зберігає стабільні голоси персонажів у різних виводах.

Аудіо демонструє понад 90% придатності в більшості сценаріїв, а Mean Opinion Score (MOS) перевищує 4 у більшості підтримуваних мов. Seed Audio 1.0 підтримує 20+ мов із міжмовним перенесенням голосу та налаштуванням тону. Наразі модель доступна через Volcano Ark Experience Center, а інтеграцію API відкрито.

Застереження: інформація на цій сторінці може походити зі сторонніх джерел і надається виключно для ознайомлення. Вона не відображає позицію чи думку Gate і не є фінансовою, інвестиційною чи юридичною консультацією. Торгівля віртуальними активами пов’язана з високим ризиком. Будь ласка, не покладайтеся лише на інформацію з цієї сторінки під час прийняття рішень. Детальніше дивіться у Застереженні.
Прокоментувати
0/400
Немає коментарів