豆包 Seed Audio 1.0 é lançado: gera voz humana + trilha musical + efeitos sonoros ambientais em uma etapa

A equipe do DOU Bao, subsidiária da ByteDance, anunciou oficialmente nesta semana o modelo de geração de áudio Seed Audio 1.0, também chamado de modelo de geração de áudio do DOU Bao 1.0, e lançou simultaneamente no centro de experiência da Volcano Ark (火山方舟) a opção de testes para criadores. A plataforma também abriu convites para testes da API no lado corporativo.

No passado, ao criar uma faixa de narração, a voz humana, a trilha musical e os efeitos sonoros geralmente eram gravados separadamente, com cronogramas separados, para então, no fim, serem montados manualmente em um software de edição. Desta vez, o DOU Bao quer fazer algo diferente: gerar todo o cenário sonoro em uma única inferência, sem que o usuário precise atuar como “cabo de ligação” no meio do processo.

Usuários individuais podem começar diretamente no centro de experiência da Volcano Ark; desenvolvedores internacionais acessam via BytePlus. O modelo também já foi integrado ao próprio app do DOU Bao.

Do roteiro ao cenário

O Seed Audio 1.0 não é um TTS tradicional. TTS é texto para voz: em termos simples, é “ler” um trecho de texto. Já o Seed Audio 1.0 trata voz humana, música de fundo, efeitos sonoros e sons ambiente como elementos do mesmo cenário de áudio, mapeando tudo para uma representação acústica unificada.

Em outras palavras, o modelo não separa “quem está falando” e “qual é o som de fundo”; ele trata o cenário inteiro como um só objeto para gerar junto.

Ele suporta referência multimodal de zero-shot. Em termos simples, sem precisar fazer novo treinamento, você fornece um trecho de texto ou um pedaço de áudio como exemplo, e o modelo consegue imitar o timbre e o estilo daquele som. Com um único prompt, dá para organizar múltiplos diálogos de personagens, música de fundo e efeitos de dublagem — efeitos sonoros no jargão da área de locução. Mesmo que o áudio gerado seja estendido para quase 2 minutos, os timbres de vários personagens não “desafinariam” no meio do caminho.

A precisão no controle da linha do tempo chega a 100 milissegundos: quando os personagens começam a falar e quando os efeitos entram, tudo pode ser ajustado com bastante exatidão. O suporte a idiomas passa de 20 línguas: chinês, inglês e japonês estão entre elas. O timbre e o estilo também podem ser ajustados separadamente, sem precisar trocar completamente o som só porque você vai mudar a forma de falar.

Essas capacidades correspondem à criação de áudio em nível de cinema e TV, cobrindo etapas como narração, trilha musical, dublagem sonora (擬音) e mixagem, e também se estendem a audiolivros, radionovelas, podcasts, vídeos curtos, jogos e mídias interativas. Em outras palavras, tarefas que antes exigiam uma equipe inteira de pós-produção são reunidas em um único modelo.

Por que “desmontar” o som para encará-lo de novo

A lógica por trás da geração de voz tradicional costuma dividir a tarefa em várias frentes: síntese de fala em uma linha, trilha musical em outra, efeitos sonoros em outra. Cada uma é treinada e exportada separadamente, e o usuário depois junta tudo manualmente na mesma linha do tempo para alinhar.

A lógica do Seed Audio 1.0 é o inverso: primeiro coloca todos os elementos sonoros no mesmo espaço de representação e então gera tudo de uma vez. A vantagem disso é que o timbre entre personagens e a música e os efeitos dentro do cenário já nascem sincronizados, sem necessidade de calibração posterior.

Três passos da ElevenLabs, um passo do DOU Bao

Comparando com o Studio da ElevenLabs, fica ainda mais claro. O método da ElevenLabs separa três APIs independentes: voz, música e efeitos sonoros. Cada uma gera por conta própria, e o usuário precisa montar e alinhar na linha do tempo; o DOU Bao pretende substituir esses passos todos por uma única inferência.

Em termos de preço, o ElevenLabs Pro custa US$ 99 por mês. Já o DOU Bao, usando a cobrança por tokens do motor Volcano (火山), calcula o custo pelo uso — e, em cenários com chinês, o custo tende a ser bem menor.

Narração, trilha musical e efeitos eram, no passado, três ocupações, três conjuntos de softwares e três exportações. O Seed Audio 1.0 quer demonstrar que esses processos podem ser compactados em uma única inferência.

Quanto a substituir de verdade as divisões profissionais em cenários como dublagem para cinema e TV, audiolivros e podcasts, é algo que só os criadores saberão dizer depois que usarem.

Ver original
Esta página pode conter conteúdo de terceiros, que é fornecido apenas para fins informativos (não para representações/garantias) e não deve ser considerada como um endosso de suas opiniões pela Gate nem como aconselhamento financeiro ou profissional. Consulte a Isenção de responsabilidade para obter detalhes.
  • Recompensa
  • Comentário
  • Repostar
  • Compartilhar
Comentário
Adicionar um comentário
Adicionar um comentário
Sem comentários
  • Fixado