Google 推出 Gemini 3.1 Flash TTS,強化情感表達並支援多說話人能力

Gate News 訊息,4 月 17 日——Google 於 4 月 15 日揭曉 Gemini 3.1 Flash TTS,這是一款先進的文字轉語音模型,強化了情感表達與控制功能。新模型將透過開發者 API、企業 Vertex AI,以及協作工具逐步推出。

模型的核心能力包括基於自然語言的音訊標籤,以便針對速度、語調與情感進行微調,並提供「Director Mode」用於指定場景與角色定位,以生成更細緻的語音輸出。多說話人功能可讓對話同時生成,使對話流程更自然,適用於播客、音訊內容與 AI 助理。模型支援超過 70 種語言與方言,反映不同地區的口音與表達方式,以在全球範圍提供在地化的語音體驗。

Google 強調效能與成本效率,透過 Flash 架構在盲測的人類評估基準上取得高分,同時降低運算成本——該架構旨在支援大規模的企業採用。生成的音訊包含 SynthID 水印,用於辨識由 AI 生成的內容並打擊錯誤資訊。

此舉反映語音介面競爭的加劇。OpenAI 正將即時語音功能與對話式 AI 結合,以實現類人互動;而 Meta 則擴大投資 AI 角色,並以語音為基礎的社交體驗來推動。產業觀察人士指出,儘管高水準的表演與創意工作或許仍將以人類主導為主,但重複性且規模化的製作市場,可能會在配音、廣告與有聲讀物等領域逐步導入 AI。

免責聲明:本頁面資訊可能來自第三方,不代表 Gate 的觀點或意見。頁面顯示的內容僅供參考,不構成任何財務、投資或法律建議。Gate 對資訊的準確性、完整性不作保證,對因使用本資訊而產生的任何損失不承擔責任。虛擬資產投資屬高風險行為,價格波動劇烈,您可能損失全部投資本金。請充分了解相關風險,並根據自身財務狀況和風險承受能力謹慎決策。具體內容詳見聲明

相關文章

科羅拉多州立法者提出以 AI 法替代方案,以回應產業關切

科羅拉多州立法者正推動廢止並取代該州 2024 年的人工智慧法,SB24-205,並以新規則取而代之。新規則將縮小 AI 監管範圍,同時回應產業對遵循負擔的擔憂。新的提案,SB26-189,將規範用於

Crypto Frontier1小時前

R0AR 進入 Consensus 2026 PitchFest 決賽,僅差進入前 20 名

根據 MetaversePost,R0AR 於 5 月 4 日晉級 CoinDesk「Consensus 2026 PitchFest」的最後遴選輪次,僅差一點就進入入選進行現場簡報的前 20 家新創公司。這位 Web3 和 AI 領域的創新者與全球其他高潛力新創公司一同被評估於產業的其中一個主要活動場景中。

GateNews5小時前

馬斯克在開庭前向 OpenAI 尋求 1500 億美元和解金,和解談判破裂

根據一份法院文件,Elon Musk 在 4 月 26 日聯繫了 OpenAI 總裁 Greg Brockman,時間是在他們的審判於奧克蘭聯邦法院開庭的兩天前,目的是探討和解。當 Brockman 建議雙方都撤回他們的主張時,Musk 回覆了威脅,對 Brockman 說:「到結束時

GateNews5小時前

Cursor 接受 SpaceX 的 600 億美元收購要約,但不願在代碼模型上與 xAI 合作

根據 The Information,Cursor 已接受來自 SpaceX 的一項有條件 600 億美元收購要約,儘管該交易尚未完成。該公司目前沒有計劃與 SpaceX 的 AI 部門 xAI 合作開發程式碼模型。相反地,Cursor 正在專注於對其進行優化

GateNews6小時前

Haun Ventures 於 5 月 4 日關閉 10 億美元基金,並在早期與晚期加密投資之間分配資本

根據彭博社,Haun Ventures 於 5 月 4 日完成了一輪 10 億美元的募資,當中 5 億美元用於早期投資,另 5 億美元用於後期投資。該基金將在未來兩到三年內部署資金,目標是加密貨幣與區塊鏈新創,同時擴展

GateNews6小時前

OpenAI 為部署合資企業籌集 $4 十億美元,估值 100 億美元

根據 BlockBeats,5 月 4 日,OpenAI 融資規模超過 $4 billion,以成立一家新的合資企業,專注於協助企業採用其人工智慧軟體。該合資企業名為 The Deployment Company,獲 19 位投資者支持,其中包括 TPG Inc.、Brookfield Asset Management、

GateNews7小時前
留言
0/400
暫無留言