关闭广告

清华新作ControlAudio:声音何时响、说啥话?都能按剧本可控生成

机器之心Pro429人阅读



本文第一作者是江宇轩,清华大学博士生,研究方向为生成模型、文生音频和多模态学习,指导老师为朱军教授与窦维蓓教授。

文本到音频(Text-to-Audio, TTA)生成技术近年来取得了显著进展,从早期的简单声效合成逐步发展到基于扩散模型的高保真音频生成,能够较好地还原复杂的自然语言描述,为影视配音、游戏音效及多媒体内容创作提供了重要的技术支撑。

然而,现有 TTA 技术在精细化控制方面仍面临挑战:一方面,模型难以实现对声音事件发生时间的精确控制;另一方面,生成的语音内容往往不够清晰,缺乏可理解性。

针对这一问题,清华大学研究团队提出了 ControlAudio,一种基于渐进式扩散建模的文生音频方法。该方法通过系统性的数据构建流程与渐进式建模策略,在统一框架下实现了对时间结构与语音内容的联合建模。

目前,该工作已被 ACL 2026 Main Conference 接收,并拟推荐为口头报告。

上一页 下一页
版权与免责声明:本文内容转载自其他媒体,目的在于传递更多信息,不代表本网观点或立场,不承担此类作品侵权行为的自己责任及连带责任。
猜你喜欢
精彩推荐

美沙签署30年核协议 沙特获铀浓缩"路径"引核扩散担忧

澎湃新闻 浏览 219

中国车在俄份额跌破50%,新一轮洗牌开启

汽车公社 浏览 640

特朗普称美将管理委直至安全过渡

新华社 浏览 514

《用武之地》票房崩塌:这块金字招牌算砸了

靠谱电影君 浏览 569

全国第一,太空光伏寡头,野心勃勃!

飞鲸投研 浏览 1484

穆勒:我认为这场美职联决赛非常棒;再次见到梅西他们很开心

懂球帝 浏览 617

美伊26日谈判在即 是否对伊朗动武:白宫先内讧了

每日经济新闻 浏览 491

贾国龙宣战失败,西贝亏损超6亿元,到底谁的责任?

数字财经智库 浏览 1227

伊朗计划彻底封锁霍尔木兹海峡 特朗普回应

财联社 浏览 345

机主称手机莫名被停机超半个月 运营商:号码为高风险

红星新闻 浏览 708

弗林斯:很惊讶沃尔特马德的转会费,要知道他曾被不莱梅免费放走

直播吧 浏览 763

林园“金身告破”,去年亏损!坚守“嘴巴经济”面临市场考验

财通社 浏览 1444

京沪高铁:一道复杂的算术题

锦缎研究院 浏览 3997

75岁斯琴高娃近况曝光令人担忧!暴瘦

小徐讲八卦 浏览 655

东升西降?拆解全球车企三季报,中国车企业绩更稳

大李说车 浏览 604

三元锂和磷酸铁锂二合一?揭开零跑D19超混电池黑科技

吴佩频道 浏览 717

30.88万起的蔚来ES8又要成爆款!股价一夜暴涨超9%

电动邦 浏览 814

北约名存实亡!美警告欧洲,不要指望美军保护

浏览 1040

非足联官方:强烈谴责决赛期间不当行为,目前正审查相关画面

懂球帝 浏览 552

别羡慕自由职业者了

虎嗅APP 浏览 1763

两人偷渡到柬电诈园"赚钱":一天骗五六个人应该差不多

大风新闻 浏览 566
本站所有信息收集于互联网,如本站收集信息侵权,请联系我们及时删除
闽ICP备16027347号-4