关闭广告

清华新作ControlAudio:声音何时响、说啥话?都能按剧本可控生成

机器之心Pro248人阅读



本文第一作者是江宇轩,清华大学博士生,研究方向为生成模型、文生音频和多模态学习,指导老师为朱军教授与窦维蓓教授。

文本到音频(Text-to-Audio, TTA)生成技术近年来取得了显著进展,从早期的简单声效合成逐步发展到基于扩散模型的高保真音频生成,能够较好地还原复杂的自然语言描述,为影视配音、游戏音效及多媒体内容创作提供了重要的技术支撑。

然而,现有 TTA 技术在精细化控制方面仍面临挑战:一方面,模型难以实现对声音事件发生时间的精确控制;另一方面,生成的语音内容往往不够清晰,缺乏可理解性。

针对这一问题,清华大学研究团队提出了 ControlAudio,一种基于渐进式扩散建模的文生音频方法。该方法通过系统性的数据构建流程与渐进式建模策略,在统一框架下实现了对时间结构与语音内容的联合建模。

目前,该工作已被 ACL 2026 Main Conference 接收,并拟推荐为口头报告。

上一页 下一页
版权与免责声明:本文内容转载自其他媒体,目的在于传递更多信息,不代表本网观点或立场,不承担此类作品侵权行为的自己责任及连带责任。
猜你喜欢
精彩推荐

向太曝关之琳头婚被骗,男方摆酒钱都未结算,难怪关美人情路大胆

不八卦会死星人 浏览 517

或将于2027年发布 全新宝马X7假想图曝光

车质网 浏览 404

新能源购置税“末班车”,上还是不上?

浙江车网 浏览 482

巴媒质问:忘恩负义的阿富汗是否正成为印度代理人

澎湃新闻 浏览 540

辽宁舰在太平洋飙车,俄罗斯航母却终场哨响

浏览 706

为什么最好全款买蔚来ES8,也不要贷款分期买?套路实在太多了

大志聊车 浏览 403

帕克怒喷奥纳纳:他甚至都算不上门将,这些人到底谁找的?

直播吧 浏览 604

搭上芯片“黑马”新凯来的光伏龙头,高管集体减持,股价大跌超7%

红星资本局 浏览 1542

今年秋冬,流行“九分”穿法,时髦又显高!

LinkFashion 浏览 499

今年最火的鞋子好怪,但是她们好爱!

黎贝卡的异想世界 浏览 622

12万人挤爆,成都跨年集体狂欢

深蓝财经 浏览 2403

新年强势开局!AI需求叠加供给趋紧,存储芯片迎来集体反弹

华尔街见闻官方 浏览 323

联想 moto razr 60 系列手机获中国线上市场安卓小折叠销量第一

IT之家 浏览 482

医托"忽悠"病患去中医馆:大师退休前挂号费600 现在50

极目新闻 浏览 389

Aqara绿米推出U400智能锁:自带UWB超宽带,可实现无感解锁

IT之家 浏览 353

女子1天接五六通催收电话崩溃:欠钱的是不熟的前同事

环球网资讯 浏览 370

科氪 | 荣耀MagicOS 10重构智能体验:AI成伙伴,全品牌互联破冰

36氪 浏览 491

双后场助76人客场掀翻凯尔特人 三分投不准时绿军该咋办?

仰卧撑FTUer 浏览 234

舒默公开指责特朗普:总统无权独自将国家带向战争

看看新闻Knews 浏览 214

俄方表示结束乌克兰危机“欧洲方案”不具建设性

环球网资讯 浏览 381

中信银行开年搅局!中信金租增资至120亿,杀进头部第八位

密探财经 浏览 16868
本站所有信息收集于互联网,如本站收集信息侵权,请联系我们及时删除
闽ICP备16027347号-4