关闭广告

清华新作ControlAudio:声音何时响、说啥话?都能按剧本可控生成

机器之心Pro487人阅读



本文第一作者是江宇轩,清华大学博士生,研究方向为生成模型、文生音频和多模态学习,指导老师为朱军教授与窦维蓓教授。

文本到音频(Text-to-Audio, TTA)生成技术近年来取得了显著进展,从早期的简单声效合成逐步发展到基于扩散模型的高保真音频生成,能够较好地还原复杂的自然语言描述,为影视配音、游戏音效及多媒体内容创作提供了重要的技术支撑。

然而,现有 TTA 技术在精细化控制方面仍面临挑战:一方面,模型难以实现对声音事件发生时间的精确控制;另一方面,生成的语音内容往往不够清晰,缺乏可理解性。

针对这一问题,清华大学研究团队提出了 ControlAudio,一种基于渐进式扩散建模的文生音频方法。该方法通过系统性的数据构建流程与渐进式建模策略,在统一框架下实现了对时间结构与语音内容的联合建模。

目前,该工作已被 ACL 2026 Main Conference 接收,并拟推荐为口头报告。

上一页 下一页
版权与免责声明:本文内容转载自其他媒体,目的在于传递更多信息,不代表本网观点或立场,不承担此类作品侵权行为的自己责任及连带责任。
猜你喜欢
精彩推荐

男子称被盗后驱车追击致小偷轻伤 对方起诉他索赔21万

潇湘晨报 浏览 411

谷歌发布 Gemini 3.8 Flash;淘宝App突发大面积故障;我国主导的腿式机器人国际标准正式发布

果壳 浏览 102

京东造车!刘强东有新玩法?

百姓评车 浏览 704

纪念戴安基顿,伍迪艾伦最高杰作告别放映❤️

幕味儿 浏览 642

智元推出多场景“六边形战士”精灵G2,首发前已获数亿元订单

文汇报 浏览 693

"花坛白骨案"告破:女老板遭谋杀 凶手"换脸"逃亡28年

封面新闻 浏览 662

港股上市未满3个月,干了7年的期货公司董秘突然辞任

财通社 浏览 4218

约6000人被埋加沙废墟下 哈马斯:不会离开自己的土地

红星新闻 浏览 714

莱巴带伤轰16ACE击败张帅,新赛季目标再夺大满贯,小商取开门红

网球之家 浏览 605

2026年必追的四部谍战剧 陈道明、于和伟领衔主演

娱乐圈笔娱君 浏览 604

会打扮的中年女人,穿衣都有这4个共同点,难怪优雅又气质

静儿时尚达人 浏览 949

美沙签署30年核协议 沙特获铀浓缩"路径"引核扩散担忧

澎湃新闻 浏览 272

周杰的负面标签到底哪些是真的?

说历史的老牢 浏览 716

公安机关对"野人孩子"父母展开调查 孩子目前安全

中国新闻周刊 浏览 725

俄罗斯:西方派往乌克兰的士兵都是"合法打击目标"

看看新闻Knews 浏览 615

郭德纲相声春晚访谈,透露最新计划

杨仔述 浏览 707

追平《主角》,对塑料古偶应激了!满屏磨皮的痛,此刻尽数爆发

娱乐圈笔娱君 浏览 381

闻泰与安世新一轮交锋来了 创始人:遭荷兰政府背叛

澎湃新闻 浏览 600

周星驰悼梁小龙,翻起港圈大佬们的恨海情天

仙女事件簿 浏览 578

夕阳很美,莎莎更美,下一站继续加油

包饺子ai剪辑 浏览 789

一等功臣爷爷送孙子到国防科大报到

极目新闻 浏览 807
本站所有信息收集于互联网,如本站收集信息侵权,请联系我们及时删除
闽ICP备16027347号-4