关闭广告

清华新作ControlAudio:声音何时响、说啥话?都能按剧本可控生成

机器之心Pro246人阅读



本文第一作者是江宇轩,清华大学博士生,研究方向为生成模型、文生音频和多模态学习,指导老师为朱军教授与窦维蓓教授。

文本到音频(Text-to-Audio, TTA)生成技术近年来取得了显著进展,从早期的简单声效合成逐步发展到基于扩散模型的高保真音频生成,能够较好地还原复杂的自然语言描述,为影视配音、游戏音效及多媒体内容创作提供了重要的技术支撑。

然而,现有 TTA 技术在精细化控制方面仍面临挑战:一方面,模型难以实现对声音事件发生时间的精确控制;另一方面,生成的语音内容往往不够清晰,缺乏可理解性。

针对这一问题,清华大学研究团队提出了 ControlAudio,一种基于渐进式扩散建模的文生音频方法。该方法通过系统性的数据构建流程与渐进式建模策略,在统一框架下实现了对时间结构与语音内容的联合建模。

目前,该工作已被 ACL 2026 Main Conference 接收,并拟推荐为口头报告。

上一页 下一页
版权与免责声明:本文内容转载自其他媒体,目的在于传递更多信息,不代表本网观点或立场,不承担此类作品侵权行为的自己责任及连带责任。
猜你喜欢
精彩推荐

2026款海狮06EV开启交付 成为全国首批上市闪充纯电车型

太平洋汽车 浏览 284

日本呼吁各国不要参加中国九三阅兵活动 外交部回应

澎湃新闻 浏览 629

生育津贴直接发放至个人 这些地方已实现

央视财经 浏览 1451

理想汽车调整销服体系!总部直管,李想:9月i8挑战月销过万

车东西 浏览 621

英伟达入股英特尔

北京商报 浏览 591

阶段性企稳?飞天茅台价格普涨,经销商称“过节需求出货量大”

澎湃新闻 浏览 4431

高市连退两步 石破茂:中日关系决定日本是否存在

时时有聊 浏览 423

消息称一加性能新机搭骁龙 8 系旗舰芯 + 超高刷屏、有很酷的联名

IT之家 浏览 471

某厂子系8E5迭代机曝光,预计为小米REDMI K100系列

IT之家 浏览 151

美军击沉伊朗军舰致104人死亡 现场视频公布

CCTV国际时讯 浏览 248

900V架构打造 莲花ForMe将于3月29日上市

车质网 浏览 283

冬天想穿得轻盈保暖,看看这些大衣穿搭,大方舒适又有高级感

静儿时尚达人 浏览 446

初三男生杀害女同学前检索会担什么责 出庭时变胖变白

红星新闻 浏览 493

车长5米3 华为乾崑奕境首款旗舰大六座SUV定名X9

网易汽车 浏览 237

现场直击|神舟21号升空前6小时,带你沉浸式追火箭!

上观新闻 浏览 447

法国小众跑车的短暂荣光:Hommell Berlinette

老爷车 浏览 492

俄罗斯将对多艘核潜艇进行改造

国际在线 浏览 596

塞尔记者:维尼修斯迎来绝佳机会,皇马希望主场球迷不要嘘他

懂球帝 浏览 386

黄金有关税收新政落地首周,市场各方反应如何?

中国商报 浏览 1721

未婚未育男子将遗产留给外甥遗嘱却写错名字 法院判了

环球网 浏览 481

月产能等同于过去一年、海外销售拉升毛利率 泡泡玛特狂奔

北京商报 浏览 567
本站所有信息收集于互联网,如本站收集信息侵权,请联系我们及时删除
闽ICP备16027347号-4