关闭广告

IDEA研究院发布LEMAS:首个15万小时多语言语音数据集

科技行者376人阅读


科技发展到今天,人工智能已经能够模仿人类的声音说话了。然而,如果你曾经尝试过让AI说其他语言,比如让一个英语AI说中文,你可能会发现它的口音怪异,发音不准,甚至完全听不懂在说什么。这就像是一个只会说英语的人硬要说中文,结果说得让人啼笑皆非。这背后的根本问题是什么呢?缺乏高质量的多语言语音数据。

由国际数字经济研究院(IDEA)主导的研究团队最近发表了一项突破性成果,这项研究发表于2025年1月的arXiv预印本服务器上,论文编号为arXiv:2601.04233v1。感兴趣的读者可以通过这个编号查询完整论文。研究团队构建了一个名为LEMAS的庞大语音数据集,包含超过15万小时的多语言语音数据,覆盖10种主要语言,并且每个词都有精确的时间戳标注。基于这个数据集,他们还开发了两个强大的AI模型:LEMAS-TTS和LEMAS-Edit,前者专门负责语音合成,后者专门负责语音编辑。

为了理解这项研究的重要性,我们可以把语音AI比作一位多语言播音员。传统的播音员要想掌握多种语言,需要大量的训练素材和精确的指导。同样,AI要想说好多种语言,也需要海量的高质量语音数据作为"教材"。但现有的多语言语音数据存在许多问题:要么

上一页 下一页
版权与免责声明:本文内容转载自其他媒体,目的在于传递更多信息,不代表本网观点或立场,不承担此类作品侵权行为的自己责任及连带责任。
猜你喜欢
精彩推荐

北京79-73力克浙江,陈盈骏18分,杰曼23+5,吴前7中1

懂球帝 浏览 337

新一轮伊核谈判结束 伊朗称不会屈服于美方压力

央视新闻客户端 浏览 480

大巴黎公布24/25赛季财报:营收达8.37亿欧元,创历史新高

懂球帝 浏览 459

美联储主席最热人选哈塞特:CPI报告好得令人震惊,美联储有很大空间可以降息

华尔街见闻官方 浏览 1960

张艺谋审美真牛!《玉茗茶骨》从娜扎到程潇,都不及张慧雯古典

温柔娱公子 浏览 371

别再乱跟风!鞠婧祎同款八字刘海适配大揭秘

Yuki女人故事 浏览 822

极兔速递三季度包裹量76.8亿件,同比增长23.1%

封面新闻 浏览 496

准美术生持枪闯海湖庄园被击毙:来自特朗普铁粉家庭

新民周刊 浏览 315

马筱梅回应孩子正脸照,是朋友偷拍曝光,网友乱说话小玥儿都无语

萌神木木 浏览 650

汽车之家官宣冬季测试真要来了:杜绝充值 喊话陈震愿意来吗

快科技 浏览 456

锋寻生物完成近6000万元种子轮及天使轮融资,加速体内CAR-T疗法临床转化 | 融资首发

钛媒体APP 浏览 415

拼多多1000亿豪赌新拼姆,跨境电商变天?

Tech星球 浏览 166

他们是“追逐声音的人”

上游新闻 浏览 516

马卡:卡瓦哈尔对现状不满,在替补席上也无队长应有的领导力

懂球帝 浏览 246

李开复,在成都投了一家“0卡糖”

投中网 浏览 917

无止境,梅西常规赛28场贡献29球16助攻

懂球帝 浏览 430

新一代宝马X5内饰曝光,明年发布!现款50万可入手,哪类人群在买

蜗牛车志V 浏览 591

视频:美公布在委内瑞拉附近扣押油轮行动画面

央视新闻客户端 浏览 364

把所有人都骗了!《生万物》最大聪明人:不是宁学祥,不是绣绣

娱乐圈笔娱君 浏览 601

媒体:莫迪访华前先访日还避开九三阅兵 "小心思"需注意

澎湃新闻 浏览 678

哈斯勒姆:科比不想和任何人做朋友 扶起对手不是曼巴精神

直播吧 浏览 616
本站所有信息收集于互联网,如本站收集信息侵权,请联系我们及时删除
闽ICP备16027347号-4