崇州市网站建设,wordpress兼容手机吗,公司网站建设高端网站建设网页设计,博客园wordpress主题我的用词一直都挺克制的#xff0c;基本不会用到“最强”这个字眼。
但是这一次的这个AI应用#xff0c;是我认为在TTS#xff08;文字转音频#xff09;这个领域#xff0c;当之无愧的“最强”。
ElevenLabs#xff0c;简称11Labs。 仅需30秒到5分钟左右的极少的数据集…我的用词一直都挺克制的基本不会用到“最强”这个字眼。
但是这一次的这个AI应用是我认为在TTS文字转音频这个领域当之无愧的“最强”。
ElevenLabs简称11Labs。 仅需30秒到5分钟左右的极少的数据集就可以直接克隆任何一个人的声音完美复刻他的说话方式、他的音色甚至连他的情绪都复刻过来。
最牛逼的是你不需要再额外做任何操作就可以直接用同样的声音说出29国的语言。那个流畅度那个口语表达。。。我在AI面前宛如一个废物。
11Labs网址在此上不去就开魔法
https://elevenlabs.io/
尽管很多的大厂的语音TTS能力已经很强大了比如微软的TTS、比如国庆期间刷爆全网的GPT的语音TTS但是这些大厂有一个问题就是公司体量实在太大了在商业化上的舆论影响和被监管风险也极大所以这种超低成本的语音克隆TTS他们至今也没有向大众公开毕竟很容易受到全社会的伦理指责。
至于那些开源的TTS说实话效果都挺差强人意比如Tortoise奇慢无比比如bark下限和稳定性太差都难堪大用。
大厂们公开的语音产品中也没有一项能达到11Labs如此便宜且如此便捷的了。要知道像微软的声音克隆成本高的可怕数小时的数据集、几千几万块钱。而11Labs只需要30秒到5分钟的音频1个月只需要5美刀就可以畅快的使用了。效果还出奇的好。
毕竟在现在这个AI时代AI语音已经成了最为重要的环节之一。内容全球化翻译、智能配音、数字人与机器人等都有超强的应用。换句话说没有强TTS在背后支持那些视频和数字人各个都是恐怖谷效应拉满假到不行的哑巴。
而11Lbas的使用上更是突出一个简单和有手就行。
先准备30秒到5分钟的音频文件不需要超过5分钟对质量几乎没有任何意义了。你可以多个音频文件但是每个不要超过10M。这块一定要注意数据集的质量跟你后面生成的质量息息相关里面不要有任何杂音越干净、越纯粹越好。
上面那个例子我就去B站扒了点特朗普的演讲视频然后剪映剪了下准备了大概4分钟的特朗普的干声数据集切成了11段。 然后进入11Labs的主页登录后进入这个VoiceLab的页面。这个页面就可以去做声音的克隆了。那个大大的加号就是新建一个声音。 在弹窗中第二个选项就是声音克隆。 不过这个功能是付费功能正常付个费就可以用了。首月优惠1美刀基本就是白给可以直接绑定中国境内的VISA就可以支付比ChatGPT的付费方便多了。
在打开的弹窗上随便输个姓名把数据集拖进去就行。标签和描述啥的不用填。然后确认。记得一定不要开任何翻译比如google翻译啥的要不然会报错。 大概只需要二十几秒钟吧模型就OK了速度出奇的快。你就可以直接点Use去使用。 这里再推荐大家几个TTS的小技巧善用标点符号去引导情绪。
比如这句话I am Trump . my other name is Chuan Jian guo.
把my other name is Chuan Jian guo这句话变成my other name... is Chuan Jian guo后你就能明显听出小停顿的情绪
如果再把I am Trump后面加三个感叹号变成I am Trump!!!的话
这情绪一下就激动了起来。。。
11Labs对这些标点符号的引导非常到位善用标点符号能给这段文字带来完整的情绪感受。
在最后说一下目前AI声音的几种技术和场景吧。
SVC类似于变声器。将一段音频转换成另一种特定的音色音频to音频我也写过一篇教程用SVC做特定人物AI配音 - 你奶奶都会的AI声音教程 成本挺高的数十分钟的干声数据集训练几个小时起步但是对情绪和音调的还原最好适合用在剧集配音、歌声转换等场景。不过这块11Labs已经明确要进军了做语音转换不知道后面用户的使用成本会拉低到什么地步。
TTS - 声音克隆。将特定的人声训练成模型然后文字转音频。用于需要特定某个人声的场景、或同声翻译等等数字人应用的很广泛。成本低但是对于情绪的变化肯定没有SVC那么强毕竟几分钟数据集几乎为0的等待时间11Labs是典型的王者。
普通TTS。用平台已经训练好的声音做配音不可自定义在有声书和视频配音里已经被广泛应用。这块的产品就非常多了国外的微软TTS、11Labs国内的魔音工坊等等。
基本就这三种了SVC和TTS我也写过好多教程了大家可以根据自己的场景各取所需。